在拉斯维加斯举行的 2025 re:Invent 大会期间,我们有幸采访到 AWS EC2 负责人 Luis Wang。
作为亚马逊云科技核心计算服务的掌舵人,Luis 长期主导 EC2——这一自 2006 年推出以来便奠定 AWS 公有云基石地位的服务。EC2 不仅为全球数百万客户提供弹性、安全、可扩展的虚拟计算能力,更在过去近二十年中持续演进,支撑了从传统企业应用到大规模 AI 训练与推理的多样化工作负载。
本次对话正值生成式 AI 进入规模化落地的关键阶段。面对模型激增、算力需求波动剧烈、多模态兴起等新挑战,Luis 分享了 AWS 如何通过底层架构创新应对未来计算范式的转变。他首次系统介绍了 Bedrock 背后全新推理引擎「Mantle」:一个统一资源池、支持秒级模型加载、覆盖全球所有区域的智能调度平台。这不仅解决了传统模型部署中资源浪费与容量瓶颈的难题,更体现了 AWS 对「推理即未来计算」的战略判断。
尤为值得深思的是,Luis 反复强调:在 AI 时代,可靠性与安全性仍是基础设施的底线,而非附加项;而真正的客户价值,不在于堆砌模型数量,而在于提供从底层硬件到高阶应用的全栈选择权,并通过工具链(如即将推出的模型迁移助手)降低技术迭代带来的迁移成本。
这些观点揭示了一个成熟云厂商在 AI 狂潮中的定力与远见——不是追逐热点,而是构建可持续、可信赖、可演进的智能基础设施。
以下为采访全文,由极客公园编辑整理。
问:您之前长期负责 EC2,现在转到 Bedrock,这是否说明 AWS 正在推动计算、存储和 AI 的深度融合?
Luis Wang:这个问题问得特别好。其实今年初我们做了一次比较大的组织调整,把我从 EC2 调过来负责 Bedrock 相关的工作。背后的核心逻辑很简单:我们相信,推理就是未来计算的主流形态。既然如此,我们就得重新思考整个推理平台该怎么设计。
过去半年,我们专门组建了一个新团队,从零打造了一个叫 Mantle 的推理引擎——它现在是 Bedrock 的底层基础设施。这个引擎从今年 8 月开始正式运行,最初支持的是开源 GPT 模型,之后很快扩展到了 Qwen、DeepSeek、Doubao、MiniMax、Kimi、昆仑这些中国厂商的模型。我们也在持续跟更多本地模型供应商沟通,希望把他们的模型也接入进来。
问:Mantle 这个平台到底带来了哪些实质性的改变?
Luis Wang:最直接的感受就是快——我们现在能以非常快的速度上线新模型。比如今天一次性就发布了 18 个来自不同厂商的模型,这在 AWS 历史上是规模最大的一次模型发布。
另外,客户经常提到数据要留在本地、要满足合规要求。有了 Mantle,我们就能把所有这些模型部署到 AWS 全球任何一个区域,不用再一个个单独适配。
但我觉得最有意思的是它的资源调度方式。以前每个模型都得单独预留一批 GPU,结果热门模型一上来就卡住,冷门模型却长期空跑,浪费严重。现在 Mantle 用的是一个统一的资源池,模型可以按需动态加载和卸载。这样一来,哪怕某个模型突然爆火,也不会影响其他用户的使用体验——客户再也不用担心「我是不是会被限流」这种问题了。
问:那像 EC2、S3 这些传统服务,未来会不会和 Bedrock 合并成一个统一的服务?
Luis Wang:不会。AWS 一直坚持一个理念:提供灵活的基础构建块,而不是替客户做选择。EC2 就是计算,S3 就是存储,它们各自保持独立。但我们会在上面搭更高层的服务,让开发变得更简单。Bedrock 就是个典型例子——它底层其实大量用了 EC2 和其他 AWS 服务,但对用户来说,你只需要调个 API 就行。
我们的 AI 战略其实是分层的。最底层是硬件和数据中心;往上是 SageMaker 和 Bedrock 这样的平台服务,分别管训练和推理;再往上是一些面向具体场景的产品,比如写代码的 CodeWhisperer、做客服的 Amazon Connect、搞智能体的 Agent Core 等等。客户可以根据自己的技术能力和业务需求,自由选择用哪一层。甚至还有我们的专业服务团队和生成式 AI 创新中心,手把手帮客户落地项目。
问:从实际负载来看,生成式 AI 的增长趋势怎么样?哪些方向跑得最快?
Luis Wang:整体增速还在加快。我跟很多客户聊下来,发现两个特别明显的趋势。
一个是越来越多人开始用开源模型,尤其是中国这边的一些模型,在特定任务上效果非常好,而且成本低得多。如果再稍微做点微调,有时候效果几乎能媲美顶级闭源模型。所以我们这周四就要上线一个新功能,叫「强化微调」,完全 Serverless,你不用管 GPU、不用预配资源,按调用量付费就行。
另一个是多模态正在起飞。图像、视频、语音生成的质量已经高到能让广告公司、影视工作室真正用起来了。我们刚发布了 Nova Omni 和 Sonic(语音到语音模型),也在评估百川、智谱这些厂商的多模态能力。我敢说,2026 年会是多模态大规模商用的元年。
问:AI 工作负载对 EC2 这类传统产品提出了哪些新挑战?
Luis Wang:挑战主要在两方面。首先是网络——训练和推理都非常吃带宽,所以我们得不断升级实例间的互联能力。比如 Trainium Trn3 就专门做了超高速网络架构,就是为了支撑大规模分布式训练。
但更重要的是可靠性。说实话,最近我见了十几家客户,他们反复提到一点:之所以从其他云迁到 AWS,就是因为「稳」。大型 AI 工作负载一旦上线就是生产级的,不能出岔子。所以在 AWS,每年做未来 18 个月的规划时,我们永远把安全性和服务可用性放在第一位——没有这两样,再多的新功能也没意义。
问:AI 应用的算力需求波动特别大,AWS 怎么应对这种弹性需求?跟传统 EC2 有什么不同?
Luis Wang:差别很大。EC2 是你开一台机器就占着它,而推理是纯 Serverless 的——请求可能一秒内涌进来几百万,你怎么保证不崩、不卡、不挤掉别人的请求?
我们做了几件事。首先,调度器会优先保障那些稳定、可预测的常规流量,避免某个突发大客户把整个池子占满。其次,我们在 API 里加了「服务等级」选项:你可以标成「优先级」,我们会给你最低延迟,但价格稍高;也可以选「灵活」,接受几秒甚至几分钟的延迟,但能打折。最后,如果你有确定性的高吞吐需求,比如每分钟要处理 1 亿个 token,也可以提前预订容量,我们保证给你留出来——就像 EC2 的预留实例一样。
问:听起来调度逻辑挺复杂的,客户需要自己操心这些吗?
Luis Wang:完全不用。客户只要正常发请求就行,想快就打个「priority」标签,想省钱就选「flexible」。所有的资源调度、排队、扩缩容都是后台自动完成的。我们还会通过 CloudWatch 提供详细的指标,比如用了多少 token、延迟多少,一目了然。真有要求的,提前买个预留容量就万事大吉。
问:那像 EC2 和 ECS(容器服务)之间,客户该怎么选?AI 负载更适合哪个?
Luis Wang:这其实取决于你想管多少底层细节。有些客户喜欢 EC2,因为完全掌控操作系统、网络、扩缩容策略;另一些客户觉得太麻烦,更愿意用 ECS 或 EKS,把基础设施交给 AWS 管。
AI 领域也一样。如果你是 ML 工程师,要精细调参、自定义部署,SageMaker 更合适;但如果你只是个应用开发者,就想调个模型拿结果,那 Bedrock 就够了。我们不会硬推某一种方案,而是根据客户的实际工作流和目标来建议。
问:旧的模型会不会突然下线?迁移成本是不是很高?
Luis Wang:我们对模型生命周期是有承诺的:至少提供一年使用期,下线前会提前六个月通知。不过有了 Mantle 之后,这个规则可能会变——因为不再需要为每个模型单独留机器了,很多模型完全可以长期保留,甚至像 EC2 里十年前的系统镜像那样,只要还能跑就继续用。
我们也知道,迁移模型很痛苦,要重写 prompt、重新测试。所以我们在悄悄做一个叫「模型迁移助手」的工具(目前还在预览)。你告诉它「我想从 A 模型换到 B 模型」,它就会自动分析你过去的调用日志,帮你优化新的 prompt 模板,还会跑大量评估确保效果不降。目标就是让迁移变得像升级软件一样简单。预计未来两三个月就会公开。
问:既然模型厂商自己也提供 API,客户为什么还要通过 AWS 使用?性价比真的更高吗?
Luis Wang:很多客户跟我们说:「我就想在一个平台里搞定所有事。」他们在 AWS 上已经有数据库、有应用、有安全策略,再引入一个新的供应商,光采购流程就能拖几个月。所以他们宁愿等我们把某个模型接进来。
另外,不同厂商的 API 差别很大,自己封装抽象层很费劲。Bedrock 给你一个统一接口,换模型就像换插件一样简单。
至于性能,第三方评测显示,我们在 Claude 系列上的端到端延迟是行业领先的。对于开源模型,因为我们能直接拿到模型权重,再加上 Mantle 引擎做了深度优化,通常比厂商自己托管的版本更快、更稳。
问:对于 AI 初创公司,AWS 有没有特别的支持?
Luis Wang:当然有。我们有专门的初创企业加速计划,不仅给免费额度,还配技术专家和 go-to-market 支持。我们很清楚,今天这些在车库或办公室里折腾模型的年轻人,很可能就是明天的行业巨头。帮他们在 AWS 上成功,对我们来说既是责任,也是机会。