2026年10月6日 · 星期二

返回

六名 AWS 工程师如何重建 Bedrock,挑战微软

Bedrock 早期像胶水拼装,容量被内部称为 disaster。六名工程师用 Kiro 做 Mantle,把等待从三周压到两天;Jassy 称它是 Bedrock 的骨干。

来源:The Information · How Six AWS Engineers Rebuilt Bedrock to Challenge Microsoft
作者:Catherine Perloff、Kevin McLaughlin(2026-09-08)

Dave Brown 在 AWS re:Invent 2025 介绍 Project Mantle

本文为对上述报道的中文编译,力求忠实于原文事实、结构与引述。

2025 年初,亚马逊云部门内部气氛紧张。用于运行人工智能模型的新服务 Bedrock 故障频发。据了解客户问题的人士称,客户反复收到错误信息,有时还要等上数周才能拿到所需算力。

问题激增之际,资深工程负责人 Anthony Liguori 带队提出了一套翻新方案——名为 Project Mantle——旨在修复限流与报错,并让服务能扩容服务更多用户。两名直接知情人士说,Liguori 与另外五名高级工程师一起,用 AWS 内部人工智能编码工具 Kiro 做出了 Mantle。

Mantle 于去年 12 月上线。几个月后,AWS 把 OpenAI 模型加入 Bedrock 的模型阵列——其中还包括 Anthropic 的 Claude 等。生意开始火起来。

咨询公司 Caylent 首席技术官 Randall Hunt 说,AWS 现在正从微软 Azure 那里抽走一部分支出;Caylent 为企业如何使用 AWS 提供顾问。尽管 AWS 在云市场份额和收入上都大于 Azure,微软云此前能独家提供 OpenAI 模型,这曾给它相对其他云厂商的优势。

Hunt 说,客户「能从 Bedrock 拿到稳定、可靠的性能,而在 Azure 上,性能多少有点靠猜」。他说,其金融服务客户自 5 月以来在 AWS 上的支出增长了五倍。他认为 AWS 的人工智能服务比微软等对手表现更好。

亚马逊 7 月表示,2026 年上半年加入 Bedrock 的新客户,超过该服务头两年之和;客户第二季度在 Bedrock 上的支出,超过此前所有季度之和。亚马逊不单独披露 Bedrock 收入,但报告称 AWS 增速在第二季度加快 9 个百分点,至 37%。微软 Azure 增长 42%,比上一季度快 2 个百分点。

微软在声明中说:「随着人工智能采用扩大,工作负载从模型开发转向大规模推理和基于 Agent 的应用,微软持续推进其人工智能技术栈,以支持客户需求变化和不断增长的人工智能需求。」

Bedrock 早期的挣扎表明,人工智能巨大的算力需求,连市场份额第一的云厂商 AWS 也被难住了。

AWS 发言人在声明中说:「为跟上 Bedrock 激增的需求,我们从零重建了推理引擎,并以性能和安全为考量。我们的做法显然引起了客户共鸣。Bedrock 是 AWS 史上增长最快的十亿美元级服务,被数十万客户使用。」

技术挑战 ​

AWS 于 2023 年秋季推出 Bedrock,距 ChatGPT 在 2022 年底问世、拉开人工智能竞赛,将近一年。亚马逊此前已提供 SageMaker 等人工智能工具。但 ChatGPT 的走红让公司措手不及。据一名参与者称,AWS 工程师每周工作 60 小时,搭建一项让客户把云应用接到大语言模型上的服务。

AWS 需要一项新服务,部分原因是客户无法在现有系统上运行领先的人工智能模型。与其他软件不同,这些模型使用人工智能公司严密守护的专有权重,不会允许客户接触。

但仓促工程做出的 Bedrock,后来参与其中的两名人士说,有时感觉像「胶水拼装」。其中一人以及另一名参与者称,这种设计没有吃满手头的人工智能芯片容量,导致客户收到错误信息,也拖累了 AWS 为更多用户扩容 Bedrock 的努力。

AWS 发言人说:「我们不断调整服务、追求完美,但也知道以我们的规模运营,偶尔会暴露预料之外的挑战;我们会识别它们,向客户沟通,并尽快解决。」

与此同时,容量对客户也越来越成问题。每名用户有一份基础容量,用量一旦上去,就会被限制,直到 AWS 解锁更多算力。一名前员工说,对部分客户,等待时间最长可达三周。

据一名参与该产品的人士称,2025 年全年不断有客户抱怨,亚马逊限制了他们对 Anthropic 模型的访问。The Information 此前报道,AWS 领导人一度担心,人工智能编码初创公司 Lovable 会因在 Bedrock 上使用 Anthropic 受挫而离开。

据直接了解该备忘录的人士称,2025 年初,一份在 AWS 销售团队内部流传的内部报告说,Bedrock 的技术挑战正在削弱拉拢客户的努力。The Information 去年报道,大约同一时期,高层把 Bedrock 的容量问题称为「灾难」(disaster)。

Hunt 说,他的客户发现,以每秒 token 衡量,2024 年 Anthropic 在 Bedrock 上最多比直连 Anthropic 慢 63%。企业直连人工智能公司时,通过应用程序编程接口接到模型,尽管模型仍托管在云服务器上。Anthropic 除 AWS 外还用谷歌云,通过 API 提供直连。

Bedrock 的问题甚至激怒了亚马逊其他事业部的高管。据两名听到相关言论的人士称,时任电商事业部高级副总裁 Dave Treadwell 在 2025 年初告诉 AWS 领导人,Bedrock 上持续的错误信息和容量问题,让他想改用直接从 ChatGPT 公司运行的 OpenAI 模型。直接从 OpenAI 运行的 OpenAI 模型,大多经由微软 Azure 云。

一名接近亚马逊的人士否认现已在 AWS 的 Treadwell 说过这话。

Mantle 的修复 ​

随后便是 Liguori 提出做一版新 Bedrock。去年 12 月 AWS 年度客户大会 re:Invent 上,时任云服务器业务负责人 Dave Brown 介绍了 Mantle——一层用于运行 Bedrock 的新技术——并解释说,它旨在让 AWS 扩容 Bedrock,以满足预期的未来需求。

Brown 在主题演讲中说:「随着模型演进、用量增长,很清楚推理需要不同的架构。」(Brown 最近离开 AWS,加入 Meta Platforms。)

Brown 也指出了 Bedrock 初始设计的短板:它是按处理标准网络服务请求的原则搭起来的。

但运行人工智能模型来驱动应用——这一过程称为推理——比运行客户存取数据、做分析或其他应用的旧云服务更复杂。推理需要在需求不断波动时,找到足够的服务器来扛住负载。这一点在 2025 年尤为明显,当时客户正把人工智能用于更复杂的任务。

Brown 在 re:Invent 上说:「推理的工作方式,不同于我们过去二十年一直在优化的传统计算模式。」

Mantle 的设计,是为了容纳复杂人工智能用户「尖峰」(spiky)的负载——突然占用大量算力、随后又几乎不用——而较旧的人工智能只允许更简单的任务,标准架构就能应付。

一名发言人说,新人工智能 Agent 持续时间更长的任务,也需要另一套分配容量的系统。

为在规模上解决尖峰问题,Mantle 引入了一项新功能:客户可给 Bedrock 上的不同任务指定不同优先级,以便 AWS 把更多容量投给客户更在意的任务。发言人说,Mantle 也努力隔离客户负载的影响,使某一客户特别重的负载只影响其自身容量、而不影响另一客户——类似于音乐会場有多个入口。

AWS 还让 Mantle 与一项现有 AWS 服务 Journal 更兼容。Journal 会沿途保存 Agent 的进度,这样客户在长流程中途出问题,不必从头再来。这帮助 Mantle 容纳人们现在用人工智能做的更长任务。

曾帮助创建 Mantle 的前 AWS 副总裁 Joe Magerramov 今年 1 月在一档 AWS 播客上说:「有了 Mantle,我们意识到推理的核心不太像网络服务,更像一套调度系统。」(Magerramov 上个月跟随 Brown 去了 Meta。)

直接兼容 ​

Mantle 也被做成与 OpenAI 和 Anthropic 的 API 直接兼容。这与第一版 Bedrock 不同:那时客户要写定制代码才能用这些实验室的 API。

到 2026 年初,Mantle 已在运行。一名前员工说,客户拿到更多容量的时间,从当年早些时候的三周,降到了 2025 年末的两天。亚马逊首席执行官安迪·贾西(Andy Jassy)在 2026 年致投资者信中,把 Mantle 称为「我们非常成功的 Bedrock 服务的骨干」。

公司还说,2025 年晚些时候,Bedrock 开始主要跑在亚马逊自研、专用于人工智能的 Trainium 芯片上。在英伟达芯片供应持续受限之际,这给 AWS 带来了新的算力来源。

当然,客户使用该服务时仍会遇到延迟。一家通过 Mantle 在 Bedrock 上访问 Anthropic Claude 模型的 AWS 客户经理说,过去几个月公司经历了间歇性中断,最长一次大约持续 11 小时。

人工智能咨询公司 Loka 的机器学习负责人 Bojan Jakimovski 说,该公司约半打客户已改到在 Bedrock 上跑 OpenAI 模型,而不是直接从 OpenAI 或在 Azure 上跑。

Jakimovski 说:「迁移有一些好处,比如推理更快、净吞吐更多。成本一样——一切都一样。」


中文编译,仅供学习交流。文中事实、引述与数字以 The Information 原文 为准;权利归原作者及原出版方。