为 AI 智能体构建云基础设施 | AWS CEO Matt Garman
摘要
AWS押注AI需求足够持久,足以支撑其2026年2200亿美元的资本开支,且预计不会放缓。 Matt Garman认为,AWS客户基础足够分散,单一客户占比最高也只是个位数百分比;已有生产环境工作负载持续产生正回报。“不存在一种泡沫情形,会让他们停止在这上面的投入。”
AWS正在整个生态中分配稀缺的加速器,而不是把芯片全部卖给前沿实验室。 尽管AWS可以把所有可用芯片卖给几家大型实验室,但它会为初创公司保留产能,并最终以某种形式满足收到请求的约60%;有时是在其他区域或采用不同配置。AWS计划在未来几年采购200万块 NVIDIA GPU,但Garman也承认:“谁知道这够不够?”
智能体工作负载正推动云架构转向高速、可能随时弃用且权限严格限定的资源,并与长期运行的系统并存。 智能体关注p99.9延迟、3秒创建数据库、计算沙箱、网关和限时权限,而不是直接继承某个人的访问权限。Garman的核心判断是明确的:“智能体工作流在AWS上的表现往往好于其他任何地方。”
AWS正在消除传统的上手摩擦,但不会把初创公司锁死在简化版终点上。 新流程铺开后,用户可以用Gmail开户、无需信用卡,并在30秒内开始使用,VPC和IAM默认配置则在后台处理。关键在于,这仍然是“一个真正的AWS账户”,客户之后可以逐步启用完整的安全和组织控制,无需迁移。
AWS的定制芯片路径从Nitro、Graviton延伸至Trainium。 Graviton的成本低20%、性能高20%,AWS前100大客户中约90%多在使用;Trainium 3的产能可能已经售罄至明年年底,而Trainium 4已经宣布但尚未发布。Garman称,按绝对性能和成本表现计算,Trainium可能是“目前市场上最好的推理芯片”。
企业采用智能体的瓶颈,与其说是模型访问,不如说是工作流重构、评估体系和信任。 Garman反对简单复制人类的五步流程:智能体可以并行尝试50种方法,但企业在赋予自主权前,需要权限体系、护栏、标注数据、生产环境度量和漂移测试。AWS的前置部署模式旨在用45天教会客户这些能力,然后退出,而不是制造持续数年的咨询依赖。
AWS围绕企业数据托管来定位Bedrock,同时保留专有模型和开放权重模型两条路径。 Garman表示,提示词和数据都留在客户的VPC内,永远不会回到模型提供商手中;拥有真正专有数据的客户可以对开放权重模型进行后训练或微调,甚至蒸馏,以更低成本获得更好表现。前提是必须建立评估体系,证明这种优势,而不是想当然。
在Amazon内部,智能体已经压缩软件、产品和业务流程,并开始重塑团队设计。 Garman称,采用智能体优先模式的“frontier teams”由员工管理能够写出全部代码的智能体;HR和财务员工也在为规划、税务和合规工作构建自己的智能体。过去需要10人完成的能力,如今可能只需3或4人,由此产生了新的问题:在小团队快速转向其他项目时,谁来持续维护已经上线的产品。
精读
1. AWS仍认为自己处于早期阶段
Raghu Raghuram先给出规模参照:AWS从赚到第一美元收入,发展到如今约1690亿-1700亿美元的规模,目前增速为37%。但Garman仍称,这只是“业务可能达到的规模的早期阶段”,因为大量工作负载仍在本地运行,而AI正在扩大每天完成的总算力。
Garman在AWS的第一份工作,是2005年商学院实习期间分析谁最看重这项拟议中的服务。答案是初创公司;它们后来成为“我们核心业务的命脉”,因为AWS的价值主张对初创公司尤其有吸引力,也帮助它们搭建能够逐步扩展的架构。
这种关系已经形成商业复利:AWS估计,目前30%-40%的收入来自AWS存续期间曾经处于初创阶段的公司。那家只有2人的公司,其价值不仅在于未来可能成为大型企业客户,也在于它可能提前发出能力需求信号——5年后,银行、医疗企业和政府可能就会需要同样的能力。
初创公司的基准线已经彻底改变。过去,一家公司可能融资1000万美元来反复迭代一款应用;如今Garman看到的团队,可能从第一天起就有2亿美元融资和10亿美元估值,相应的目标、模型训练成本和基础设施扩张规模也都更大。
2. 智能体暴露出新的云性能边界
一些初创公司的需求并没有改变:创始人仍然需要可扩展架构、安全性、性能以及能够支撑公司从3名员工继续增长的IAM。Garman称,正是这层完整能力,让许多公司最终更偏好AWS而非新型云厂商,即便它们眼下的直接需求只是GPU。
改变的是使用者。AWS如今不仅为人操作的云设计,也为智能体操作的云设计,重点包括大规模API访问、快速创建资源和可预测的性能。Garman举了一个具体例子:“如何在3秒内启动一个数据库?”
AgentCore和Bedrock是明确面向智能体构建的服务;处于预览或测试阶段的“AWS Context”,则旨在为S3、Aurora及其他AWS存储中的数据建立统一的上下文层。智能体可以穿越这些彼此分离的数据资产,而人通常做不到。
智能体还会放大尾部延迟。人可能根本察觉不到S3的p99.9性能,但智能体工作流可能因此被阻塞;延迟、吞吐量和底层引擎的响应速度,因而从抽象的基础设施指标变成了编排约束。
3. AWS简化上手路径,但没有移除控制能力
Raghuram提出的反问是:如今编程智能体会自行选择数据库、邮件系统和部署目标,可能让运行了10年的服务显得“过时”。Garman回应称,核心构件仍然稳健;真正的缺口,是让没有现成云账户的人,或某个智能体,能够更容易地开始使用云。
在典型的成熟工作流中,客户告诉Kiro、Claude或Codex在AWS上构建,提供凭证和部署指令,之后由智能体处理其余工作。但如果一个尚未上云的实验只说一句“部署”,它可能会选择上层体验更简单的合作方;Garman称,AWS欢迎这种结果,但也希望直接解决这个问题。
AWS正在逐步推出新的开户流程:用户可以用Gmail注册、无需信用卡,也不必手动定义VPC或IAM角色。默认配置由后台处理,账户可在30秒内投入使用。
Garman最强调的设计选择是连续性:这不是一个之后必须迁移的玩具账户。当客户需要组织、定制VPC或细粒度IAM时,“你已经处在一个真正的AWS账户里”,可以逐步开放这些控制能力。
4. 可弃用的智能体基础设施需要生产级退路
智能体经常创建一个数据库、完成一项小任务,然后将其丢弃,由此产生一个真实的设计问题:这个数据库是否需要5个9级别的持久性?AWS传统的Aurora定位,是把数据库视为需要持久性和可用性的生产资产;对一次性智能体任务而言,这可能属于“过度设计”。
Garman不愿意用一个随意降低持久性的选项来解决,因为AWS并不总能知道临时资源最终会不会变成永久资源。因此,工程目标是打造双用途基础设施:创建速度足够快、资源足够轻,可以随时丢弃;同时又能够在不更换系统的情况下扩展成持久化生产数据库。
一些智能体需求是真正新增的基础构件,而不是旧系统的新用法,包括计算沙箱、网关,以及区别于人类或服务角色权限的权限体系。“你不能只是把Raghu的权限给它”;智能体可能只需要完成一项任务所需的狭窄、限时权限,甚至不应访问某个工具的全部能力。
Firecracker微型虚拟机提供了现成底座。它大约在10年前开发,如今已被许多沙箱初创公司采用;其启动速度快、传统虚拟机开销低,同时保有强安全边界,非常适合执行智能体任务。
5. 稀缺性使GPU分配成为战略组合决策
Raghuram直接点出矛盾:前沿实验室可以“吞掉所有可用GPU”,而规模较小的公司没有相当的信用和融资能力,却可能成为明日的企业客户。Garman承认,AWS完全可以把所有加速器分配给少数实验室,但公司有意为初创企业、企业客户和更广泛的生态保留供给。
扩建规模极其庞大:Garman称,AWS计划在2026年投入2200亿美元资本开支,并预计不会放缓,因为需求依然“巨大”。电力、数据中心、资本、内存、芯片,甚至建设这些设施所需的施工劳动力,都可能轮流成为约束。
AWS称,最终收到的请求中,约60%会以某种形式得到肯定答复,但交付可能要延后,也可能安排在其他区域,或采用不同配置。每家初创公司仍然想要更多;AWS宣布将在未来几年采购200万块 NVIDIA GPU,但这个数字本身也可能不够。
Garman将AWS与另一类供应商区分开来:后者最大的1到2个客户可能占到30%-60%的产能。AWS的单一客户集中度最高也只是个位数百分比,而大部分使用量来自与应用绑定的核心算力、存储和推理;他询问的几乎每一家企业都表示,当前AI能力已经带来正回报。
6. 限制因素持续向供应链下游移动
当被问及2027-2028年的瓶颈时,Garman引用了《目标》中的一句话:“从来不会只有一个约束,永远只是最新的约束。”电力缓解后,限制因素可能转向内存、TSMC产能、HBM、网络设备、连接器、硬盘或SSD。
地理位置会进一步放大问题,因为产能并非完全可互换:印度尼西亚有充足电力,并不能解决德国的短缺。AWS跟踪的零部件达到数万乃至数十万种,并沿供应链向上追溯4到5层,寻找任何可能阻断部署的部件。
规划周期已经从向公用事业公司申请再增加几兆瓦,扩展到为太阳能、核能和其他电力项目提供融资;有时这些项目位于表后,有时则向电网供电。电力和输电决策如今延伸至20年,服务器、内存和芯片需求的规划则横跨2026年、2027年和2028年。
数据中心引发的反对也带来沟通挑战。Garman称,AWS需要更清楚地说明可再生能源、用水和就业方面的收益。他举例称,某个县的居民据报道每年少缴5000美元税款,原因就是AWS带来的税收;但这一看不见的收益此前没有被告知居民。
7. Nitro带领AWS从虚拟化卸载走向定制AI芯片
AWS的芯片路径始于“虚拟化税”。公司最初将网络虚拟化迁移到一块卸载卡上,随后与一个小团队合作,由其搭载Arm核心的卡片吸收存储虚拟化和其他功能;收购该团队后,AWS最终借助Nitro通过API提供接近裸机的资源。
收益不仅体现在利用率和性能上,也体现在隔离能力上:Garman称,AWS可以有底气告诉客户,自己无法访问客户正在运行的虚拟机。由于这套架构并不是其他人可以直接购买的通用组件,他认为AWS因此获得了长达10年的领先优势。
将这些Arm核心做成服务器后,AWS最初得到的是性能不足的Graviton;随着Arm性能提升,Graviton随后成为“势不可挡的爆款”。Garman称,过去5到6年里,Graviton一直保持成本低约20%、性能高约20%;AWS前100大客户中约90%多在使用,一些客户迁移整个服务器集群后,服务器数量减少了一半。
AWS在5到6年前启动Trainium项目,如今已经开始交付Trainium 3,产能可能已经排到明年年底。Bedrock的大部分流量运行在Trainium上,此外还有Anthropic和OpenAI的合作,以及大约6到12家在其上构建产品的较小型初创公司。
8. 企业自主性取决于重构、评估和数据信任
如今大多数企业智能体仍然相对简单、缺乏自主性,但客户已经报告了实际价值。Garman的第一条建议,是停止复刻“Bob完成第1、2、3、4、5步”;智能体可以并行化处理、尝试50种方法,以不同于人类工作流的方式解决目标问题。
第二个障碍,是企业对自主性的担忧有充分理由。企业需要护栏、沙箱、数据权限,以及明确哪些环节必须保留人在回路中;当智能体可能删除生产数据库时,“放手去做”不能算一条可接受的指令。
Raghuram列出了评估体系的要求:标注数据、持续测试循环、目标达成标准、生产环境度量、回测和漂移检测。Garman称,企业目前并不知道如何解决这些问题。他怀疑真正擅长解决这些问题的人并不存在,因此AWS才推动前置部署工程服务,目标是在45天内教会客户这项能力,然后让客户能够自行运转。
在模型选择上,Garman认同企业数据是“它们最有价值的资产”。Bedrock保证数据留在客户的VPC内,模型提供商永远看不到提示词;这是AWS优先建设的底层原则,即便3年前批评者还认为AWS推进得太慢。
9. 开放模型与机器速度安全扩大AWS的服务边界
拥有重要专有数据的客户,可以对开放权重模型进行后训练或微调,再进行蒸馏,最终有可能以更低成本获得更好的性能。Garman始终保留条件:客户需要拥有合适的数据和专业能力,并通过评估证明定制模型确实更优。
Raghuram称,这让SageMaker“重新获得了生命力”;Garman则表示,SageMaker一直就是模型构建平台,如今非常适合企业构建定制模型。他希望AWS逐步简化开放权重模型之间的比较、调优和测试。
在生存风险争论、安全漏洞和Hugging Face遭攻击的背景下,CEO们最关心的问题仍然很实际:如何信任运行在自身环境中的智能体?AWS给出的答案包括权限、沙箱、护栏、明确允许的行为,以及在适当场景下保留人工审核。
Garman将Continuum描述为一套把强大模型用于防御的系统:它扫描环境中的漏洞,再结合权限和补偿性控制措施等上下文,对漏洞进行优先级排序。他希望最终实现“机器速度的安全防护”,替代警报发出后等待人工调查的工作流。
10. Amazon自身的智能体采用开始重塑团队
Amazon正在安全和软件开发领域使用AI,Amazon Q也已经向每一名员工推出。Garman称,HR员工把原本需要数周的团队规划工作压缩到数小时完成,财务团队则使用智能体收集税务规则并确保合规。
最大的提升来自软件和产品开发。AWS的“frontier teams”采用智能体优先模式,而不是把AI当作代码补全工具:智能体负责编写代码,员工则管理智能体团队,由此带来Garman所说的客户能力发布“涡轮增压”。
组织设计仍未解决。Garman预计,在很长一段时间内,人仍然不可或缺,但一项过去需要10名员工负责的产品能力,如今可能只需要3或4人;而且它可能建得足够快,以至于这些人应该转去解决另一个问题。
AWS正在试验pod和更灵活的人员配置,同时面对维护问题:小团队构建的产品,必须有人继续运营。Garman目前没有提出万能的组织结构,只是观察到员工喜欢更快地构建、完成更多工作,而且“那里确实有真正的工作”。