Claude Opus 4.5、白宫Genesis与Amazon的500亿美元AI押注
摘要
Genesis Mission将美国基础科学重新定义为国家级AI基础设施,把能源部超级计算机、联邦数据集与实验室工具整合起来,将数年研究压缩至数天。 Alexander Wissner-Gross称这是一个“1939时刻”,美国将成为“一座大型AI工厂”;Peter Diamandis重点提到生物科技、聚变与量子领域,项目目标是在10年内将美国科学生产率翻倍。上行空间取决于资金与执行是否到位。Wissner-Gross强调,开放科学可能让影响“真正呈指数级增长”,而在强IP保护下进行的封闭式公私合作,影响力会低得多。
Claude Opus 4.5被描述为递归自我改进的潜在临界点,而不只是又一次基准测试发布。 核心数据包括:在结果相当的情况下减少76% token、在8种编程语言中的7种取得领先,以及在关键任务上超过即将入职Anthropic性能团队员工的AI表现——这正是Wissner-Gross眼中的“金丝雀”。Mostaque称,Opus 4.5在不使用推理token的情况下取得52%的SWE-bench Pro成绩,高于其Intelligent Internet框架的45%;成本则降至25美元/百万token,降幅67%,并有望在明年一次性完成典型的100,000–200,000-token代码库。
随着评估从解题分数转向赚取的美元,具备能力的智能成本正在下降。 据称,Opus在同模型多智能体设置下得分75%,负责调度Haiku或Sonnet时升至88%;Wissner-Gross则用一句话概括趋势:“我们正在把智能成本推向零。”Mostaque预计,Vending Bench和交易测试等基准接下来会衡量真实经济产出;如果未来2年内、甚至“很可能明年”,单个创业者还无法建立一家10亿美元公司,他会感到意外。Wissner-Gross则认为,一个靠拉升山寨币赚钱的“婴儿AGI”现在差不多就能做到。
AI原生公司可能把劳动力与资本模式彻底反转,让几乎所有运营投入都变成可变成本。 Mostaque给出的机制非常具体:企业可以先向客户收费,1或2个月后再向AI供应商付款,同时把合规、预测、税务和支付全部自动化,从而有望在约1年内让一家完整公司“几分钟内”上线。Salim Ismail将其与接近零的获客成本和供应成本联系起来;Wissner-Gross则认为,智能体“既不是资本,也不是劳动力”,人类可能转而投资由AI创业者组成的舰队。
算力交易正从Nvidia短缺扩展为一个涵盖Google TPU、AWS Trainium、内存、电力与互连的异构市场。 Google第7代Ironwood TPU据称比上一代快4倍;Mostaque强调Google的芯片互连能力、100万至200万token上下文,以及DRAM价格上涨约5倍的环境。与此同时,Amazon计划投入最多500亿美元建设美国政府AI基础设施,并从2026年起新增1.3 GW容量;其耗资110亿美元、拥有2.2 GW电力的印第安纳州设施,运行着500,000颗主要适合推理的Trainium2芯片。
购物智能体将用户意图的控制权,变成下一场分发权争夺。 ChatGPT购物研究使用ChatGPT Mini,据称准确率最高可达64%;但Mostaque指出,Amazon Rufus据称已有2.5亿用户,转化率最高提升60%,明年可能带来100亿美元增量销售。最终胜出的可能是用户身边安全且有魅力的“Jarvis”:它观察请求、对话,最终甚至观察视线,再把任务分发给专业智能体,同时绕过搜索、联盟媒体和推荐引擎。
与会者认为,严重的劳动力冲击会先于丰裕经济到来,使协调与经济增长成为政策上的约束条件。 Mostaque预计,最多900天内,大多数通过键盘和鼠标完成的工作都会变成“负价值”,但他明确没有预测所有工作都会消失;他还提到Grok 4.1 Fast在TaoBench上取得约95%的成绩,成本为0.50美元/百万词,并预测2年内将不再有客服岗位。可行的过渡方案包括全民AI、AI社会科学家、UBI、全民基本服务和全民基本股权;但Wissner-Gross认为,前提是经济增长速度必须快于传统人类劳动力失去价值的速度。
脑机接口与不断下降的发射成本,仍是本期节目中上行空间最大的实体世界押注。 据称,Paradromics可达到每秒200 bit,而Neuralink约为10 bit,并已获准在约2个月后开始人体测试;曾经对高带宽BCI持“坚决反对”态度的Ismail承认:“该死,他又说对了。”Diamandis则梳理了发射成本曲线:航天飞机约50,000美元/kg,Falcon 9降至2,500美元/kg,Starship预计降至100美元/kg,月球质量投射器甚至可能降至0.10美元/kg;这类成本曲线将把可用土地与材料供应扩展到远超地球的范围。
精读
1. Genesis将美国科学变成一个算力系统
Diamandis将这项行政命令定义为一个统一平台,把能源部超级计算机、实验室数据和此前彼此隔离的联邦数据集连接起来。其目标回报是把生物科技、聚变和量子研究中的AI驱动实验从数年压缩至数天;如果资金充足、执行到位,他认为这可能成为美国加速人类知识增长的最强引擎。
Wissner-Gross刻意使用了军事类比:“这是曼哈顿计划。”1939年,曼哈顿计划把美国变成生产核武器的一座工厂;Genesis则会把美国变成“一座大型AI工厂”,同时提供算力和模型所需的“限制性反应物”——数据集、软件工具与科学基础设施。
Mostaque认为能源部牵头并非巧合,因为能源本身就是约束条件。更多放松管制、聚变与太阳能发展,可能进一步强化算力计划;只要解决一个重大能源或科学问题,就可能产生巨大后果,前提仍是Genesis得到正确执行。
Ismail称,这项计划既是追赶——中国和法国多年来一直在使用主权数据集——也是政府发挥作用的典型案例。他从国防部学到的一条经验是,风险资本会在指数曲线的拐点附近等待,而政府负责为“任意漫长的平坦部分”提供资金;Genesis可能把这个拐点提前。
Wissner-Gross表示,成败还取决于开放程度:曼哈顿计划式的封闭项目可能限制外溢效应,而开放科学将产生“真正指数级”的影响。拥有强IP保护、同时包含大量私营部门工作的公私合作,影响力会低得多。
2. Opus 4.5是递归改进的金丝雀
这次发布伴随着异常具体的性能宣称:结果相当时减少76% token、在8种编程语言中的7种取得领先,以及多智能体支持提升15%。Wissner-Gross最看重的是,据称该模型在关键任务上超过了即将加入Anthropic性能团队的员工。
他对递归自我改进的定义是可操作的:前沿实验室开始把比人类研究人员更多的算力和基础设施分配给AI研究员,使模型能够更好地研究并编写自身的后代模型。他说:“我们正在接近,甚至可能已经到达这一节点”,但也提醒Opus的预训练截止时间早了数月。
Mostaque的对比进一步强化了这一判断。Intelligent Internet使用多个模型,在Scale AI的SWE-bench Pro上取得45%;据称Opus 4.5在不使用推理token的情况下达到52%。这让他感到意外,因为近期的性能提升通常依赖模型延长思考、检查工作并消耗更多推理算力。
据称,Opus单独进行同智能体多智能体测试时得分75%,与更便宜的Haiku或Sonnet搭配后升至88%。Mostaque称,这是第一个能够“可证明地”监督其他智能体的AI,打开了群体智能体模式;Wissner-Gross还补充说,他的一次性Mario式横版游戏测试也运行得非常出色。
3. 基准测试正从解题转向美元
ARC-AGI 1和2测试视觉模式识别与程序合成,题目对人类直观、但历史上一直让模型困难。Wissner-Gross提到Opus的成本效率,以及一家名为Poetic的公司宣布在ARC-AGI 2上达到超人水平的结果,认为这表明此类基准开始饱和。
其经济后果不止于视觉谜题:实体世界自动化需要识别模式、操控环境并合成隐含流程。Wissner-Gross总结称:“世界需要更难的基准”,因为过去区分人类与AI的能力正在被攻克。
Mostaque预计,下一条评估轴线将是字面意义上的美元——Vending Bench、交易结果,以及其他衡量持续经济工作的测试。模型正在从只能被人“拍肩膀”来完成孤立任务的“非常聪明的人”,转向能够经营企业并赚钱的智能体。
4. AI智能体把公司变成可变成本组合
对于单人建立10亿美元公司的时间,Mostaque的估计是“最多1或2年”;Wissner-Gross认为现在差不多可以做到,尽管可能首先是通过AI拉升一枚山寨币。Ismail提到,一位熟人已经在1个月内创办了47家AI初创公司:生产引擎已经存在,但单个项目仍需找到产品市场匹配。
Wissner-Gross拒绝沿用资本与劳动力的传统二分法,因为智能体可能是“新的第3类”。他提出的替代方案不是让所有人都成为创业者,而是让所有人成为投资者,持有由AI智能体组成的舰队、指数,甚至完整经济体。
Mostaque解释了公司栈为何会改变:招聘、服务器、合规、预测、税务和支付对账都会变成按需服务。由于客户可以预先付款,而企业AI账单在之后结算,新公司可以同时拥有可变成本结构和正现金流;他预计完整的上线栈约1年内就绪。
Ismail将此与企业两端的零边际成本联系起来。互联网压低了需求获取成本;Airbnb式模式压低了供应成本;AWS则把计算从资产负债表中移除。当两项约束都被消除,“市值就会爆炸”,这就是组织形态的“圣杯”。
5. 购物智能体让分发与信任成为瓶颈
Diamandis认为,ChatGPT购物研究正在攻击搜索引擎、联盟博客、YouTube评测者和Amazon推荐系统。据称,该系统使用ChatGPT Mini,在选择符合用户需求的产品时,准确率最高可达64%。
Wissner-Gross认为,这代表着对单一通用模型的更广泛否定。除了通用模型,OpenAI还推出了Deep Research、Codex,如今又推出购物专业模型;金融、医疗和咨询领域可能紧随其后。通过路由机制,这些模型的扩张仍可被隐藏在“一块玻璃面板”之后。
Ismail追问,一个私有、主权化的Jarvis何时会替用户选择智能体并采取行动。Wissner-Gross回答:“现在。”他指出,计算机操控智能体已经部署或进入测试阶段;抬头显示器和可穿戴设备是下一层交互界面,但不是底层能力实现的前提。
Mostaque认为,分发可能压倒原始模型质量。他回忆Amazon CEO Andy Jassy曾表示,Rufus拥有2.5亿用户,转化率据称最高提升60%,明年可能带来100亿美元销售额。日常购买可能被自动化吞没;非必需消费则可能归属于最值得信任、最有魅力且始终陪伴用户的智能体。
6. Google让加速算力进入多供应商市场
Google第7代Ironwood TPU据称拥有上一代4倍的性能;TPU正越来越多地以云容量形式提供,也可能进入客户自有数据中心。Meta据称使用TPU,说明无需客户购买硬件,也能与Nvidia展开直接竞争。
Wissner-Gross欢迎所谓Nvidia/CUDA垄断逐渐松动。Google TPU、AMD加速器、Amazon Trainium和专用ASIC,正在把加速算力变成一个“多供应商、非常健康、非常异构的生态”,而非单一厂商造成的瓶颈。
Mostaque强调Google在芯片互连方面的优势:此前每个单元为64颗,如今他认为大约达到9,000颗;此前运行中还曾连接50,000颗低能耗芯片。他表示,当前一代的算力约为v5s的10倍,Google还能够跨数据中心连接系统。
随着DRAM价格上涨约5倍,他强调的核心区别是RAM与FLOPs。Google架构支持Gemini处理涵盖视频、音频和文本的100万至200万token输入;当原始模型速度已经足够时,Mostaque预计上下文容量将成为更重要的性能差异化因素。
7. Amazon正用推理容量铺满农田
Amazon计划投入最多500亿美元建设美国政府AI基础设施,并新增1.3 GW容量,项目将于2026年开始施工。Wissner-Gross称,政府云长期严重缺GPU,尽管公共部门按不同口径计算约占经济总量的四分之一至一半。
Diamandis提到,AWS服务11,000家政府机构,并预计到2025年底资本开支将达到1,250亿美元。Ismail问,AWS是否实际上已经成为联邦政府的云;Wissner-Gross则回应称,政府会使用多家供应商,但AWS显然是其中的关键供应商。
位于印第安纳州乡村的Project Rainier,把工业故事压缩进一个地点:1,200英亩土地、7栋建筑在约1年内建成、投入110亿美元、配置2.2 GW电力和500,000颗Trainium2芯片。Wissner-Gross称:“我们正在用算力铺满地球”,将改造后的中西部农田比作1939年的工厂动员。
Mostaque认为,Trainium2相当于Hopper,运行Claude推理表现扎实,但在高要求训练任务上约落后1代。训练需要具备韧性的互连,并在大量设备间执行反向传播;推理主要是前向矩阵乘法,因此更容易通过OpenXLA等框架迁移。
8. 发射成本下降扩大稀缺性的边界
Diamandis的发射成本阶梯从航天飞机开始:最初规划为每次5,000万美元、每年50次发射,但最终每次成本约10亿至20亿美元,每年只能发射1至4次,约50,000美元/kg。Falcon 9通过第1级回收,将成本降至约2,500美元/kg。
他预计下一步还会下降25倍,完全可复用的Starship将成本降至100美元/kg;随后,利用电磁加速和太阳能发电的月球质量投射器,成本可能达到约0.10美元/kg。Ismail强调,这是在“一个非常物理的环境”中发生的对数级成本崩塌,发射将越来越像软件。
分歧在于目的地与资源使用方式。Diamandis更偏好地月系统、由小行星建造的O’Neill圆柱体,并希望避免再进入另一个行星的重力井;Wissner-Gross则兴致勃勃地支持“拆解太阳系”,同时承认小行星带可以充当“训练轮”。
Mostaque从地球内部反驳土地稀缺论:地球有160亿英亩宜居土地,约合每人2英亩;随着客运无人机以及廉价能源、供暖和制冷打开困难地形,这一数字可能增至200亿至220亿英亩。他预计人口将在2050年前后达到约100亿峰值;Ismail补充引用Tesla robotaxi约0.30美元/英里预测,认为这可能彻底扩大实际通勤地理范围。
9. BCI带宽上升,但神经科学仍未被理解
Paradromics已经完成绵羊测试,并获准在约2个月后、即1月或2月左右开始人体测试。其宣称的200 bit/s是Neuralink约10 bit/s的20倍;曾在2030年代初对高带宽BCI持“坚决反对”态度的Ismail承认,这一进展改变了他的看法。
Mostaque预计,BCI将在未来3年成为最大的投资领域之一,因为它既能治疗残障,也能增强人类能力。Ismail提到Neuralink联合创始人Max Hodak及其使用神经干细胞的公司Science Go,以及Sam Altman投资的Merge Labs,认为这些都说明相关架构正在快速扩散。
Wissner-Gross的推测曲线认为,到2045年,1 gigaflop算力可以压缩到人类脑细胞大小。他另预计,完整的高分辨率人类连接组可能在5年内完成,同时承认当前破坏性切片方法极具侵入性,而且连接组只是上传的一个代理指标。
Mostaque认为,有用的神经解码可能无需纳米技术即可实现:Stability的Mind’s Eye已经从低带宽MRI信号中重建被试看到的图像,扩散模型则可以根据部分信号推断丰富的脑部过程。Wissner-Gross认为,Drexler式分子装配器最迟将在2045年前出现,但更温和的DNA折纸或AI设计版本,10年内出现也有可能。
10. 丰裕转型本质上是协调问题
Mostaque谨慎重申了自己的预测:最多900天内,大多数通过键盘或鼠标完成的人类经济工作都会变成“负价值”。他没有说所有工作都会消失。Wissner-Gross则回应,如果AGI意味着通用性,那么最迟在2020年夏天GPT-3及《Language Models are Few-Shot Learners》论文发布时,AGI就已经存在;至于经济意义上的通用AI,要么已经到来,要么即将到来,取决于采用何种基准。
更尖锐的劳动力预警来自Grok 4.1 Fast。Mostaque称,它在TaoBench上取得约95%的成绩,成本为0.50美元/百万词。他预测:“2年内不会有客服岗位。”他补充说,采用需要时间,但方向是单向的。
Mostaque提出的应对方案,将Sage项目等自上而下的AI社会科学家,与全民个人AI结合起来,让贫困人口和其他“隐形人口”能够被食品、医疗和福利系统识别。政府应与AI协调、直接分发AI,并研究1933年新政等历史响应。
Ismail认为,在从稀缺制度转向丰裕制度的艰难10年过渡期内,需要UBI或全民基本服务;Wissner-Gross则增加了全民基本股权。他提出的治理检验标准是宏观经济层面的:总产出增长必须快于传统劳动力被淘汰的速度,因为“只要我们拥有丰裕,分配丰裕相对容易”。
11. 他们对2035年的展望,建立在最难的曲线持续复利之上
Ismail设想,感恩节晚餐成本降至现在的十分之一,同时根据每个人的新陈代谢定制,并由超低成本的食物与能源生产。Wissner-Gross希望看到一些人类在火星或云端庆祝节日,也许身边还有被提升的动物;Mostaque认为,10年是AGI预测中“最悲观的终点”,前提是人类能够顺利完成过渡。
Wissner-Gross认为,2025年最具定义性的标志是,数学“正被AI可信且确定地解决”,这将成为科学、工程和医学重大挑战的金丝雀。Diamandis则选择人形机器人,以及正在流入制造业的资本,作为自己的“Data或C-3PO”正在接近的证据。
Mostaque庆幸,AI社会科学家及其所需的协调基础设施如今看起来已经可以建造;而且“除了硬光之外”,全息甲板所需的工具都已存在。Diamandis最后谈到长寿逃逸速度,引用超大规模云厂商的兴趣,以及Dario所表达的目标:在5至10年内将人类寿命翻倍。