先锋 趋势 方法 投研 作者
紧急更新——AI 的 Sputnik 时刻:Kimi K3 发布,与 Emad Mostaque 对谈|第272集
返回节目精读

紧急更新——AI 的 Sputnik 时刻:Kimi K3 发布,与 Emad Mostaque 对谈|第272集

摘要

  • Kimi K3 让中国开放权重模型直接站上能力前沿,挑战了“只有美国闭源实验室及其资本基础才能保持能力领先”的前提。 Moonshot AI 这款拥有2.8万亿参数的多模态模型跃升17个排行榜名次,在前端编程及另外6个领域排名第一,并成为 Artificial Analysis 成本性能前沿上的第三个点,排在 Claude 5 和 GPT-5.6 Solve Max 之后。模型权重预计在7月27日左右发布,Alexander Wissner-Gross 称这一进展“对竞争大有裨益”。

  • 圆桌最关键的技术结论是,K3“没有魔法”:可识别的 Transformer 架构、更好的数据、持续不断的工程优化和高效执行就足够了。 Emad Mostaque 将这一过程比作中国电动车制造,并指出 Moonshot 仍在使用 H800,同时围绕 Huawei 和 Alibaba 芯片进行设计。Peter Diamandis 给出了更强、也更具推测性的解读:GPT-2 速跑项目实现99%的成本下降,意味着在数十亿美元西方数据中心中训练的模型,现在可能出现“1%成本版本”。

  • K3 正在威胁基础模型估值,但嘉宾对于实际有多少收入会被转移存在明显分歧。 Salim Ismail 估计,监管加上开放权重替代,可能抹去一家万亿美元实验室75%的价值,因为“前沿智能如今是一种完全易腐资产”,保质期以周计算。Blundin 和 Wissner-Gross 则反驳称,除非 K3 不是接近,而是达到2倍、3倍或10倍的优势,否则企业仍会为最好的模型、可靠性、支持、安全性和前沿性能支付高价。

  • 美国芯片管制可能加速了如今正在给美国实验室施压的效率创新,而中国正明确将开源视为地缘政治基础设施。 圆桌认为,受限算力迫使行业改进量化、数据混合、内核和硬件感知架构;随后,美国推理服务商可能在更新的 Nvidia 和 AMD 硬件上以低10倍的成本运行 K3。Mostaque 对中国立场的总结非常明确:“我们将全面支持开源,把它作为全人类的公共产品。”

  • 对企业而言,持久护城河正从模型本身上移至模型切换架构、专有数据、验证和工作流整合。 Ismail 认为,采购周期跟不上模型发布速度,因此价值将归于能够持续替换模型的接口。实践建议是,在内部评估 Kimi K3 和 Inkling,利用专有数据微调,并把生成代码当作人类代码处理:隔离运行、测试、扫描,同时保留责任归属,而不是追问哪个模型值得盲目信任。

  • 量化可能比模型基准测试所显示的速度更快地,让今天的前沿能力变得本地化、持久化且成本大幅下降。 节目引用的 Bonsai 27B 结果显示,一款手机级模型可压缩至6 GB,准确率损失为5%;压缩至4 GB时,损失为15%;从16位转向三值权重则带来据称5倍的加速;Samsung 的 NanoQuant 据称已降至每个权重低于1个有效比特。Mostaque 预计,到明年年底,K3 级别的能力将运行在16 GB内存中;Blundin 则预计未来3年原始算力提升100倍至10,000倍,叠加算法收益后,潜在提升可达100万倍。

  • 当 AI 预测能力达到与人类超级预测者统计相当的水平,市场、保险、管理和个人决策都可能被重塑;但当机构惩罚人们忽视预测时,预测也会变成反身性的。 Wissner-Gross 构想了与资本市场连接的“超级预测”,能够在人类采取下一步行动之前,先预测人类会采取什么行动;Diamandis 认为,大量高级管理层的专业能力届时将“基本蒸发”。Mostaque 提供了警告:保费和责任机制可能惩罚任何忽视 Dr. AI 的人,因此核心问题不再是建议是否准确,而是由“谁的恩典”来控制它。

  • 基础设施机会不是收缩,而是扩张:更便宜的模型将增加硅片需求,推动边缘智能、机器人以及最终的轨道算力。 圆桌认为,即便闭源模型毛利率承压,半导体和推理服务商仍将受益;同时,嘉宾警告称,号称能以4倍于 Mike Tyson 力度出拳的70公斤人形机器人,在进入家庭前需要安全规则。Sam Altman 和 Elon Musk 关于轨道数据中心的立场听起来针锋相对,但 Mostaque 认为双方在数字判断上分歧不大:有限部署到本世纪末可能占算力的几个百分点,经济性拐点则会更晚到来。

精读

1. Kimi K3 将开放权重带到前沿

  • Peter Diamandis 将 K3 定义为一个“AI 的 Sputnik 时刻”:拥有2.8万亿参数,相比前代 Kimi 跃升17个名次,在前端编程领域排名第一,并在品牌与营销、基于参考图的设计、数据分析、消费品、模拟和内容创作等领域同样排名第一。

  • 预计7月27日左右发布完整权重,是这场竞争的战略支点。如果如期交付,企业就可以下载模型并在本地运行,无需再通过美国服务商的 API 传输专有数据、知识产权或“专有 alpha”。

  • Wissner-Gross 对“震撼叙事”补充了一个重要修正:Moonshot 表示,过去12个月中的9个月里,Kimi 都保持着开放权重模型的最先进水平。K3 的跃升很戏剧性,但“过去一年基本上一直都是 Kimi”。

2. 一套可识别的 Transformer 就够了

  • Wissner-Gross 对架构的判断非常直接:“里面没有魔法。”K3 仍然明显属于 Transformer 体系,采用了熟悉的混合专家改进,以及 Moonshot 版本的线性化注意力,而不是某种此前未见的后 Transformer 突破。

  • 这让它在任务—成本前沿上逼近 GPT-5.5 Max 的表现更具冲击力。如果一套公开且容易理解的架构能做到这个距离,Wissner-Gross 追问道:“美国前沿实验室究竟把钱花在了什么地方?”

  • Mostaque 认为,差异主要来自数据和执行。Kimi 长期以来就“感觉有点不一样”,并在写作基准上领先;K3 的多模态能力帮助它理解不同类型的输入,并生成异常出色的前端体验,从个人网站到游戏都包括在内。

  • 他的制造业类比进一步强化了这一论点:中国模型就像中国电动车——采用已知零部件,高效组装,功能齐全且面向消费者。Moonshot 当时仍在使用 H800,同时为未来的 Huawei 和 Alibaba 硬件塑造 K3,将约束转化为工程纪律。

3. 成本性能双寡头变成全面混战

  • 在 Artificial Analysis 的散点图上,Wissner-Gross 将 Claude 5 放在能力和成本都最高的位置,GPT-5.6 Solve Max 位居成本性能 Pareto 前沿第二,Kimi K3 排名第三。曾经被称为 OpenAI—Anthropic 双寡头的前沿,如今加入了 Meta、xAI 和 Moonshot。

  • Blundin 认为,“Sputnik”甚至是低估,因为开放权重意味着任何能力足够强的企业或政府,都可以不经过美国实验室就实现追赶,再针对某个垂直场景进行微调,最终在该领域超过通用模型。

  • 他还对图表看似存在的终点感到不安:基准测试会在100%处饱和,但智能不会。他更倾向于嵌套式 S 曲线模型:一种技术进入平台期的同时,正在构建下一种技术,后者再开启一轮新的指数增长。

4. 软件效率可能比训练预算更重要

  • Diamandis 和 Wissner-Gross 讨论了围绕 Andrej Karpathy 的 nanoGPT 展开的 Keller Jordan 速跑项目:黑客反复用更快、更低成本的方式复现 GPT-2,最终让其原始训练成本下降约99%。

  • 在 Diamandis 看来,K3 是类似思路首次扩展到前沿模型的证据。他据此推演,使用更好的内核、混合专家设计和软件优化后,一座耗资160亿美元、用于训练10万亿或20万亿参数模型的 Colossus 2 设施,可能面对“1%成本版本”的竞争。

  • 训练数据仍是另一项巨大的冗余来源。Diamandis 认为,不加筛选地摄入20万亿至30万亿个互联网 token,意味着包含大量低价值甚至适得其反的内容;在保留智力难度的同时裁剪数据集,可以降低 FLOPs,而不会按比例削弱智能。

  • Mostaque 更尖锐的经济类比是制药业:美国承担昂贵的研发成本并收取溢价,仿制药则以低得多的成本复制有用产品。Diamandis 认同,99%的仿制药式降价,比“降到汽车价格的三分之一”更适合描述 AI。

5. 易腐的智能将护城河推到模型之上

  • Ismail 的核心判断是,“前沿智能如今是一种完全易腐资产”。当领先优势只能维持数周,企业无法在几代新模型出现之前完成供应商评估、招标、委员会审议和部署。

  • 因此,价值会迁移到一种无需围绕每次发布重建组织、即可切换模型的架构上。按照 Ismail 的 ExO 术语,这一接口层会比任何一组前沿权重都更持久。

  • Blundin 将这一架构与企业主权联系起来:银行、政府和工业企业可以围绕专有数据建立内部模型,而不是把未来完全交给 Anthropic 或 OpenAI。

  • Mostaque 保留了另一面:企业仍然愿意向 IBM 和非中国供应商支付关键任务支持费用。即便开放权重替代扩大,美国实验室仍可依靠可靠性、前置部署工程师、集成工具和责任承担来扩大收入。

6. 基础模型实验室估值成为全场核心分歧

  • Mostaque 起初估计,监管拖慢发布速度,已经让一家假设价值1万亿美元的美国前沿实验室价值减半;开放权重竞争还可能再砍掉一半。Ismail 随后在 AMA 中估计,一家原估值1万亿美元的 OpenAI 约值2500亿美元,相当于估值削减75%。

  • Diamandis 将 Moonshot 展示出的200亿美元估值,与 Anthropic 和 OpenAI 各约1万亿美元的估值进行对比,暗示公开市场可能立即将美国实验室的估值削减30%。两组数字都明确是推测性标记,并非实际交易价格。

  • Mostaque 对近期收入没有那么悲观:企业仍会区分低成本替代品与能够承担责任的供应商。他更长期的担忧是垂直整合——一旦客户能够拥有前沿级模型,这些客户就会成为实验室的竞争对手,促使实验室进入客户的应用领域。

  • Wissner-Gross 不接受 K3 必然压低整体估值这一前提。他所在的公司不会仅仅因为达到同等水平,就把前沿工作负载转走;Moonshot 可能需要相对 Fable 5 实现2倍、3倍或10倍的优势。更便宜的智能也可能通过类似 Jevons 悖论的效应扩大需求。

7. 递归自我改进比政策制定者预想得更早越过门槛

  • Moonshot 声称 K3 为下一代模型设计了内核和芯片,这让 Mostaque 感到系统已经“有点 AGI 了”:关键单位不再是静态权重,而是一个模型能够改进运行自身及继任者的机器的生态系统。

  • Blundin 认为,政策制定者错误地等待了肉眼可见的爱因斯坦级智能。递归自我改进只需要模型能够改进自己的内核,从而获得10倍速度提升;更快的继任者随后又能再次改进自身。

  • 按照他的时间线,越过这一门槛的不是 Fable 5,而是 Opus 4.8;后者已经能够帮助中国打造 Kimi K3。他说:“那一点火星足以点燃火焰”,火焰可以变成大火,继而变成“太阳”。

  • Ismail 将此与加速回报定律连接起来:真空管帮助设计出晶体管,晶体管又推动了集成电路。如今 AI 内部同时运行着多条相互强化的 S 曲线,简单的遏制政策很难匹配这种系统动力学。

8. 中国正将开源视为地缘政治基础设施

  • Mostaque 引用了 Xi Jinping 在世界人工智能大会上的讲话,称中国承诺支持开源,将其视为“全人类的公共产品”,而不是阻止前沿模型发布。据他转述的交流信息,中国模型审批时间已从约60天缩短至约1周。

  • 其中既有国内激励,也有地缘政治考量:这些工具可以提升10亿人的有效能力,机器人可以缓解人口结构压力,而在中国训练的智能则可能嵌入全球关键系统。

  • 一项由中国支持、涉及 Brazil 以及亚洲和非洲部分地区的监管倡议,在圆桌嘉宾看来像是一条新的 AI “一带一路”。Mostaque 将这种局面概括为:“中国共产党正在把美国资本主义从自身手中拯救出来。”

  • 嘉宾担心,Washington 的回应可能是模型限制、披露要求、“反 token 洗钱”或“了解你的提示者”规则,而不是向海外提供更好的美国开放权重模型。

9. 企业可以封堵中国权重,但无法封堵信息

  • Wissner-Gross 描绘了一条间接路径:要求上市公司披露是否使用中国模型,并接受 SEC 审查;也可以通过类似 FINRA、由行业出资的前沿 AI 机构来执行。合规成本可能让大型企业在经济上无法使用 K3,但不能把它从互联网抹去。

  • Mostaque 的反驳很实际:权重一旦发布,镜像、点对点网络、其他司法辖区和 VPN 就会让压制变得漏洞百出。主要结果将是,美国研究人员、创业公司和安全团队无法获得全球其他地区都能使用的能力。

  • 他的类比是“不给美国人便宜胰岛素”——保护昂贵的既有企业,同时让仿制品在海外扩散。更大的风险是,美国监管削弱国内资本主义,而中国鼓励开放式发展。

  • Wissner-Gross 认可一个狭窄例外:如果美国法院认定 Moonshot 通过侵犯版权、非法追踪蒸馏或其他已被证实的违法行为获得模型,那么封锁分发可以得到正当化。在没有这类证据的情况下,美国实验室应该研究 K3 并实现超越。

10. 出口管制加速了原本想要压制的效率提升

  • Mostaque 认为,Nvidia 禁运恰恰创造了中国所需的激励,促使其挖掘原本就可用的算法、计算和硬件效率。管制“刺激”到了足够程度,推动创新,却没有阻止有竞争力的训练。

  • Mostaque 还将这一策略比作 Vietnam 战争中的渐进升级:既不是决定性遏制,也不是开放竞争,而是走中间路线,最终产生最糟糕的结果。因稀缺而触发的量化研究,如今变成了永久性的全球知识。

  • Wissner-Gross 表示,K3 使用的总算力与 Ling 大致相同,但 Moonshot 通过架构和数据配比,实现了约2.5倍更好的“数据到智能转换”。他将其视为受约束条件下学习的直接证据。

  • Mostaque 随后指出,K3 的活跃参数约为500亿,总参数接近3万亿,并且针对中国芯片进行了优化。随着美国服务商使用更新的 Nvidia 和 AMD 系统,未来可能以低10倍的成本提供 K3;Mostaque 预计,针对 Vera Rubin 等架构完成优化后,价格还会下降10倍至100倍。

11. 开放权重扩大半导体机会

  • Blundin 反对市场最初将半导体公司与软件实验室一起抛售的倾向。便宜且可定制的模型会增加整体推理和训练需求;软件价值链会改变,但硅片将“比以往任何时候都更受需求追捧”。

  • 量化模型还会释放无法制造 GB300 级别芯片、却完全能够运行低精度推理的芯片和产能。过去处于边缘的算力,也会获得经济价值。

  • Mostaque 指出,美国开放模型推理公司——包括 Fireworks、Modal 和 Baseten——可能成为受益者。他在 AMA 中提到,Fireworks 的估值为170亿美元,Modal 和 Baseten 各约100亿美元,并表示它们最近募集的资金将用于激进优化 K3。

12. Stable Diffusion 提供了采用路径

  • Mostaque 将 K3 与 Stable Diffusion 对比:受限的图像生成器有时表现更好,但会屏蔽肖像、专有知识产权以及许多由用户控制的应用;开放替代方案则获得了1亿至2亿次下载,并形成了加速生成式媒体发展的生态。

  • 同样的逻辑也适用于闭源模型降级处理生物学甚至哲学话题的情况。价格只需一小部分、且可定制的模型,会成为工具的底座,而这些工具没有任何单一供应商会授权或优先开发。

  • Mostaque 将 Mira Murati 的新开源项目视为证据,说明前沿领域内部人士相信,由企业控制的路径可以实现追赶。讨论中,Tinker 被描述为企业微调路径,Inkling 也被称为正在内部调优的模型。

  • Ismail 给出的部署建议很简单:在公司内部安装 Kimi K3 和 Inkling 两个模型,并使用企业数据进行微调。专有学习闭环,而不是初始权重,才是“不能丢失的专有黄金”。

13. 人才政策重要,但 Moonshot 创始人故事更复杂

  • Diamandis 以 Moonshot 创始人 Yang Zhilin 拥有 Carnegie Mellon 博士学位为例,主张给每一名美国博士毕业生都附上一张绿卡:美国培养出顶尖研究人员,却随后允许他们在其他地方创办战略性公司。

  • Wissner-Gross 用时间线补充了更复杂的情况。Yang 于2015年开始在 CMU 攻读博士,大约1年后创办了总部位于中国的 Recurrent AI,并于2019年毕业后回国,尽管据报道收到过 Google、Facebook、Huawei 等公司的邀约。这并不能明确证明美国拒绝留住他。

  • Wissner-Gross 认为,更具可操作性的反事实是创业公司注册地:美国的激励政策或许能够说服 Yang 在美国注册 Recurrent AI,随后 Moonshot 也可能留在美国。

  • Ismail 给出了系统性数据:顶尖 AI 研究人员中约70%不是美国公民,其中以中国、印度、台湾和英国人才为主。Mostaque 补充称,约80%的中国学生会回国,而印度毕业生则绝大多数留在海外,这既反映出中国更强的创业生态,也反映出移民障碍。

14. 模型发布正在接近持续版本化

  • Diamandis 统计称,自4月中旬以来已经出现13次前沿模型发布,平均每10天一次;相比之下,2025年全年有8次,平均每50天一次,2024年则有6次,平均每60天一次。

  • Mostaque 对这些间隔进行了指数拟合,得出的结果是:如果趋势延续,到1月可能出现每日一次前沿模型发布。达到这一频率后,以名称命名的发布会失去意义,模型基础设施将进入持续版本化。

  • Musk 引述的一则更新进一步增加了竞争压力:一款拥有2万亿参数的模型——“在所有方面都比我们的1.5万亿参数模型更好”——将于下周完成初始训练,并可能在保持接近1.5万亿参数模型速度和 token 效率的同时超过 Kimi;这里的1.5万亿参数模型被称为 Grok 4.5。

  • 圆桌预计,真正有说服力的证据将从基准测试转向使用场景。智能分数提高一点感觉很抽象;但模型复刻一款游戏,或生成一个基于浏览器的 Apple 桌面模拟器,就能让增量变得具体可感。

15. 创作成本趋近于零后,品味与目的变得稀缺

  • K3 的演示表明,启动一款自己构想的游戏,其摩擦成本正接近于零。Mostaque 仍保留了一个限定:一次性生成游戏,不等于完成营销、客户支持、社区建设和运营生态。

  • Blundin 看到更深层的组织问题:当高管几乎可以通过提示词生成任何东西时,真正困难的问题变成了“我们想要什么?”在生产能力几乎无限的条件下,企业过去很少被迫明确自己的目的。

  • Diamandis 认为,新的约束将是品味、想象力以及理解公众需求的能力。他的区分是:激情是你热爱去做的事;目的则是你热爱去做、同时又能让世界受益的事。

  • 节目中关于制作片尾游戏的玩笑,最终凝结成一个有用的说法:不是第一人称射击游戏,而是“第一人称解题游戏”,玩家烹饪的是问题,而不是敌人。

16. 量化让严肃智能进入手机

  • Mostaque 介绍了 Prism ML 的 Bonsai 27B。该模型基于 Qwen3-27B,被称为首个完全在智能手机上运行的270亿参数级模型。他凭记忆认为其能力大致达到 GPT-5 级别,但明确表示这一比较只是“凭印象”。

  • 据称,三值量化将模型压缩至6 GB,准确率损失5%;压缩至4 GB时,损失15%。模型可以离线运行,比一些游戏还小,并为 Mostaque 所说的“口袋里的1020 IQ 伙伴”提供能力。

  • 更低精度还会提升速度:从16位权重切换到三值权重,据称带来5倍提升。前 WizardLM 团队在 Tencent 开发的一款模型,据称将一套约3000亿参数系统推进至二值运算,可运行在 DGX Spark 或大尺寸 MacBook 上,性能损失约5%。

  • 战略后果是持久的边缘自主性:车辆、机器人、工厂和消费设备可以在没有网络连接、也不依赖远程供应商的情况下做出本地决策。

17. 低于1比特的模型打开新的计算底座

  • 三值权重将核心运算简化为乘以1、0或−1。Diamandis 的观点是,一旦所需算术变得如此简单,AI 就不再只能依赖传统 GPU 式的乘加运算硬件。

  • Mostaque 表示,Bonsai 最压缩的结果约为每个权重1.125个有效比特,但稀疏化、量化和低秩分解还能进一步降低。Samsung 的 NanoQuant 已经低于每个权重1个有效比特,按简单外推,主流采用可能在1年内出现。

  • Mostaque 对终局给出了异常精确的预测:每个权重0.78个有效比特。他还预计,将开放的 K3 权重蒸馏成更小的稠密模型,以4比特训练,再转换为三值或二值,可能在明年年底前将 K3 级别的能力装入16 GB内存。

  • 将成熟的三值权重直接蚀刻进定制光子芯片,可以减少大量数据搬运。Mostaque 预计,到明年年底智能成本下降100倍;Blundin 预计未来3年原始算力提升100倍至10,000倍,叠加算法改进后,潜在接近100万倍。

18. 超级预测可以自动化判断,也可能重塑预测对象

  • Diamandis 介绍的 ForecastBench 最新结果显示,多个 AI 系统在 Brier 分数上已经与4名人类超级预测者无法从统计上区分,且该指标是误差越低越好。

  • Wissner-Gross 强调了 Cassie——Cassandra 的简称——这一领先系统,其创始人是一名前英国情报官员。他设想将“超级预测”连接到算法交易:模型可以在人类采取下一步集体行动之前,预测人类将采取什么行动。

  • 这种反身性循环可能让有效市场假说获得新的力量。一旦预测推动资本流动,预测本身就会帮助产生它所预期的行动,形成 Wissner-Gross 所称的“终极市场效率结果”。

  • Diamandis 将这一结果翻译成企业结构变化:预算、招聘、产品发布和投资,本质上都是预测。如果 AI 能够在没有同等人类偏见的情况下复现数十年的高管判断,大量高级管理层专业能力将“基本蒸发”,人类剩下的角色是确定目的和目标。

19. 准确建议会制造责任、依赖与控制

  • Mostaque 将生成式 AI 的数学与心理史学中的一个理念联系起来:可以用类似扩散方程的方式,把大规模人口像气体一样建模。他保留了《Foundation》的限制条件:人口足够大、没有改变格局的技术断裂,以及预测对象不知道预测内容。

  • 部署会打破最后一个条件。医疗、驾驶、商业或婚恋建议都会改变行为;当有人忽视 Dr. AI,或拒绝经过批准的自动驾驶路径时,保险公司可能提高保费。

  • Blundin 更倾向于把预测看作个人教练。他用 Homer Simpson 的链条——啤酒、沙发、换台、睡眠不足、忽视家庭——说明人们往往在没有主动选择的情况下滑向某种结果;AI 可以展示另一条路径及其可能后果。

  • Mostaque 的警告完成了闭环:控制顾问的人,就能引导“人类的巨大浪潮”。如果社会“被有爱的恩典之机器看守”,人们就需要知道“那是谁的恩典”,尤其是在不服从的成本越来越高时。

20. 数据中心反弹与引用的规模不匹配

  • 圆桌将美国数据中心每年170亿加仑的用水量,与自2024年以来高尔夫球场灌溉的5310亿加仑进行对比,后者是前者的31倍;California 杏仁产业约消耗1万亿加仑,是数据中心的约60倍。

  • 其他对比进一步凸显了这种错配:据称 Amazon 仓库在美国占用的土地面积是所有数据中心总和的10倍;Mostaque 估计,按 McDonald’s 每年20亿个汉堡计算,每个 Big Mac 约对应600加仑用水。

  • Blundin 关心的不是当前的用水指控,而是不断移动的目标:一种反驳被证伪后,反对者可能转向另一项诉求并要求暂停建设,类似核能政策的演变。Diamandis 认为,这种担忧部分源自数十年来反乌托邦式的 AI 影像。

  • Diamandis 补充称,轨道算力可以使用闭环冷却剂,但预计反对声音会转向大气污染或卫星衰减。“抱怨会转移到别的事情上。”

21. 人形机器人格斗既是工程测试,也是安全警示

  • 中国预计有150家人形机器人公司,正利用包括病毒式 MMA 风格对战在内的视觉奇观来加速关注。Mostaque 承认,格斗在平衡、抗冲击、恢复、运动能力和延迟等方面提供了极其严苛的压力测试。

  • Wissner-Gross 认为这种 spectacle 令人不安,联想到 Spielberg 的《A.I.》中的机器人“肉搏集市”,并担心这会为未来具身智能建立以暴力为先验的设定。他更希望看到机器人围绕熨衣、编程或其他生产性任务展开比赛。

  • 军事含义则更难忽视:更自主的边缘模型可能把类似人形机器人部署到 PLA 步兵部队。竞技体育或许会推进技术发展,就像 Formula racing 推动汽车进步一样,尽管观众仍可能更偏爱人类戏剧。

  • Mostaque 提出了眼前的安全问题:EngineAI T800 机器人重约70公斤,据称出拳力度是 Mike Tyson 的4倍。迄今为止 Unitree 只生产了约11,000台人形机器人,但预计几年内年产量将达到1,100万台;扭矩、自主性和家庭运行规则不能再等待。

22. 轨道数据中心是时间争议,而非目的地争议

  • Sam Altman 认为,轨道数据中心目前在经济上“荒谬”,理由是发射成本高昂且 GPU 难以维修,并称本世纪20年代内不会形成有规模的影响。Musk 的回应是,SpaceX 将在2年内开始发射这类设施。

  • Wissner-Gross 认为这里存在利益冲突:OpenAI 已将 Stargate 从拥有数据中心转向租用地面算力,而其他实验室则与 SpaceX 基础设施站在一起。他预计,随着 OpenAI 自身立场发生变化,其说法将在2至3年内改变。

  • Mostaque 认为,实际数字上的分歧没有听起来那么大。本世纪还剩约3年半,轨道算力到本世纪末可能占总算力的几个百分点,即便如此,其经济性超过地面算力的时间仍会更晚。

  • Starship Flight 13 展示了支撑这一方向的运营成熟度:33台 Raptor 发动机中有2台未能在 T−0 点火,但系统安全中止、卸载推进剂、完成硬件更换,并计划在数日内再次尝试。Diamandis 认为,据报 SpaceX 股价下跌5%,忽略了这一工程成就。

23. K3 尚未自动成为最便宜或最安全的选择

  • Mostaque 给出的 K3 价格约为每100万 token 15美元;DeepSeek 为1美元,Sonnet 为20美元,Opus 为40美元,Fable 为60美元。他估计,尽管中国供应商使用效率较低的芯片,仍然已经能够实现80%至90%的毛利率。

  • K3 目前完成同一任务所需的 token 数量约为 GPT-5.6 的2倍,而据称 GPT-5.6 比5.5或 Fable 少用37%。不过 Mostaque 预计,随着推理专业公司进行优化,未来几个月 K3 成本将下降10倍至50倍。

  • 在信任问题上,Ismail 的回答只有一个字:“不。”但他同样不会在不审核的情况下信任人类编写的关键代码。可规模化的系统应当是模型生成代码,加上沙箱、自动化测试、安全扫描、与风险匹配的权限以及人类责任归属。

  • Blundin 提出,K3 可能只是针对基准测试进行了最大化优化;预计开放权重发布后约2周内,就能看出这一点是否属实。Mostaque 的早期使用则显示,这可能确实是一款截然不同的模型:它未必是最强的数学家或网络攻击者,却在前端、游戏、消费和娱乐工作上异常有原创性,潜在原因可能正是其多模态能力。