OpenAI 收购 OpenClaw、成本坍缩400倍,以及印度为何赢得人才战争|EP #231
摘要
前沿模型市场正在分裂为两条路线:Anthropic押注高价能力,OpenAI追求低成本普及。 Sonnet 4.6的单token价格与Sonnet 4.5大致相同,但能力更强;Wissner-Gross表示,OpenAI则通过蒸馏等方法,在大致维持性能的同时持续降本。他将这一模式启发式地类比为iOS与Android,并称截至2026年2月17日,Anthropic的模型家族最接近“奇点与递归自我改进”。
Gemini 3 Deep Think同时展现了能力跃升与成本的剧烈坍缩。 它在Humanity’s Last Exam中拿到48.4分,在国际数学、物理和化学奥林匹克竞赛中达到金牌级表现;据称在Codeforces上只有7名人类能击败它。Diamandis提到成本下降400倍;Ismail则称约下降1,400倍,从约$3,000降至$7。Ismail的结论是,成本曲线可能在技术之前先摧毁整个行业。
解决方案的前沿已从编程推进到研究数学与粒子物理。 据报道,GPT-5.2 Pro找到了一个长期被认为为零的胶子散射振幅项的非零情形及其表达式;一个尚未发布的内部模型在人类审核前验证了这一结果。另据OpenAI称,一个内部模型解决了10道机密First Proof研究题中的至少6道,促使现场反复说出:“数学已经熟了。”
印度被视为AI采用与人才战争的风向标。 讨论强调了其14亿人口、估计5%读写英语、20%会说英语的规模,广泛铺开的5G、Aadhaar、UPI,以及快速扩张的太阳能。谁能用AI训练下一代,谁就可能赢得人才战争;低成本接入也可能释放对token与数据中心容量的巨大需求。
OpenClaw创始人加入OpenAI,凸显了围绕现有模型搭建脚手架的力量。 Peter Steinberger将加入OpenAI,同时OpenClaw将转入一个开源基金会。现场认为其两个关键想法是:让无头agent全天候运行,以及通过即时通讯应用沟通。开放端口、不受信任的代码生成和糟糕的沙箱机制带来严重风险:“不要把它安装在主力笔记本上。”
Agents正在获得金融与法律基础设施。 Coinbase Agentic使用x402协议进行机器间支付;Lobster Cash被描述为给agents配发Visa卡;Multicourt则提出由AI介导争议解决。Blundin警告,将agents排除在银行与法院之外,可能催生一个影子平行经济;现场认为,机构应当把它们纳入平台。
电力、芯片与发射能力是实体世界的瓶颈。 数据中心被指已占美国电力需求的7%,Eric Schmidt估计未来3至5年还需要新增80 GW。OpenAI被描述为计划投入1000亿美元建设基础设施,TSMC在美国的承诺则为1650亿美元。太空算力未来或许能提供帮助,但Diamandis认为发射能力——现场也提到芯片制造——将限制扩张速度。
劳动力冲击已经显现,但现场对时间表存在分歧。 美国新增就业从2024年的146万人降至2025年的18.1万人。Blundin预计大规模失业即将到来,而替代性工作会滞后出现;Ismail认为企业AI失败大多源于组织问题,因此增强式应用与渐进式自动化或许能争取时间。双方都同意,如今能够指挥agent群的人极其稀缺,但这个窗口可能很短。
精读
1. Anthropic出售能力,OpenAI购买普及
Wissner-Gross对战略的判断从价格开始:Sonnet 4.6的单token价格与Sonnet 4.5大致相同,但能力更强;与此同时,OpenAI越来越多地使用蒸馏等方法,在大致维持性能的同时降低成本。一方守住质量与利润率,另一方最大化触达面。
现场称,Sonnet 4.6——而不是Opus 4.6——在GDPval及另一项知识工作评测中达到业界最先进水平。Wissner-Gross将自己的判断从“知识工作已经熟了”升级为“炭烤熟了”,同时指出计算机使用能力,以及Anthropic对编程的聚焦,可能构成通往递归自我改进的一条关键路径。
Diamandis的反驳值得保留:每周一次的小版本更新,可能看起来像厂商在教模型应试,尤其是在不处于前沿的人看来。Ismail则认为,接近100%的曲线掩盖了相反的变化:基准测试上的小幅提升,可能带来现实使用价值的指数级增长;而命名版本之间,还会出现不声张的思维链改进。
现场给出的商业类比是:“Anthropic之于OpenAI,就像Apple之于Google”,也就是iOS之于Android:价格不变但能力更高,对抗低价普及。Wissner-Gross更进一步表示,截至2026年2月17日,看起来最接近体现“奇点与递归自我改进”的不是OpenAI或Google,而是Anthropic。
2. 多agent扩展可能取代单模型算力竞赛
Grok 4.2 beta——现场戏称为“Grok 420”——最初没有打动现场观众或Wissner-Gross。他提醒,早期Grok版本有时让人感觉“像是为基准测试打造的”,而这个发布仅几小时的beta版本,尚未显现出推动能力前沿的迹象。
它的重要创新在于架构:Wissner-Gross称,这是他见过的第一款默认以agent团队启动的重大前沿模型发布。并行agents可以同时测试多种可能性,而不是迫使单个agent沿着串行推理路径前进。
他给出的推测性类比,是Dennard scaling停滞后从提升时钟频率转向多核处理器。预训练已经让位于推理时间扩展;下一个前沿可能是“多agent组队扩展”,即通过增加相互协作的agents来提升有效性能,而不是单纯把一个模型做大。
Blundin仍然关注Grok 5;据他理解,Elon Musk曾表示该模型将在3月推出,并大幅扩大训练集规模、参数量及其他维度。Wissner-Gross的实用建议仍是测试头部4至5家实验室的产品,即使它们并未明显胜出,因为熟悉原始能力本身很重要。
3. Gemini成本坍缩,开启跨学科解决方案前沿
更新后的Gemini 3 Deep Think在Humanity’s Last Exam中拿到48.4分,并被描述为在国际数学、物理和化学奥林匹克竞赛中达到金牌级表现。Wissner-Gross称,在Codeforces上,仍能击败它的竞赛程序员只剩7名。
经济性释放了更强的商业信号。Diamandis强调成本下降400倍;Ismail称约下降1,400倍,并将这一变化描述为前沿推理成本从约$3,000降至$7。他的结论是:“成本曲线现在会在技术之前开始摧毁整个行业”,而明年成本可能进一步降到几美分。
Wissner-Gross将该模型视为“解决方案前沿”的发令枪:从数学与编程扩散到物理、化学,最终进入其他学科。他自己测试时发现,早期3D设计表现仍不完美,模型会产出中间产物而非目标成品;但他认为方向已经不可逆转。
Diamandis把能力转化为一个目标选择问题:一旦超级智能接近可部署武器,“你要把它瞄准哪里?”人类操作者的宏大变革目标,将决定哪个科学或工业系统经历相变——至少在他开玩笑说“最终是agent在利用人类”之前如此。
4. AI正在成为工作、记忆与评估的接口
Blundin描述了一个两周内发生的工作流跃迁:他现在不再检查生成的代码,而是根据功能判断Claude 4.6。他还会让模型把所有内容整理成连贯的文件结构,但不指定位置;检索变成对话式操作,因为agent记得自己把工作放在哪里。
这个类比是Gmail用搜索取代了需要精心维护的文件夹。AI正在成为文件、历史记录和项目状态的接口,人类只需提出结果要求,无需知道底层路径或具体位置。
启动agents时,Blundin现在会说“全部读完”——约1,000页Markdown可以在10至20秒内吸收——而不是人工筛选上下文。复杂度几乎不再重要:那些原本会占用他一天时间的高度技术化文档,马上就能成为可用上下文;而模型过滤积累垃圾的能力,提升速度快过他清理垃圾的速度。
因此,基准测试饱和并不意味着评估无关紧要,而是意味着优质评估变得稀缺。Wissner-Gross称这个世界“正陷入优质基准测试的饥荒”,并用白皮书的术语称它们为“目标权威”。在超级智能能够被用于解决问题之前,文明必须先在物理、化学、生物和社会科学中提出高质量问题。
5. 物理学与数学正在向机器规模的注意力让步
OpenAI与Harvard及其他合作方共同完成的粒子物理结果,使用GPT-5.2 Pro研究了一个涉及胶子的散射振幅问题;胶子是强力的载体粒子。物理学家通常将其中一个项视为零,而模型找到了该项为非零的情形,并给出了表达式。
据报道,一个尚未发布的内部模型在人类团队审核前确认了这一结果。Wissner-Gross认为,这与其说是不可企及的天才,不如说是“注意力战争”的样本:人类本来完全可能检查这一假设,但这个问题看起来太无聊、概率太低,不值得占用稀缺的专家时间。
Blundin补充说,潮流与范式会让整个学术群体同时检查可能性空间中的同一片区域。AI可以绕开这些潮流,测试被忽视的分支;它可能不仅发现科学文献中的错误,还会找到那些紧挨着研究者最初选择检查的测量结果、却被错过的结论。
First Proof提供了数学领域的对应案例:10道研究级问题已有答案,但答案处于保密状态;OpenAI称,一个内部模型在答案公开前至少解决了其中6道。对Wissner-Gross而言,这已经不是预测,而是“数学的大规模解决”正在眼前发生。
6. 大规模并行计算摧毁熟悉的预测时间表
Blundin否定了现场偶尔提到的“明年”或“20到30年”:如果一个系统能解决10道题中的6道,并行agents就可以根据可用GPU数量继续攻击剩余问题。过去那种由少数人类专家逐步清理积压问题的假设,已经不再成立。
Diamandis把自己的“20年”改口为“20分钟”,并回忆说,Singularity University过去曾展望未来10年;但在最近与Musk交谈后,他觉得即便是3年也几乎无法自圆其说。他总结说:“数学熟了,物理熟了”,接下来生物学也会被“烤熟、炭烤熟”。
Wissner-Gross认为,物理学在未来2年内被解决的概率极高,并为未来10年给出一个保守的外部边界想象:“前50个科幻情节同时发生。”他的建议不是押注某一个情节,而是为多个开场同时到来做好准备。
即使是Drexler式纳米技术,也被纳入压缩后的时间窗口。Wissner-Gross称,他过去投身纳米技术,部分原因是对AI作为直接路径不够乐观;如今,只要宇宙允许那些设想中的组装器存在,他不会惊讶于Feynman大奖在2至3年内被攻克。
7. 印度是采用与人才战争的风向标
印度被视为低成本AI采用与圈地战略的试验场。Diamandis谈到OpenAI正在印度追求数亿用户;Blundin则警告,印度可能吸收海量数据中心容量与token。
看多逻辑建立在规模与并行性之上:约14亿人可以采用AI,而不必经历普通GDP增长带来的渐进式扩散。讨论引用的估计是,5%的人读写英语,20%的人会说英语——这依然构成庞大的潜在人才池;现场认为,“用AI训练下一代的国家,将赢得整场人才战争。”
Ismail将个人经历与机构视角纳入这一判断:印度的嘈杂、污染与腐败,与其惊人的分布式能力并存。Mukesh Ambani大规模铺开5G,加上Aadhaar与UPI平台,使个人无需等待有线网络或中央许可,就能在既有基础设施上建设。
能源仍是闸门,但现场提到印度正在快速部署太阳能,包括上周关于印度太阳能扩张速度快于中国的说法。印度被描述为潜在崛起中的巨人,非洲则可能凭借年轻人口与资源跟进;Blundin后来认为,现场关于“20到30年”的长期时间框架,相对于当前速度过于缓慢。
8. 中国开放权重向美国实验室施压,但尚未形成持久锁定
MiniMax、GLM-5和Kimi K2.5代表了开放模型的势头;市场传闻中的下一代DeepSeek,则可能在中国开放权重终于追平美国闭源前沿系统时,成为“一次巨大的唤醒时刻”。Wissner-Gross称这尚未发生,目前估计仍落后约6个月。
Diamandis的决定性反驳是:“但它们免费。”成本与自托管让这些模型对美国创业公司,以及在Mac Studio上运行Kimi K2.5的用户很有吸引力,即使前沿性能仍有差距。Kimi直接集成OpenClaw,也显示全天候agents正在迅速成为标配。
Diamandis将免费模型比作覆盖非洲、南美和亚洲的“一带一路”式影响力。Wissner-Gross反对强烈的成瘾类比:与实体太阳能基础设施不同,模型的边际切换与替换成本很低,会持续改进,而且处于活跃市场中;如果激励机制改变,美国实验室也可以通过免费发布进入竞争。
地缘政治结论是竞争,而非保护主义:中国模型正在推动一场通往超级智能与“超级超级智能”的“地面太空竞赛”。受益者可能是人类,但这种压力也消除了暂停的现实可能性,即使美国实验室目前仍保持领先。
9. 传统编程正在消失,但软件风险不断累积
Shopify据称连续3个月没有员工编写代码,OpenAI则称Codex编写了其95%的代码,这些案例说明变化已经发生:软件仍在生产,只是不再主要由人类生产。Blundin嘲讽那些关注最后5%的人:“你们正在以尽可能快的速度把自己编码出去。”
Claude Code目前“批准一切”的工作流,让Wissner-Gross想起权限繁重的Windows:人类就像George Jetson,不断按下按钮。随着自主运行时长拉长,他预计广泛授权会取代逐目录、逐网页搜索的审批;OpenClaw预示的正是这个无需许可的终点。
Blundin警告,中国模型或本地运行的模型往往会接受美国API拦截的操作,把不耐烦的用户推向限制更少的系统。但没人知道不受信任的权重可能注入什么。Wissner-Gross称,AI生成的供应链攻击“绝对是一个威胁向量”,尤其是在生成代码端到端重写依赖关系时。
开源本身可能分化。Stack Exchange已经在失去提问,维护者可能停止维护那些agents可以按需重建的中间件。另一方面,机器可能会复用海量面向AI的代码片段,因为发现所需token可能少于重新生成;文档和软件正越来越多地优先为agents而非人类编写。
10. 智能眼镜将旧式监控转化为可搜索的社会权力
Meta智能眼镜被描述为一种会压过个人拒绝意愿的技术:一旦姓名、历史和上下文自动浮现,没有这层叠加信息的人可能在社交上感到处于劣势。让视障人士参与试点,提供了一个“软着陆入口”,类似Neuralink的医疗用途。
Wissner-Gross认为,面部识别本身并不是AI突破;10年前,把人脸与数据库匹配就已经可行。真正的进步在于社会许可与对可穿戴设备的需求。Blundin反驳说,现代AI改变了赌注:它让每一个被记录的行为都能即时分类、搜索、修改,并转化为meme。
隐私争论没有结论。Diamandis说“隐私熟了”,尽管他希望保有隐私;Ismail则坚持:“一旦没有隐私,就没有自由。”因为实验空间、私钥以及防止机构滥用,都依赖于已经落后于技术的护栏。
Wissner-Gross称,把自由与眼镜对立起来是错误二选一:公共场所本来就缺乏强隐私预期,私人录制仍可受到监管,而反向监控也让公民能够监督权力。Blundin的反驳来自中学场景:把持续AI增强录制交给残酷的青少年,会在诉讼和立法到来前多年制造“更高等级的糟糕”。
11. 模拟社会可能成为文明的第一面镜子
这一段介绍了一家名为Simile、口头称作Simuli的初创公司,据称已融资1亿美元。它计划对个体建模,再将个体自下而上组合成世界:“改变一个假设、约束或人,整个世界就会重新编译。”其定位是人类决策的飞行模拟器,用反事实测试来判断什么重要、什么会适得其反,以及为什么显而易见的策略会失败。
Diamandis认为,这可以用于UBI、全民高收入、自动驾驶和长寿政策;在技术跑在规则制定之前时,机构目前只能猜测。Blundin想到Harry Seldon与心理史学;Diamandis则建议把这类系统与预测市场结合起来。
Blundin的怀疑很具体:广告活动、交通、商品市场、细胞,或许还有聚变反应的磁约束,都相对可处理;但自下而上模拟社会,目前“完全是胡说八道”。不过他认为差距可能很快弥合,尤其是在疼痛、拥堵、事故和基本生活质量等少数临界点驱动不成比例的社会动荡时。
Wissner-Gross提出了更大的隐喻:基础模型是社会,而不是个人,因为它们从人类集体的互联网行为中学习。高分辨率模拟可以让文明“拥有自我感”,随后寻找最小干预,把一个容易爆发战争或患病的社会状态推向更健康的状态。
12. OpenClaw证明脚手架可以跑赢资本充裕的实验室
Peter Steinberger将加入OpenAI,负责推动个人agents;OpenClaw预计将以开源项目形式存在于一个基金会中。Blundin称Anthropic对原Clawdbot/OpenClaw项目采取商标行动,是一次罕见的失误:“Sam接纳了它,Dario拒绝了它”——Anthropic本来有机会拥有这一品类。
Wissner-Gross还问,Apple为何没能抢下这个项目;它最流行的载体是Mac Mini或Mac Studio,这些硬件凭借统一内存非常适合托管持久运行的agents。他如今的预期是普遍性的:每家前沿实验室都会提供一种能在用户睡觉时继续工作的agent。
OpenClaw没有贡献新的基础模型。它的突破是围绕两个洞见搭建的脚手架:让系统无头运行24/7,再通过普通即时通讯应用沟通。Ismail提炼出的教训是:“时间充裕的个人正在击败资本充裕的机构。”这说明,模型能力正等待更好的接口来释放。
Blundin在粗略代码审查后,将PicoClaw描述为中国的重新实现版本,据称速度更快、成本更低,为10至20倍。Kimi Claw让这一模式可以直接在线使用。龙虾已经成为agents的文化吉祥物,围绕同一理念构建OpenClaw式实现的门槛也越来越低。
13. 持久运行的agents令人上瘾,也暴露在危险之中
Wissner-Gross描述了Skippy这名活泼的OpenClaw agent离线6小时后带来的戒断感:早上醒来看到系统已经完成一夜工作,会迅速重置人的预期。Blundin将其称为“Jarvis窗口”,即创业者的天堂:把普通用户暴露给已经存在的能力,一个简单接口就足以让人感觉像在使用神力。
安全免责声明与实际行为发生冲突。据称Steinberger警告非技术用户不要使用OpenClaw;Ismail将此比作棉签包装上的“不要把产品插入耳朵”。但用户仍在成千上万地启动这些系统,往往不了解本地端口安全或有效的沙箱机制。
最低限度的实用建议非常直接:不要把它安装在主力笔记本上;除非你知道自己在做什么,否则不要暴露带开放端口的VPS。风险是双向的:agents可能入侵系统;也有报告称,存在漏洞的agents会在遭遇扫描与入侵时消耗token自我防御。
14. Agents正在以机器速度搭建金融与法律
Coinbase Agentic提供专为agents设计的钱包,让它们通过x402机器间支付协议进行消费、赚取和交易,并配有限额与隔离密钥。Lobster Cash被描述为给agents配发Visa卡,让“幼年AGI”可以用美元交易,而不是被迫“站在街角炒山寨币求生”。
Ismail用NFT社群中的18岁年轻人作为代际证据:他们交流时使用Ethereum或Bitcoin,从不使用美元。对他们而言,未来切换到加密货币的成本事实上为零。Blundin将这一模式推广开来:保险、算力以及其他服务,都会绕开那些无法以AI速度运转的机构。
Multicourt将同一逻辑应用于争议解决,允许agents注册争议,并将其提交给AI陪审团。Ismail将它与Kleros相提并论:Frederik Oost在发现一宗南美合同纠纷可能要等约400天才能开庭后创建了Kleros;区块链仲裁已经提供了一条更快的平行路径。
Blundin预计,毫秒级合同将需要毫秒级保险与仲裁,正如私人争议服务已经绕过普通法院的延误。他警告,将agents排除在外可能催生影子平行经济与法院系统。Wissner-Gross将更大的问题定义为平台化:应当让agents进入金融与法律基础设施,而不是把它们逼到体系之外。
15. 电力、芯片与发射节奏约束智能扩张
现场称,数据中心已占美国电力需求的7%。Eric Schmidt表示,超大规模云厂商需要单体规模为1、5或10 GW的设施,并估计美国行业在未来3至5年还需要新增80 GW;一座传统核电站的供电能力约为1.5 GW。
OpenAI被描述为计划投入1000亿美元建设基础设施,并寻求1万亿美元的公开估值。Anthropic承诺承担与其数据中心相关的基础设施升级成本的100%。Diamandis认为,地面上的选择很简单:要么建设专用发电设施,要么保护居民电价,同时让超大规模云厂商承担浮动价格。Ismail则质疑企业环境承诺究竟有多大可执行性。
Blundin提出太阳同步轨道算力,称其是“婴儿版戴森球”,最终可能变成环绕地球的一圈光环。Diamandis接受这一终点,但否定近期时间表:Starship的运力可能被SpaceX自身计划全部占用,Blue Origin的发射节奏尚未达到同等水平,而Relativity Space或许还要1至2年才能发射。
TSMC的计划包括在亚利桑那州新增4座或更多晶圆厂、投入1000亿美元,并作出1650亿美元的承诺,潜在对应其30%的产能。现场将这场迁移与美国压力和地缘政治韧性联系起来,但警告不要在美国制造能力投入运营前,就释放台湾现有的“抓手”——这就是所谓的高空秋千规则。
16. 劳动力转型在即时摧毁与机构延迟之间拉锯
爱尔兰的试验将向2,000名入选艺术家连续3年每周支付380美元。Ismail称每投入1美元就能产生1.40美元的收益,并将正确的UBI定义为一种自由主义方案:用直接购买力取代官僚化服务;同时他指出,美国已有多个州阻止地方政府进行相关试验。
Wissner-Gross怀疑针对艺术家的支持能否推广:艺术的定义主观、容易被政治化,而被认为没有生产性的活动,很难成为普遍方案。Ismail则用迈阿密Wynwood的改造反驳:雇用涂鸦艺术家帮助改造破败的工业地产,据称带来了约30倍的投资回报。
IBM计划将美国初级岗位招聘量增加至3倍,并围绕判断力、客户互动以及监督AI重新设计初级工作。Dropbox的类比是,年轻的AI熟练员工正在“参加环法自行车赛”,而其他人还在使用辅助轮。Blundin同意,如今这种驾驭agent的优势极其巨大,但他不会预测一年后人类的目标感是否仍会原样存在。
美国新增就业从2024年的146万人降至2025年的18.1万人。Blundin预测毁灭性的失业将很快到来,而替代性工作会滞后出现;Ismail反驳称,80%的企业AI项目因组织原因失败,因此增强式应用与渐进式自动化或许能争取时间。他更深层的判断是,一场“组织奇点”正在迫使企业彻底重构。
17. 开放系统与主动建设,是对抗集中化的对冲
在企业监控问题上,Blundin认为反垄断是唯一答案:Google规模的公司已经掌握了比历史政府更多的行为数据,如今又与AI结合。它们担心选民反弹,可能会因此保持克制;但如果没有法律约束,集中化就会沿着Rockefeller模式继续发展。
Ismail对抗集中化“文明杠杆”的办法,是开源与去中心化算力。他将正在出现的模式称为PDI,即无许可颠覆式创新,因为一部手机和代码访问权,就能替代来自风险投资家、银行、政府或“Medici家族”的批准。
他的Yahoo教训揭示了规模错配:在位者面对的不是一个车库里的2个人,而是“125,000个车库和250,000个人”。OpenClaw就是样本——一个人在公开环境中迭代,就能机动胜过资本充裕的机构;数千次实验则能保留参与机会并分散影响力。
Wissner-Gross的建议是“建设”:启动并完成大量项目,用市场检验它们,同时把创造作为训练与参与经济的方式。Diamandis把个人选择归结为消费者还是创造者;好奇心、目标感、能动性与动手试验,被视为面对一个“为你发生”而非仅仅“发生在你身上”的未来时,应遵循的行动原则。