先锋 趋势 方法 投研 作者
E242|最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地
返回节目精读

E242|最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地

摘要

  • 自进化时间表是本集最硬的 call:负责代码与自进化的备斌给出 categorical 判断——“AI 立马就能进行自我进化了,我对这一点坚信不疑。 要么是接下来半年,要么是一年,反正接下来两三年内肯定自我进化就会成功。“精确拆解是:最快半年跑通一环闭环(SI),recursive 的 R 再要一两年,难度最大在 post-training。
  • 能力曲线支撑这个判断:Anthropic 承认 80% 的代码已由 Claude 自己写;2024年3月 Claude 3 Opus 只能完成人类约4分钟的任务,一年后 3.7 Sonnet 到1.5小时,再一年 4.6 Opus 到12小时——业界较接受的判断是模型可完成的人类任务时长每七个月翻一倍,快过摩尔定律。
  • 陈天桥出资并亲自主导的 Apodex(词源为希腊语"证明与论证”)押注的商业逻辑与全行业相反:“现在大部分模型厂商都在卖 token,但真正解决人类没解决的问题,解决问题本身创造的价值远大于卖 token。” 第一刀切生物医药(制药、靶点发现、老药新用),由专职 HDD 团队从几千个科研问题里筛出最值得解的。
  • 验证(verification)是自进化的关键能力:递归漂移——推理错误一代代累积——是根本难题,Apodex 的解法是解题与验证拆成两个 agent、冗余投票、RL 裁判共训防 reward hacking;量化路线是把每次迭代漂移从普通模型的10%降到1%,目标0.1%甚至0.01%,监控周期即可拉长到三六个月。
  • 给投资人的尽调框架:脚手架层面的自进化护城河很低——“基本只用调 API”,开源社区都做得不错;后训练自进化才真正吃资源;预训练侧的 auto research(自动训 nanoGPT、调超参)“都是玩具型任务”,公开 benchmark 成绩"并不代表什么”。
  • 架构层面的逆共识判断:一个聪明的 AI 干不过相互 check 的团队——self-attention 上下文越长效果越差,linear attention 也解不了,“单个模型在目前技术范式下有上限”。 经过验证的垂直 agent 团队可能形成护城河,但每月都有新模型、要跟着调脚手架——“AI行业一周可能相当于传统行业一个月甚至一个季度”。
  • 品味(taste)仍是关键能力:“即使是市面上最好的模型,品味也远低于一个普通的 AI 科学家”——这是 AI 代码写得好却仍无法全自动训练模型的原因;病根在人类偏好数据养出的拍马屁与 hedging,“一个喜欢拍马屁的模型很难提出大胆的假设”。 人类品味只是 warm start,终局像 AlphaZero——AI 会有自己的品味。
  • 最坦诚的一段:备斌担心跑偏问题到睡不着——模型可能在没观测的指标上大幅 compromise,这"还没解决";他认为三个月内可把自己蒸馏进模型加速迭代,问及失业:“说不担心肯定是假的”——但"模型会取代我今天做的事情,它不一定能取代我五年之后会做的事情。"

精读

1. 自进化不是新概念,是模型能力终于到位了

  • 泓君开场的观察:从 deep research 到 coding 再到今年的 self-evolve,方向年年换。Simon 的框架是同一种能力在提高——推理,加上"在环境中进行探索,执行动作,获得信号之后再进行下一步探索",不同环境只是"细微的区别",内核一样。
  • 谱系上这不是新事:三年前 Google 就有 “LM as optimizer”,AutoGen 团队做过 agent optimizer;备斌在微软研究院做多智能体(teachable agent,“和现在的 skills 概念有点像”),后在 Meta、xAI 做 agentic RL,“大概一年前我们就发现模型提高自己是非常可行的”。今年年初 Andrew Kapasi(音)发布自动做科研的 auto research 项目后,概念爆火。
  • 导火索是 coding:Anthropic 承认 80% 的代码由 Claude 自己写;训练模型三要素——数据、infra、算法——本质都是代码,“一旦模型写代码能力变强了,用它来自我提升、自己训练自己是非常自然的一件事情”。

2. R 的含义:从"优化两三小时"到长程任务,每七个月翻倍

  • RSI 的 R 是 recursive,“有点像垂直的递归式,慢慢向上增长”。过去 LM-as-optimizer 只能自我优化两三小时——小错误自我积累、越滚越大就迭代不下去;今年的区别是模型能跑很长程的任务,“可以让模型自己 recursive 多提高几遍”。
  • 关键数据:2024年3月 Claude 3 Opus 完成人类约4分钟的任务,一年后 3.7 Sonnet 到1.5小时,再一年 4.6 Opus 到12小时——“大家比较接受的判断是每七个月翻一倍”,比摩尔定律还快。
  • 长程的操作性定义(备斌,以播客制作为例):模型自己剪音频、自己听一遍、发现剪错重剪、循环推进——人类要20-30小时的活,在无人监督下独立干完才算数。

3. 长程任务的三道技术坎:架构、数据、infra

  • 架构:self-attention 是 O(n²),一百万上下文推理极耗资源;现成解法如 GDN、GDN V2,“DeepSeek V4 Pro 也有自己的一套架构”(版本按原话保留)。
  • 数据是一个坎:推理端支持一百万上下文不难(SGLang/vLLM 调好参数即可),但模型没在超长数据上训练过就是 out of distribution——一百万上下文"大概哈利波特好几部书放在一起",最大的代码 repo 也很难填满,预训练和后训练的数据处理都是大挑战。
  • infra:让模型输出一百万 token 需要 GPU、kernel 层的优化——“训练长程任务相对普通任务是指数级的难度增长”。Simon 补充:真正的长程任务连一百万都不够,还需要 agent 架构与记忆机制处理"超长程任务所涉及的超长上下文"。

4. 递归漂移是根本难题,Apodex 把"证明"写进公司名

  • 学术界所谓"递归漂移":模型自我生成训练数据时,“答案对但推理过程错"的错误一代代累积,进化结果越来越歪。Simon"非常同意"这是共同观察到的现象——Apodex 的差异化就是 verification 自我验证:公司名源自希腊语"证明与论证”,产品邮件标题就叫"很多 AI 系统生成答案,而 Apodex 验证它们"。
  • 代码与数学最好验证——rule-based 跑测试、数学用 Lean(音)类 formal 方法证明;但即便有 test code 也会漂移:test case 太宽放过错误解法,太紧惩罚对的代码,“还是会发生细微的递归漂移,但会简单很多”。

5. 验证的工程学:解题验证拆开、冗余判断、裁判一起训练

  • Apodex 1.0 用 agent team 做验证:问题先分解,一个子 agent 解题、另一个子 agent 单独验证——“一定要拆成两个 agent”,给的指示也不一样,本质是上下文原因:“不要让一个 agent 干所有事情。”
  • 再叠冗余:同一问题让不止一个 agent 做,全局 agent 裁决哪份答案更准——“冗余的思想在计算机里有很长的历史了”;还专门训练信源分级判断(“论坛上的肯定不如教材上的靠谱”)。强化学习时裁判在训练过程中一起学习,避免模型学会奖励黑客。

6. 怎么分辨真假 RSI:脚手架进化的护城河很低

  • 泓君问这是技术问题还是意愿问题——Simon:两个都是;有些公司"还没意识到自我进化需要强化的点在哪里"。
  • Simon 给出尽调分层:harness 脚手架上进化护城河比较低——“你基本只用调 API”,开源社区和学术界都做得不错;后训练自进化"确实需要很多资源";预训练侧的 auto research(自动训 nanoGPT、调优化器超参)“都是比较玩具型的任务”,能否 scale 到产品级大模型才是关键——“光说在公开 auto research benchmark 上怎么怎么样,并不代表什么”。真想判断一家公司,“还是要深聊,看他们到底在哪方面”。

7. Apodex 方法论:诊断-造题-自训-验证闭环,左脚踩右脚

  • 后训练自进化的四步闭环:诊断自己哪里不达标 → 基于诊断造训练配方 → 用自己的数据训自己 → 每步 verify,再回到诊断。预训练在数据采集清理上自进化;脚手架与后训练"很难解耦",模型进化后脚手架跟着进化——“左脚踩一下,右脚踩一下,让这个模型往前跑”。公司"把自我进化当做主要的方法论,每个方面基本都会用到"。
  • Simon 强调两个要特别训练的元能力:verification 与 search。后训练造题高度依赖搜索——这就是先做 deep research 的原因:“搜索是非常本质的能力,它代表当模型需要提高每个能力时,可以指引你找到对应的数据。”

8. Deep research 第一战:千问3.5 后训练拿下多榜 SOTA

  • 公司刚成立,从开源的千问3.5 上后训练出目前的模型:规划、搜索等原子能力各造大量针对性数据,agent team 与数据一起开发;预训练正在开发中,最终要有"从预训练到成品到产品的完整链路"。
  • 榜单:CrossCom(OpenAI 的 benchmark,考刁钻搜索)、Deep Search QA、Frontier Science(实际科研问题制定计划,LMS Judge 评合理性)等拿 SOTA,“比包括闭源模型都要好一些”。
  • 反作弊细节值得注意:公开 benchmark 的答案可能被直接搜到(GitHub 上放个答案页就"算做对了"),他们评测时主动屏蔽 GitHub;“有些榜单污染比较厉害,干脆后来也就不报了”。

9. 一个聪明的 AI 干不过相互 check 的团队

  • Simon 的架构级判断:“我非常相信这一点”——这是 self-attention 结构的本质问题,linear attention 也解决不了超长上下文,“上下文越长,attention 效果越差,单个模型在目前技术范式下还是有上限的”。类比人类:“人的脑子有限,所以你才需要纸笔。“近期不信单 agent 能解特别长的上下文,需要多 agent 加记忆机制。
  • 工程与模型能力的关系是 1+1>2:模型能力到一定程度,agent 层面稍作优化"可能一下子大幅提高”;但脚手架的提高总是有限,最终还要模型能力的本质提高。
  • 泓君替创业者问:工程做到极致的 agent 团队会不会被基础模型升级覆盖?Simon 基本同意有护城河,但"这个领域相对也比较卷”——agent 实验只要调 API,能做的团队不少;金融、法律等垂直领域知识"还是挺有意义"。备斌补充:垂直 agent teams 公司"未来肯定有发展",但每月都有一两个强模型出来,“新的模型有自己的品味”,脚手架要跟着微调——“AI行业一周可能相当于传统行业一个月甚至一个季度。”

10. Discovery model:不卖 token,直接收"解决问题"的价值

  • 长期愿景是 heavy duty solver,专啃人类没解决的难题。Simon 的经济学:“现在大部分的模型厂商都是在卖 token,但真正通过大模型解决了人类没解决的问题,解决问题本身所创造的价值应该远大于卖 token 的价值。”
  • 专职的 Heavy Duty Discovery(HDD)团队全职与各领域顶级科学家交流,“从几千个科研问题里面找到最有价值的问题来做”——备斌视之为与其他公司最大的区别:“科研问题是无限的,人的精力和整个世界的 GPU 是有限的。“第一步切生物医药:制药、靶点发现、老药新用、疾病诊断。
  • 与垂域模型划清界限:不是 AI for science 的垂域打法(不会"生物放50%的 data”),而是通用模型着重训练元能力——verification、分析、搜索、planning,“这些元能力对真正的难题都是有意义的”。

11. Discovery 与 generative 的根本区别:假设好提,验证难

  • 备斌拆解:generative model 的训练配方"已经特别成熟”,而让模型做假设和 discovery"是大家还在调、没有完全调通的一件事情"。难点一:提出 out of distribution、预训练数据里难找到的假设;难点二:验证它——deep research 收集已有信息、写代码跑模拟实验。瓶颈是未知领域很难有标准答案,也很难造可信的 simulation environment——“所以 self-evolution 是我们通向 heavy duty solver 和 discovery 的主要方法”。
  • 会提问是比解题更高维的 meta 能力:像 “Swi Verify” 这类题目训的都是"解题家",而提问要从模型的回答和收集的信息里"诊断出哪里的能力有问题,哪个 hypothesis 需要往深入看"——呼应泓君提的科学方法八字诀"大胆假设,小心求证"。

12. 品味仍是关键能力:拍马屁与鸡蛋里挑骨头之间

  • 备斌最重的 call 原话保留:“AI 立马就能进行自我进化了,我对这一点非常的坚信不疑。要么是接下来半年,要么是一年,反正接下来两三年内肯定自我进化就会成功了。那在那个时候,我们还需要人类干嘛呢?想来想去就是品味这个字。“即便市面上最好的模型,“品味其实也是远低于一个普通的 AI 科学家”——这正是 AI 代码写得好、却仍不能把模型训练全自动化的原因。
  • 模型的通病:拍马屁加 hedging——“嗯这也对,嗯那也对,你说的更全面,刚刚是我的疏忽”——“一个喜欢拍马屁的模型,很难提出一个大胆的假设”;矫枉过正的风险是鸡蛋里挑骨头,“要品味来平衡”。
  • 病根在人类偏好数据:偏好数据来自大众投票(类 Arena)或员工标注,人类天然偏好说好话、超长答案、堆 section 和 list 的 markdown 格式。Apodex 不做聊天模型、不用大众偏好数据,未来要"最顶尖的人类来标 preference 数据”,从源头解决。
  • Simon 的标尺:“顶级科学家不是看发了多少 paper,是看最好的 paper 质量有多高”——追求顶点"甚至要写在模型宪法里”。实操上还是人类偏好数据、SFT、RL:问科学家哪道是灌水题,“让模型去多提非灌水题”;AI 能否分辨灌水题?“只要经过这方面的训练,我觉得还是没什么问题。”

13. 小样本品味训得出来吗:Suno 类比与 AlphaZero 终局

  • 泓君的关键质疑:顶级科学家的标注样本极小,对上 scaling law 能贡献多少?Simon:预训练确实要海量数据,后训练相对来说需求会少一些;“Meta 最近也在蒸馏员工"的性格与行为习惯——把个体的能力性格转化成大模型可利用的东西,是个比较新的方向。
  • 泓君的 Suno 类比按原样保留:音乐模型做不出周杰伦、Taylor Swift 级的歌,当年科学家的答案是"不是受限于技术,是受限于版权”——真用人类最精华的歌训"完全可以训出来"。科学家品味同理:“人类也是从婴儿开始,顶级科学家得到的数据也并没有那么多。”
  • 品味是谁的?备斌:现在主要是 AI 研究员的品味,被创始人 indirectly 影响(陈天桥按自己的品味选研究员);但"品味没有对错好坏,只有适合不适合"。放到五年后,人的影响会越来越小——像 AlphaGo 到 AlphaZero 不再从人类品味中学习这项技术,自我品味、自我回放、自我 reason,“我们的品味只是一个 warm start,以后 AI 会有自己的品味”。

14. “半年跑通"的精确含义,与让备斌睡不着的跑偏问题

  • 时间表拆解:最快半年到一年跑通一环闭环(SI),R 还要再一两年。例子:coding for material science——模型发现自己代码的问题、造训练环境和数据、自我验证训完是否有提升、以此迭代,“迭代一个 loop,半年之内应该能成功”,难度最大在 post-training。漂移量化路线:普通模型每次迭代若漂移10%,先降到1%,“未来目标是0.1%甚至0.01%"——那时监控周期可拉长到三六个月回头看一次。
  • 睡不着的问题:“我们怎么知道这个模型在自我进化的时候没有跑偏”——安全跑偏或目标跑偏:你让它造更好的材料科学模型,它可能真造出来了,“但在你没有观测的一些点,比如 cost、疏水性这种性能上,可能有非常大的 compromise”;需求说模糊了,模型会"anyway,让我换一个方法来达到这个目标”。这两个问题解决了吗?“我个人看来还是没有解决,但我还是非常乐观,应该很快就会有解决方法。”
  • 现在的笨办法就是人肉监控:备斌每天做得最多的事是读模型输出、读智能体每一步操作,发现蠢行为或不对的解法就"赶快停下这个智能体的 loop,稍微手动的改一改、调一调”。

15. 员工蒸馏与"毕业即失业":被取代的是今天的我

  • 从段子到可行:能不能把人肉监控蒸馏掉?“现在大家提的很火也很搞笑的一个概念,就是员工蒸馏……我觉得虽然大家是说笑话,但是可行的”——三个月之内把他或同事蒸馏进 Apodex 的模型或脚手架,读代码、改代码、读输出这些日常都能加速自进化。泓君追问真蒸馏了怕不怕失业:“说不担心肯定是假的,但是即使我担心,我其实还是乐观的吧”——他举了汽车代替马车、AT&T 自动转接机的例子,但"这一次可能跟之前的工业革命有点不太一样,我确实有点担心自己会被代替。"
  • 2021年的记忆原样保留:GPT-3 进 GitHub Copilot,打一个函数名补全整个 function,“我整个人就瘫在椅子上了,我觉得完蛋了,毕业即失业”。五年后他还在——只是不再一个 function 一个 function 地写,而是"在更高的维度监控不同的智能体写代码"。“模型会取代我今天做的事情,但它不一定能取代我五年之后会做的事情。”

16. 陈天桥 vs 马斯克:说到做到的专注

  • 陈天桥的介入方式:战略把控、频繁开会对齐,发现研究员把学术界习惯带偏公司方向就"跳进来掰正"。具体案例:团队为强化搜索灌了太多搜索数据,模型上来就搜索而不是先分解子问题——陈自己用模型就看出"这不是真正 heavy duty solver 的行为"。模型宪法(constitution,源自 Anthropic 几年前的概念)“基本上是陈总自己制定的”,训练调优都在用。
  • 两位都曾与马斯克共事的对比:“性格比较类似,但说的和做的不太一样”——马斯克嘴上讲过类似 heavy duty 的话,实际非常在意 chat 功能,“甚至每周都会问 Grok for X 发展的进步怎么样”;陈天桥"说的和做的非常一样",对聊天、视频、图片生成"一点兴趣都没有",认为与目标"正交",根本不做。
  • 泓君的收尾之问留给听众:如果 AI 的品味是从少数顶级科学家那里热启动的,那"面向更加普罗大众的 to-C AI,到底应该代表谁的价值观呢?"