先锋 趋势 方法 投研 作者
返回先锋
吴翼
研究员 2 场深度对话收录

吴翼

清华叉院 (IIIS) · 助理教授兼强化学习专家

前沿洞察

吴翼指出,推理强化学习(Reasoning RL)正开启第二增长曲线,推动AI从“回答问题”跃迁至“出售时间”。预训练奠定表征底座,强化学习则掌舵决策行动;下一步决胜在于环境内多轮交互与超长rollout基建。但他警示:思维链伸长与准确率的机理仍不明晰,现实Agent受困于低基准成功率,突破高成本与可靠性瓶颈方能落地。

观点集合

一堂「强化学习」大师课|对谈清华叉院助理教授吴翼

  • 🗓️ 日期2025-04-05 | 🎙️ 节目:42章经

o1与DeepSeek-R1证明reasoning RL可能成为预训练之外的第二条智能曲线,但思考长度与准确率的关系仍缺乏满意解释。预训练提供理解与表征,强化学习负责推理、决策和行动,下一阶段竞争将转向环境内多轮Agent及支撑超长rollout的基建。

查看访谈对话精读提要
  • 强化学习解决的不是单步分类,而是没有标准路径、只在终局判断好坏的长程决策。 吴翼因此说“人生就是一个强化学习的过程”,但曲凯追问出了关键限制:人生往往连 reward function 都不知道;吴翼的回答是,很多时间恰恰要用行动和反馈去探索目标,而不是先把目标想清楚再开始。

  • RLHF 的历史作用主要是让 GPT 从会续写变成会服从指令,并不等于让模型智力持续 scaling。 InstructGPT 把 prompt 当任务、每个 token 当 action,再用人类排序训练 reward model;吴翼的比喻是,它像“让一个聪明的清华北大的同学,经过实习之后,变成公司里很能打的员工”,但没有从根本上让这个人更聪明。

  • o1 开启的 reasoning RL 才被视为预训练之外的第二条智能曲线:增加 inference-time compute,让模型先写出大量 thinking token,再交答案。 中间怎么想可以自由探索,训练只奖励最终结果,因此数学等可验证任务成为主战场;但“为什么吐的字多就会更准”至今没有令人满意的理论解释,OpenAI 从 slow thinking 构想到做成可能花了约一年半至两年。

  • 只验终局释放了探索空间,也带来思考长度、成本与泛化边界的问题。 DeepSeek-R1 可能连“一加一”都想很久,Anthropic 则能让简单题少想、复杂题多想,但其实现究竟是多个模型路由还是训练更好,吴翼明确说“不知道”;理科 RL 能泛化到文科,却仍需 SFT、RLHF 和 base model 把“极致的 nerd 模型”拉回可用区间。

  • 预训练与强化学习是乘法关系:前者提供理解、记忆和表征,后者把这些能力转成推理、决策与行动。 OpenAI 在 2016 年网页购票上仅靠 RL 碰壁;机器人方向上,2019 年灵巧手拧魔方做出了很惊艳的成果,但 2020 年通过视觉整理桌面的尝试仍未成功,随后机器人团队在 2021 年解散。直到 CLIP 一类预训练多模态表征进入机器人训练,语言控制才明显走通。“小学水平的人想得再深也没用”,好的 base model 仍是 Agent 的基础盘。

  • DeepSeek-R1 最重要的产业意义不是宣布唯一路线,而是大幅降低了 reasoning RL 的技术不确定性。 吴翼用灯塔作比:OpenAI 在黑暗里指出东方,DeepSeek 则像“往前走一个月就到了”;真正门槛仍包括强基座、超长 rollout、并行生成与判分、稳定回传和高吞吐训练系统,且字节、DeepSeek、OpenAI 等仍在探索不同路线。

  • 下一阶段竞争会从单轮做题转向环境内、多轮交互的 Agent,并沿泛化、代码和工具调用分化。 OpenAI 的 Deep Research、Operator 已把范式从“一条指令—一个答案”推进到反复观察、思考、调用工具;吴翼判断美国在这种大规模 Agent RL 上仍明显领先,国内推理与单点代码能力已接近,但公开产品尚未显示同等精细的交互训练能力。

  • 对投资者和创业团队,短期护城河更可能落在基建、数据与迭代速度,而非某个孤立算法。 吴翼直言“基建远大于所有”,AReaL-Boba 把 7B 训练从早期约一周压到两天,并报告 AIME 2024 超过 60;应用公司不应预设终局,可以像 Manus 那样在能力尚未商品化的窗口,用微调、API 和工程抢先提供可用产品——“创业公司是不能想终局思维的”。

  • 🔗 原始收听与视频来源: 一堂「强化学习」大师课|对谈清华叉院助理教授吴翼

收听完整访谈 →


88. 和吴翼技术解读OpenAI Operator:推理从抽象世界走向物理世界的开端

  • 🗓️ 日期2025-01-24 | 🎙️ 节目:张小珺Jùn|商业访谈录

Operator把o1式推理扩展为观察、行动和反馈闭环,依靠多模态基座、演示数据与强化学习驱动浏览器交互。它证明Agent正从回答问题走向出售时间,但OSWorld当前只有三十多分,可靠性、成本和垂直场景交付仍决定商业化速度。

查看访谈对话精读提要
  • Operator 的关键跃迁不是“会点网页”,而是把 o1、o3 的单次深推理扩展成多模态、闭环的环境交互。 模型会观察、行动、接收新反馈再行动,甚至关掉弹窗、点击失败后退回、浏览器计算失败后改用计算器;吴翼称其为从纵向思考深度向横向通用能力扩展,“回溯发生在动作上,但不是它的思维链”。这让 AI 的价值边界从生成答案推进到执行任务,但可靠性也随之成为商业转化的硬门槛。

  • Operator 没有神秘的技术秘密,但其壁垒是三块能力同时做到极致。 一是高质量的原生多模态基座模型,二是数量不必巨大但行为足够好的演示数据与任务,三是能在几千卡乃至一万卡上高效驱动浏览器或操作系统交互的强化学习系统。OpenAI 早在 2016 年的第一个大型项目就是 Web Agent,却因只有强化学习、没有基座模型和标注数据、连算力都没有而失败并裁掉约二三十人;九年后的关键配方正是基座模型与强化学习的结合。

  • Operator 更像“多模态、闭环的 o1”,而不是给 o3 装上一双手。 它的思维链较短,主要通过动作试错,且很可能采用不同于 o1、o3 的基座模型,因此单独入口既反映模型差异,也像产品过渡态;当前 OSWorld 只有三十多分,吴翼却判断按 OpenAI 的节奏,“今年肯定给你干到七八十”。能力曲线可能仍很陡,但眼下发布代表技术突破,并不等于商业产品已经成熟。

  • Operator 的商业模型本质上是出售时间,而非出售聊天次数。 如果三个可靠 AI 能并行处理退货、采购、报税等任务,吴翼保守地估计人的有效时间或可“乘以二”;在企业端,它对应一个比新增员工更便宜的“AI 员工”。但 OpenAI 的产品收入首先提供的是现金和融资杠杆——“用户提供的不是数据,用户提供的是钱”——用户数据虽是护城河,却不会像推荐系统那样自动转成智能飞轮。

  • 通用模型公司将占据共识主战场,创业公司的机会在其尚未覆盖的 1% 长尾。 全球软件和网站数量巨大,即便 Operator 覆盖 99%,剩余 1% 仍足以支撑客服、物流、报税、订单等垂直 To B Agent;吴翼称美国已有十多家此类公司,而中国这样的 Agent 公司相对少一些。GUI Agent 通用却低效,可能只是中间态:若两三年后大量请求由 Agent 发起,网站可能同时开“给人”和“给 Agent”的两扇门。

  • Operator 对应 OpenAI 分级中的 L3 Agents,距离 L4 Innovators 仍有结构性鸿沟。 L1 到 L3 都属于可验证的 instruction following:聊天、深思、再到与外部世界交互;L4 要在缺乏明确指令和标准 verifier 的情况下提出“原来没见过、而且更好”的东西,吴翼认为“三到四是特别大的改变”,可能不止两三年。低级的 L5 组织或许会因多个 Agent 被动协作而先出现,但自主组织仍依赖创造力。

  • 2025 年更像 Agent 的能力拐点,而不是商业化终局。 多模态基模、强化学习和交互基础设施都到了新的阶段,行业会把开环文本推理改造成闭环多模态推理;但赛道已经高度共识化,巨头会“开着坦克”推进,资源较少的团队只能沿“乡间小道”寻找非共识机会。Operator 只是指针从抽象世界的“九十度”向物理世界偏到“八十度”的信号,真正的物理智能、个性化记忆和 Agent 间协作仍待探索。

  • 🔗 原始收听与视频来源: 88. 和吴翼技术解读OpenAI Operator:推理从抽象世界走向物理世界的开端

收听完整访谈 →