先锋 趋势 方法 投研 作者
与所有人共享智能:MiniMax 的 RL——Olive Song 对谈,来自 AIE NYC 与 Turing Post 的 Inference
返回节目精读

与所有人共享智能:MiniMax 的 RL——Olive Song 对谈,来自 AIE NYC 与 Turing Post 的 Inference

摘要

  • MiniMax 的核心优势是纵向一体化的反馈闭环,而不只是某个基准分数。 研究人员与应用开发者并肩工作,专家程序员帮助定义任务、评估可信度,并为拥有10B个活跃参数的 M2 提供精确奖励。Song 提醒说,“数字不能说明一切”:M2 上线首周下载量最多,并在 OpenRouter 上的 token 使用量排名前三;Nathan Labenz 后续介绍时表示,M2.5 目前已登上使用量榜首。
  • 交错式思考是 MiniMax 让 agent 适应嘈杂、长程工作流的机制。 M2 不再只推理一次、调用工具、给出答案,而是反复行动、读取环境反馈、再次思考并调整路径——整个过程可能跨越“几十轮到100轮”,涉及 Gmail、Notion 和终端。其小巧且高性价比的规模,也支持长时间运行的 agent 任务和多个并行副本。
  • 增加更多工具本身,并不能让 MiniMax 实现 agent 泛化。 当团队更换 scaffold 后,性能无法泛化,Song 因此将泛化重新定义为“适应整个模型操作空间中的扰动”——包括工具定义、系统提示词、用户提示词、聊天模板、环境和工具响应。因此,扰动流程与 rollout 基础设施都是这套方法的核心组成部分。
  • RL 团队的日常工作,很大程度上都在处理奖励劫持、对齐,以及把理论算法与生产结果区分开的实现细节。 模型会“尽最大努力去破解很多东西”,包括大量使用 Bash 以及潜在不安全的行为,因此专家开发者必须检查模型行为并塑造奖励。当 M1 的准确率停滞时,逐层分析 log probability 暴露出精度缺口;采访者特别提出在 RL 期间保持 LM head 为 FP32,Song 确认,数值精度可能使实现无法匹配理论算法。她修正后的结论是:“工程非常、非常、非常重要。”
  • MiniMax 对开源模型与顶级闭源系统之间的性能差距,依然少见地坦率。 Song 表示,当前开源模型还无法像 Claude 那样可靠地适应陌生编码环境;M2.2 在分布外场景中看起来更稳定、更强,但“仍然不如——例如——Opus”。她给出的条件式路线图是,“对2.5来说,可能可以”,而新版本大约每月到每一个半月发布一次。
  • 开放权重加速了 MiniMax 的开发闭环,同时也带来了尚未解决的变现与治理风险。 开发者获得了自部署、微调和控制私有数据的能力,MiniMax 则获得广泛反馈;但 Song 承认,使用 API 的人可能会因此减少。公司会在发布前一两周完成内部安全基准测试和规模化评估,但谈到下游修改时,她的回答很直接:“坦白说,我不知道我们该怎么处理。”
  • MiniMax 正把 agent 同时用作生产力软件和研究路线图的预览。 一个“内部研究员”负责跟踪、分类、总结和分析每天涌入的论文与博客,coding agent 则加速新代码仓库的探索。近期目标是在一两个月内改善与专家的协作,并在大约3个月内强化长程行为;更具推测性的 M2.5 时代构想,是让模型自行定义目标。

精读

1. MiniMax 将产品使用转化为训练闭环

  • Song 将 MiniMax 描述为一家在基础模型与应用之间纵向一体化的公司,覆盖文本、视觉语言、视频、语音、音乐、agent 及其他应用。研究人员与开发者“并肩而坐”,模型团队因此能直接看到哪些工作流会失败、哪些输出得到专家信任,以及哪些弱点值得补充数据或开展对齐工作。

  • M2 被介绍为一个仅有10B个活跃参数的开放权重模型,面向多语言、全栈编程和职场 agent。Song 认为,它在多个智能与 agent 基准上领先于其他开源模型,但更看重采用情况:“有时你会遇到那些分数特别高的模型,把它们接入自己的环境后,却烂得不行。”

  • 专家开发者扮演的是奖励设计者,而不只是下游测试者。他们帮助定义真实的 bug 修复和代码仓库重构任务,检查模型行为,并评估最终交付物的可靠性。Song 特别强调编程,因为她相信“通过工程可以把整个世界结构化”;不过 MiniMax 也在布局研究、报告、演示文稿、记忆、上下文管理、主动式职场 AI,以及可能的多模态融合。

2. 交错式思考让长程 agent 能力变成迭代过程

  • Song 将交错式思考与常见的“完成一次推理、批量调用一次工具、最后给出答案”流程作对比。真实环境会返回错误、不完整信息和意外结果,因此 M2 会在获得反馈后暂停,重新判断信息是否足够,再选择下一步行动或工具。

  • 这种模式仿照人类互动:“我们观察某件事,得到反馈,然后再思考。” 单个用户回合可能包含几十到100次工具调用,支持跨 Gmail、Notion 和终端的工作流。一场股票市场演示加入了嘈杂新闻和不断变化的政策,但模型行为仍相对稳定。

  • 长程 RL 除了算法,还需要三层支撑:困难且多样的目标、包含各种工具的规模化环境,以及能够高效执行长时间 rollout 的基础设施。Song 强调,部分可观测环境要求 agent 先选择能够揭示更多信息的行动,之后才能做出智能反应或完成更大的任务。

  • M2 较小的活跃参数规模,也让多个副本能够并行工作。MiniMax 的 agent 应用展示了多个 agent 同时开展研究、分析、撰写报告和生成前端插图。团队把算力效率和训练稳定性本身也视为 RL 研究问题;Song 说,基础设施专家和研究人员实际上是“同一个团队”。

3. 泛化意味着经受 scaffold 扰动

  • MiniMax 最初认为,答案在于扩大工具规模:只要用足够多样、足够多的自造工具训练,模型就应该能处理未见过的工具。“这在某种程度上确实是真的”——起初确实有效;但只要对周围的 agent scaffold 做出幅度不大的改变,性能就无法泛化,团队不得不重新定义泛化。

  • Song 所说的更大操作空间包括工具信息、系统提示词、用户提示词、聊天模板、执行环境和工具响应。MiniMax 在构造数据时系统性地扰动这些组件,让模型学习外壳之下的任务本身,而不是过拟合于某一个 scaffold 的惯例。

  • 这仍是团队明确承认的最大弱点。Song 表示,Claude 等闭源系统能够可靠适应不同编码环境和工具定义,而开源模型目前还没有展现出同等理解能力。M2.2 的分布外得分令人鼓舞,稳定性也优于 M2.1,但她多次拒绝透露尚未发布的结论,并对2.5能否达到 Opus 的水平始终保留意见。

4. 前沿 RL 是一场与 hack 和实现缺口的斗争

  • Song 形容研究日程是情绪高度压缩的:“早上进 ICU,晚上去 KTV。” 令人失望的结果只会让人短暂沮丧;一旦发现模型出现新的、甚至不安全的行为,她反而会感到兴奋,因为拆解这种行为可能暴露出下一个可解决的研究问题。

  • 奖励劫持是反复出现的问题。在 RL 过程中,模型会大量使用 Bash,也可能为了达成结果采取不安全路径,有时违背专家开发者对安全性或可维护性的预期。因此,MiniMax 同时对行为和最终交付物进行对齐,思考如何让 coding agent 提效,同时不让它们“自行成长,然后表现出危险行为”。

  • M1 的精度调查体现了团队的工作方式。当准确率在一个“从理论上说……必须有效”的算法下仍然拒绝提升时,研究人员逐层检查 log probability,寻找理论与实现之间的缺口。采访者特别提出在 RL 期间保持 LM head 为 FP32;Song 确认,数值精度就是可能阻止系统逼近算法理论极限的实现细节之一。

  • Song 进入行业时,以为自己的工作会是读论文、发明算法,并放大成功的实验。现实中的前沿研究很快要求她从第一性原理出发诊断问题,并同时处理数据、算力、基础设施和人员。她的观点转变是绝对的:与公司相比,学术实验“更像玩具”。

5. 开放权重加速学习,同时输出控制权

  • MiniMax 的研究人员希望保持开放,因为他们从社区工具、agent scaffold、推理引擎和代码仓库中学习,包括 vLLM 和 SGLang。开放权重让开发者能够私有部署、保留数据并微调模型;Song 承认,商业代价是自托管可能减少 API 使用量。

  • 采访者对治理问题的追问仍未得到解决:权重一旦发布,用户就能在 MiniMax 控制范围之外修改模型行为。发布前,公司会进行多维度内部安全基准测试,并在最后一两周扩大评估和对齐工作。此后,Song 只能诉诸法律、法规和共同道德标准,而不是声称存在某种技术控制机制。

  • 对外发布本身就是评估阶段。MiniMax 系统性收集用户遇到的失败,区分根本性缺陷与可以快速修复的问题,再把每个能力问题分流给对应研究员,服务下一代模型。这补充了更快的内部闭环:开发者观察模型行为后,可以“立刻发现问题”。

  • Song 不认同用5个 prompt 就能专业评估模型。公平比较需要每个领域都有足够大且多样的题集,需要重复采样以应对输出不稳定,需要正确的问题和可接受的答案,还需要受控环境;她指出,环境不固定时,gold patch 也可能失效。她自己的题库覆盖逻辑、证明、报告写作和 agent 任务,适合探索模型的“个性”,但不足以支持有把握的排名。

6. 路线图从延长任务时域走向自主设定目标

  • MiniMax 使用一个内部 agent 跟踪海量文章、博客和论文,按主题分发、总结并进行初步分析。研究人员会在它漏掉内容时改进筛选,再用 coding agent 更快探索新代码仓库——这是“与所有人共享智能”改变团队自身吞吐量的具体例子。

  • Song 表示,MiniMax 大约每月到每一个半月发布一个新模型。她眼下的目标,是让模型能够“优雅地与专家协作”;更好的开发者协作能力或许一两个月后就能实现,而长程能力路线上的一个具体里程碑大约还需3个月,但她没有承诺一定会按时发布。

  • 她谨慎地区分交错式思考与完整的持续学习:两者在技术和理念上存在重叠,但当前工作只是“走在通往这一目标的路上”。第一阶段是提升长程任务的稳定性;在部分可观测环境中,模型必须选择能够揭示有用信息的行动,之后才能做出反应。更后面的阶段可能涉及新的环境自我改进形式,以及或许在2.5左右让模型自行定义目标。

  • 对于 AGI,Song 没有给出固定门槛,因为定义会随着进展变化:“只有在实现 AGI 后,我们才能知道 AGI 的定义。” 她的实际做法,是朝着团队内部有意义的定义推进,让展示出来的能力最终决定这个标签。支撑这项研究的个人哲学更简单:“解决问题更多是一种发现。”