先锋 趋势 方法 投研 作者
[NeurIPS最佳论文] 用于自监督强化学习的1000层网络——Kevin Wang等,Princeton
返回节目精读

[NeurIPS最佳论文] 用于自监督强化学习的1000层网络——Kevin Wang等,Princeton

摘要

  • 这篇论文的核心主张不是“把强化学习网络做大”,而是让深度与真正具备扩展性的自监督目标结合起来。 传统基于价值的强化学习依赖噪声大、带偏差的时序差分目标;团队转而对未来状态是否属于同一条轨迹进行分类,利用不依赖人工设计奖励的表征。Benjamin Eysenbach提醒说,单纯把大网络加到“PPO、SAC或你喜欢的强化学习算法”上,会错过论文的真正结论。

  • 性能来自一套配方,而非某个单一架构技巧。 朴素地增加深度会让结果“完全退化”,单独加入残差连接或其他改动也作用有限;只有它们与对比学习目标结合后,才出现性能“突然飙升”的临界深度。这种交互关系挑战了“深度强化学习本身无法扩展”的传统认知。

  • 相比增加宽度,增加深度带来了明显更好的参数经济性。 以4个宽度为256的隐藏层为起点,增加深度时参数量大致线性增长,而逐层加宽会让参数量近似二次增长;同时,深度曲线的改善速度也更快。多数环境在约64层时就接近饱和,因此实际建议并不是自动部署全部1,000层。

  • 数据仍是决定性输入:只有在状态转移达到约5000万次后,性能才出现大幅跃升。 基于JAX的GPU环境让研究人员能够并行采集数千条轨迹,并在数小时内生成数亿个时间步。即使是1,000层实验也能放进单块80GB H100,这让论文展示的规模相对容易复现,但分布式扩展仍未被探索。

  • 机器人可能是一个应用方向,但讨论将其定位为研究路径,而不是已经验证的部署结果。 相比模仿学习需要“多到离谱的数据”和人类示范,以目标为条件的自监督强化学习或许能让机器人在“完全没有人类监督”的情况下学会有意义的任务。

  • 下一阶段的扩展前沿,是把深度、宽度、批量大小和更低的推理成本结合起来。 更大的网络似乎解锁了更大批量带来的收益,而浅层价值型强化学习无法利用这些收益,这意味着过去批量扩展失败,可能只是因为模型容量不足。Tomasz Trzcinski提出的“深教师、浅学生”方案——先训练大模型,再为部署进行蒸馏或剪枝——已经被列为团队明确的后续方向之一。

  • 从概念上看,这套方法模糊了强化学习、表征学习与世界模型之间的边界。 它仍然是一个演员—评论家式的目标条件算法,但代码中没有任何一行是在说“在这里最大化奖励”;对同一轨迹与不同轨迹进行分类,与下一状态预测和隐式世界建模存在相似之处。Eysenbach更广义的判断是,智能系统可能来自“借鉴所有这些领域的洞见”,而不是固守严格的学科边界。

精读

1. 深度强化学习的扩展异常,让一次怀疑主义押注值得进行

  • Kevin Wang在Princeton本科期间参加Benjamin Eysenbach的独立研究研讨课时启动了这项工作,这是他最早接触机器学习研究的经历之一;Ishaan Javali及后来的合作者也参与其中。项目源于一个刻意保持基础的问题:为什么语言和视觉模型已经扩展到巨型网络,最前沿的强化学习算法却仍在使用两层MLP?

  • Eysenbach此前的判断很直接:“我以前试过,行不通。别人以前也试过。”按他的说法,他的职责是“选择押注方向”;这次押注之所以值得尝试,是因为Michał Bortkiewicz在前一年搭建了基础设施,让实验成本相对可控。

  • 更广泛的深度学习革命提供了正面先例:更深的网络在其他领域一次次被证明有效。强化学习,尤其是从零开始训练的智能体,反而显得异常;在这个领域,“深度”过去通常意味着两层、三层或四层,而不是数百层或1,000层。

2. 真正具备扩展性的成分是未来状态分类,而不是奖励

  • Ishaan将团队的替代方案描述为自监督、目标条件强化学习:学习状态、动作与未来状态的表征,把同一条轨迹中的样本拉近,把不同轨迹中的样本推远。由此得到的智能体无需人工设计的奖励信号,也能抵达目标。

  • Eysenbach给出的因果解释很具体:标准Q-learning要对“虚假、嘈杂且带偏差”的时序差分误差进行回归,而这套方法则将问题转化为判断某个状态是否位于同一条未来轨迹上。分类、交叉熵和表征学习,恰恰是语言与视觉领域已经实现扩展的目标形式。

  • 走到这一步并不容易。朴素增加深度会损害性能;单独加入残差连接无法修复问题;只调整某个局部组件也没有效果。只有架构与目标函数结合后,才出现离散的“临界深度”:每增加一倍深度,性能不再平滑改善,而是成倍增长。

  • 一位合作者强调,架构本身并没有“重新发明轮子”;它借鉴了既有的残差网络与强化学习架构,包括DrQ、SimBa和SimBa-2。结果来自“架构与目标函数的融合”,而不是某个单独提出的新模块。

3. 1000层的标题背后,是一条更克制的扩展规律

  • Eysenbach反驳了对标题最简单的解读:“哇,大网络真好。”论文并没有证明实践者可以直接把深度加到PPO或SAC上;它同时要求架构发生变化,并采用不使用奖励的目标函数。

  • 这也让该方法是否属于强化学习变得模糊。它仍然是一个演员—评论家式的目标条件算法,但Eysenbach说,它看起来更像自监督学习,而不是传统强化学习:“归根结底,这是一种强化学习方法吗?我不知道。”

  • 参数效率明显偏向深度扩展。以4个宽度为256的隐藏层为基线,参数量随深度大致线性增加,随宽度则近似二次增长,因为加宽一层也会扩大下一层的输入维度。在参数量相当的情况下,增加深度的曲线快速上升,而增加宽度只能带来更慢的改善。

  • 更深的网络仍然会带来延迟成本:规模足够大时,层数翻倍可能让前向传播时间大致翻倍。不过论文讨论指出,许多环境在约64层时就已接近完美表现,而真正的瓶颈可能是智能体与环境之间的数据采集,而不是网络推理。

4. 发生性能跃迁,既需要足够数据,也需要足够容量

  • 实验使用了由JAX加速、运行在GPU上的环境,可同时采集约1,000条轨迹。这构成了一套扩展测试平台:数亿个时间步可以在数小时内生成。

  • Michał强调了图表中一个关键限制:“只有当我们跨过大约5000万次状态转移时,才会看到这种巨大的性能提升。”因此,只有深度而没有足够经验并不是完整配方;“数据在这里至关重要”。

  • 深度似乎也解锁了批量大小的扩展。传统基于价值的强化学习从更大批量中往往获益有限,但团队发现,成功的深层网络能够利用更大批量,这支持了一种假设:过去的失败可能源于网络太小,无法吸收额外数据。

  • Michał用语言模型和世界模型作了类比:与其预测唯一的下一个世界,不如生成可能的世界并对其分类,就像随着证据增加不断收窄对手的扑克牌型范围。讨论对这一平行关系保持谨慎:二元未来状态分类可以类似于一种不预测下一帧的隐式世界模型,而Tomasz认为后者的维度更高、复杂度也更大。

5. 机器人与蒸馏,构成超越基准测试的路径

  • 机器人被讨论为一个潜在应用,而不是已经展示过的迁移结果。模仿学习需要在大量人类监督下收集“多到离谱的数据”;目标条件强化学习则可能训练智能体,在“完全没有人类监督或示范”的情况下完成有意义的任务。

  • Tomasz提出了“深教师、浅学生”的部署思路:利用深度提升训练能力,再进行蒸馏或剪枝,因为训练和推理不必采用同一套架构。团队网站已将其列为未来方向。

  • 讨论还提到,Michał称其在JAXRL的目标条件强化学习上取得了明显领先的当前最佳表现,同时强调了一个开放问题:能否用更小、更高效的模型保留这项性能。

  • 后续工作覆盖多个抽象层级。Tomasz描述了如何把较短的子行为拼接成更长的测试时行为;Ishaan表示正在探索视觉—语言—动作模型及表征应用;Michał则介绍了冻结预训练VLM、加入动作专家,并采用分层规划:由运行较慢的大模型输出高层动作片段,再交给更快的控制器执行。他还指出,相比文本和工具调用,动作输出得到的产业关注仍然较少。