Verifiable Rewards
观点集合
🔬 可验证奖励驱动的 RL,但验证器是一间实验室——Lila Sciences
- 🗓️ 日期:
2026-07-16| 🎙️ 节目:Latent Space
Lila 将受控实验变成可验证训练数据飞轮,已生成覆盖生命科学、化学和材料科学的10万亿实验验证推理 token。体内 CAR-T 项目据称由2至3人用6个月完成,远短于约6年和1亿美元的对比,但放大生产、监管、仿真到现实的鸿沟及5–6%的 FLOPs 利用率仍是风险。
查看访谈对话精读提要
Lila 的核心押注是:受控实验可以成为 AI 的下一座互联网级训练语料库,而自然本身提供可验证的奖励。 互联网曾是“我们开采的化石燃料”,科学强化学习则让模型提出实验、观察现实,并生成更好的训练数据。真正可能构成公司护城河的是由此形成的飞轮,而不是某一种药物或材料。
这套操作系统优化的是信息增益和迭代速度,而非最大化机器人吞吐量。 仪器组成一张图,由类似 PCI 总线的传输层连接;每个动作都是一次 API 调用,执行者可能是“机器人手臂”,也可能是“人手臂”。Lila 自称“token 生成最大主义者和灵活性最大主义者”:下一次实验必须让模型学到有价值的东西,而不只是增加一个低信息量样本。
早期结果显示模型能力确实得到提升,但“愚蠢”和“新颖”之间的界线仍被刻意保持开放。 在表达和基因编辑任务中,Lila 称模型零样本表现“达到约 80%”,而人类为 0%;其提出的非铂族金属电催化剂从无聊到看似愚蠢,最终成为表现最好的候选物。这种上行空间伴随着严格复测、环境遥测、工具限制,以及承认有信息量的假阳性也可能浪费时间。
最清晰的商业验证是:一个体内 CAR-T 项目由2至3人用6个月完成。 对比项目大约耗时6年、此前投入1亿美元;Lila 称其“monster” UTR 的表现约为 Moderna 和 Pfizer 参考值的10倍,在非人灵长类动物的 B 细胞清除和持久性上也优于 Capstan 数据。Lila 不会负责临床试验,而是把这类验证点转化为收取费用并分享上行收益的“零 FTE 初创公司”合作模式。
跨科学领域泛化是其经济学 thesis,而不是品牌包装。 Lila 已生成10万亿个由模型产出、经实验验证的推理 token,覆盖生命科学、化学和材料科学,并称其通用模型往往胜过领域专用替代方案。在小分子药物发现中学到的化学能力,已经迁移到金属有机框架等应用。Rafa 认为语言不必成为每一种科学模态的必要表征,而 Andy 强调结合工具使用的 token 化推理。
物理扩展目标是一座经济学上类似云基础设施的全自动实验室。 当前系统包括定制驱动程序、被刻意放弃保修的设备,甚至还有运行 Windows 95 的视觉语言模型;终点是 24/7 运行、高密度垂直堆叠、自主运输,以及最大化单位体积产生的 token 数量。一座10万平方英尺的马萨诸塞州设施只是中间步骤,目标实验室“应该让人感觉像数据中心”。
最大风险出现在发现之后,以及仿真、硬件、监管和经济学的交界处。 一位嘉宾提到,只有约5–8%的临床项目能从 IND 推进到获批;材料还需要放大和验证,材料仿真数据往往无法预测现实,而 Andy 称强化学习工作负载的模型 FLOPs 利用率只有约5–6%。Lila 更克制的承诺是“让骰子的装载尽可能充分”,而不是消除后续风险;团队也反复承认,其激进的硬件和客户导入假设可能失败。
🔗 原始收听与视频来源: 🔬 可验证奖励驱动的 RL,但验证器是一间实验室——Lila Sciences