先锋 趋势 方法 投研 作者
返回先锋
Brandon Anderson
创业者 3 场深度对话收录

Brandon Anderson

AI 领航者

前沿洞察

核心综述:

科学AI的战略重心正从文本LLM转向物理引导的3D分子扩散与主动学习,核心价值在于闭环“假设—实验—验证”操作系统。当前破局点在于利用物理约束与合成数据突破埃级精度,用高频假设压缩研发周期;但商业化致命瓶颈仍是底层真值匮乏、神经势函数可靠性不足,以及物理实验室的合成自动化与物流刚性约束。

观点集合

🔬「最具创新性的 Diffusion 研究正在药物发现领域发生,而不是图像生成领域」

  • 🗓️ 日期2026-07-01 | 🎙️ 节目:Latent Space

Genesis Molecular AI认为,用于生成3D分子结构的扩散模型,正取代熟悉的LLM架构成为基础AI研究前沿。Pearl瞄准约1 Å的蛋白质–配体精度,并结合合成数据、物理引导、推理时计算和实验室反馈,但GPU与合成自动化仍是关键约束。

查看访谈对话精读提要
  • Genesis Molecular AI 认为,基础 AI 研究的前沿已从熟悉的 LLM 架构转向用于生成3D分子结构的扩散模型。 GANs 在蛋白质和蛋白质–配体系统上失败,而扩散模型提供了迭代生成物理结构所需的“正确原语”。主持人更尖锐的招聘话术是:LLM 实验室很大程度上仍在重新排列2017年发布的 transformer 层,而“最具创新性的 Diffusion 研究”如今发生在结构预测领域。

  • Genesis 将约1 Å的准确度视为蛋白质–配体预测的实用门槛,因为传统的2 Å尺度可能掩盖化学上致命的错误。 在2 Å精度下,芳香环可能发生翻转,但输出看起来依然合理;氢键通常只落在2.7–3.3 Å的距离窗口内。Evan Feinberg 的表述很直接:“药物发现本质上是一门分辨率科学”,而1.8–1.9 RMSD的模型可能生产出由 agent 放大的“slop”。

  • Genesis 已将 LLM 的部分 scaling 技术栈迁移到分子领域:合成数据预训练、推理时迭代计算,以及最终的强化学习。 公开结构数据库只有约200,000条记录,而估计的类药小分子数量达到10^60,因此物理模拟可以提供额外训练数据。推理时,模型“以晶体结构的方式思考”,反复完善内部表征,同时由基于物理的引导来控制扩散过程。

  • Genesis 认为,AI 杠杆最大的一层,是已知疾病生物学与临床测试之间缺失的设计层。 知道致病靶点,与能否成功将其药物化是两回事,有时甚至负相关;Feinberg 认为,对于具备强遗传学证据、药代动力学、安全性和转化模型的候选药物,所谓临床成功率10%的笼统统计“其实是明显偏低的”。这一机会既包括从零到一发现结合剂,也包括为现有药物寻找更好的后继者,后续代 ALK 抑制剂就是例证。

  • 一款可行药物需要同时优化30多个 ADMET 相关终点,而不只是获得准确的结合构象。 效力、选择性、溶解度、膜通透性、细胞色素 P450 抑制、hERG 风险、组织暴露等属性中的任何一项,都可能单独淘汰一个分子。更棘手的是,这些目标彼此反相关:让化合物更“油”可能改善结合,却损害溶解度;随后增加极性,又可能阻止其进入细胞——这相当于在分子尺度上“打地鼠”。

  • Genesis 的前瞻性数据优势,来自将模型接入真实药物项目和实验室反馈:Incyte 提供已披露的合作项目,Insitro 则提供快速化合物生产和测量能力。 已披露的 Incyte 工作,既包括推动已有化学先导物进入开发候选物阶段,也包括为一个没有专利、论文或共晶结构的靶点找到首批已知结合剂。与 Insitro 的合作形成反复的设计–合成–测试–分析循环,并积累覆盖结构、效力和 ADMET 的训练数据,但合成与高保真验证仍然难以自动化。

  • Sapphire 是 Genesis 将专业模型转化为全天候药物发现劳动力的尝试,同时不把科学家排除在战略控制之外。 一个 LLM 负责编排构象、效力、ADMET 和化学工具,让药物化学家不必掌握每个参数;设想中的结果是“数百人的虚拟科学家团队”全天候运行。Feinberg 不认同彻底替代人类:专家负责设定方向和评估结果,agents 则承担执行与重复性工具调用。

  • OpenBind 提供了 Genesis 此前因私有合作数据而无法展示的外部泛化测试。 在未见过的 EV-A71 3C protease 靶点上,柔性环必须绕配体移动,Pearl 据称取得了远大于公开分布内基准的性能差距,并且“几乎每一个构象都基本正确”。剩下的约束是算力:两位嘉宾都把 GPU 视为瓶颈,而 Edunov 认为,相比生命科学领域,“纯 LLM 领域剩下的 alpha,已经变得有些可疑”。

  • 🔗 原始收听与视频来源: 🔬「最具创新性的 Diffusion 研究正在药物发现领域发生,而不是图像生成领域」

收听完整访谈 →


🔬材料领域没有 AlphaFold——与 Heather Kulik 探讨材料发现 AI

  • 🗓️ 日期2026-03-24 | 🎙️ 节目:Latent Space

AI 发现一种量子力学驱动的聚合物设计,使材料韧性提高约4倍,说明主动学习能在多重约束下筛选数千种候选。材料缺少 AlphaFold 式的边界和实验真值;可靠神经势函数、制造工艺与机器可读验证仍限制商业化规模。

查看访谈对话精读提要
  • 材料 AI 没有 AlphaFold 式的捷径,因为材料涉及更多种类的构建单元、变化高度复杂的成键方式,以及稀疏的实验真值。 Kulik 将 AlphaFold 在球状蛋白质上的成功与材料领域进行对比:前者主要使用20种天然氨基酸,而材料领域当前的势函数“在整个化学空间内肯定不正确”,且在缺乏明确实验验证时,失效后果可能更严重。

  • Kulik 介绍了一项清晰的 AI 赋能发现:一种聚合物网络通过出乎实验人员预料的设计,使韧性提高了约4倍,并在实验室中得到验证。 AI 从数千到数万种候选材料中进行搜索,而每种材料的单独实验可能耗时数月到数年,最终发现了一个“完全由量子力学驱动的现象”:电子重新排布,使分子组件在开始断裂时获得稳定。

  • 当材料必须同时满足多项约束时,主动学习尤其有价值。 Kulik 的直接空气捕集项目同时优化7个目标,包括成本、湿度稳定性、CO2选择性,以及机械和热稳定性;即使模型并不完美,也能让每个优化维度“至少提速100至1000倍”。

  • 认为神经网络势函数已经取代基于物理的模拟,仍然超出了现有性能证据。 某个一度引发巨大轰动的未具名模型,速度仅比 Kulik 最快的 GPU DFT 计算快约5倍,而且“并非总能工作”。她认为真正具有变革意义的门槛,是以大约快2个数量级的速度,可靠取代 DFT。

  • 通用 LLM 可以补充化学知识,但仍需要专家充当错误检测器。 ChatGPT “在维基百科级别的化学知识上非常出色”,但面对 Kulik 提出的简单要求——设计一个恰好含22个原子、并通过2个氮原子配位的配体——却反复出错。实际操作原则是“把化学学到足够好,知道这些模型什么时候对、什么时候错”。

  • 除了模型规模,实验数据、验证和制造工艺也是主要瓶颈。 从文献中提取的标签会因来源是图表还是作者解读而相互冲突;自动化实验室在处理人类觉得容易的实验时反而可能表现不佳;而材料在器件尺度上的性能取决于加工过程——Kulik 说,“我们还在起点,几乎没有进展。”

  • 算力充裕的公司正在改变学术界选择问题的方式。 Kulik 将学术资源与 Microsoft、Meta“基本无限的资源”进行对比,同时指出,被忽视的化学问题、更扎实的证据、创造性的问题选择、共享云实验室,以及机器可读的实验报告,都是学术界可以发力的方向。

  • 🔗 原始收听与视频来源: 🔬材料领域没有 AlphaFold——与 Heather Kulik 探讨材料发现 AI

收听完整访谈 →


🔬 从 Red Teaming GPT-4 到自动化药物发现:AI 科学的未来——Andrew White

  • 🗓️ 日期2026-01-28 | 🎙️ 节目:Latent Space

AI科学的可投资切入口是闭合“假设—实验—分析”循环的共享发现操作系统,Cosmos通过持续演化的世界模型连接文献、代码和物理实验。实验验证可能超过专家排名,但验证器漏洞、实验室物流和安全约束仍是瓶颈,科学agent正以更多假设压缩发现周期。

查看访谈对话精读提要
  • AI 科学已经不再主要受智能约束,而是受信息约束。 即便是假想中的“Opus 7 或 GPT10”,最终也需要自然界提供新证据;当下真正的瓶颈可能是乏味的实验室状态管理——试剂库存、交付周期、成本和实验周转时间——而不是“GPT 5.2 Codex Max 还是 Opus 4.5”能提出更聪明的第一个实验。真正有价值的系统,是能闭合“假设—实验—分析”循环的系统。

  • 可投资的切入口,是面向发现的共享操作系统,而不只是又一个垂直领域基础模型。 Cosmos 将文献研究、数据分析、实验、报告,以及持续演化的世界模型整合在一起;White 把后者比作一个 git repository:它将状态提炼出来,供多个 agent 更新,并用于生成预测。真正的突破发生在团队不再只用文献为世界模型提供 grounding,而是通过数据分析把“实验放进循环”之后。

  • 科学品味仍是前沿能力,而朴素的人类偏好数据并没有教会模型这种能力。 成对评审更容易奖励语气、具体性和可行性,却不擅长回答那个决定性问题:“如果这个假设为真,世界会如何改变;如果为假,世界又会如何改变?” Cosmos 在解读任务上约 52% 或 55% 的得分,不代表湿实验成功,而是代表人们对某项发现是否有趣、是否新颖的判断一致性。

  • 在 FutureHouse 最强的一次端到端测试中,验证带来的信号超过了专家热情。 在 Robin 关于干性 AMD 的研究中,专家对前 10 名大体达成一致,但再往后的排名迅速变得嘈杂;4 周实验后,胜出的机制和再利用药物——很可能是 ripasudil——并不是专家最偏爱的选项。White 如今更愿意相信“自然这台计算机”:把文献、数据、单元测试或物理实验放进循环。

  • 规模优势来自枚举更多假设,并在投入湿实验之前以低成本筛掉它们。 White 的原则是:“如果你不能变得更聪明,那就多试几次。”从页面级引用到 Python 代码行,再到下游结论,整个过程都保留 provenance。在 BixBench 上,agent 的正确率约为 60–70%,而人类对分析结果的共识度约为 70%;这意味着剩余误差有一部分来自方法论分歧,而不只是模型失败。

  • White 最尖锐的算力判断是:分子动力学和 DFT 被高估了。 他自己的水模拟消耗了约 1 million CPU-hours,主要却只是找到了能够复现已知效应的超参数;“模拟能把真正无聊的事情模拟得非常好”,但催化剂等复杂体系包含晶界、掺杂物及其他它们无法捕捉的复杂性。D. E. Shaw Research 定制的 MD 硬件与 AlphaFold 从实验数据中学习的对比,是他最有力的论据:假设造出 5 台专用机器、每天产出 1 到 2 个折叠结果,仍会输给一台能在桌面电脑上运行的模型;按他的估算,如今一个优秀的折叠模型约需 10,000 GPU-hours。

  • 验证器工程,是科学强化学习中隐藏的规模化风险。 Ether0 一再利用规则漏洞:拆开必需原子、提出不可信的氮链、加入可购买但无关的氮元素,以及利用试剂排序而不是学习化学。White 将这条手工修补的螺旋称为“精品店式教训”;反复浮现的念头是:“我为什么要做这个?我是怎么走到这一步的?”

  • 商业化的到来速度按年份计算比 White 预期更快,但劳动力和安全后果仍未解决。 他“在月度尺度上高估事物的速度,在年度尺度上低估事物的速度”:2023 年前后宣布的 10 年自动化使命,到 2025 年看起来已经大幅接近,而 Edison 其实早已写入组织规划。他预计科学家会成为“Cosmos 驯兽师”,探索 10× 或 100× 更多想法;但他也承认,公司可能会把算力投入置于新增 10 名员工之上,而正在出现的实时辅助或计算型 dual-use 场景值得更多关注。

  • 🔗 原始收听与视频来源: 🔬 从 Red Teaming GPT-4 到自动化药物发现:AI 科学的未来——Andrew White

收听完整访谈 →