先锋 趋势 方法 投研 作者
🔬生物安全是一场 AI 军备竞赛——Eric Nguyen(Radical Numerics CEO)
返回节目精读

🔬生物安全是一场 AI 军备竞赛——Eric Nguyen(Radical Numerics CEO)

摘要

  • Radical Numerics押注基因组语言模型将从读取 DNA 走向设计 DNA,并在同一套技术路径中内置防御能力。 Eric Nguyen梳理了从 HyenaDNA 的百万 token 上下文,到 Evo 的生成式基因组学,再到 Omni 的任务对齐。由于能够设计生物功能的模型也可能识别生物功能,公司确立了覆盖科学发现、人类健康和生物安全的“双重使命”。

  • Omni所称的突破不只是规模,更在于把基础模型变成可用基因组系统的后训练。 Evo 和 Evo 2 展现了广泛能力,但在一些任务上仍可能输给专用模型;Omni通过任务专属格式、特殊 token、监督样本和问答结构,回答“某个突变是否致病”这类实际问题。Nguyen称,这推动Omni在变异效应任务上达到当前最先进水平,尤其是在长距离、非编码 DNA 领域。

  • 最具价值的切入口,是人类基因组中约98%的非蛋白编码区域——传统解读在这里最薄弱。 蛋白编码区域只占基因组约1.5–2%,而大量疾病相关变异位于调控区域,其影响取决于具体上下文。Omni比较野生型与突变序列的似然,将差异转化为“意外因子”,再通过对齐训练输出可以直接使用的预测。

  • Radical最具推测性的设计结果,把生物优化轨迹视为基因组版本的链式思考。 研究给模型输入按适应度从低到高排列的 RNA 适配体,模型延续这一轨迹,生成了评分高于训练样本的合理序列。Nguyen反复强调,这一结果仍需湿实验验证;但他认为,该范式可以延伸至抗菌噬菌体和具有选择性稀土结合能力的蛋白质。

  • 公司提出的技术优势,不是孤立的蛋白质结构,而是更长的生物学上下文。 Nguyen将 DNA 称为“物理世界的印记”:上游调控区域、邻近基因、物种身份和进化历史,都可能约束哪些设计是合理的。这一框架支持建立覆盖 DNA、RNA、蛋白质、表观基因组学、代谢组学、最终延伸至自然语言的统一模型,而不是一组单模态工具。

  • 生物安全既是使命承诺,也可能成为产品类别,但双方并未假装筛查问题已经解决。 Radical将防御拆分为检测、归因、对策和政府层面的威慑;其模型的目标,是即使序列不再匹配已知病原体数据库,也能识别功能性危险。RJ的反驳很现实:在数十亿条序列的规模上,误报可能阻碍正常研究;而与软件漏洞不同,“我们的基因组是固定的”,无法简单打补丁。

  • 不过Nguyen仍认为这是一场“军备竞赛”,因为设计能力正在进步,而生物防御明显落后。 近期更近的风险可能是意外释放,但国家生物武器项目在战时仍是重大担忧。他明确指出的瓶颈包括 GPU,以及一个文化层面的瓶颈:科学家需要领域专业知识,同时还要保有足够想象力,去挑战根深蒂固的工作流程。

精读

1. 基因组语言模型学会 DNA 中写入的语法

  • Nguyen将基因组语言模型(GLM)定义为:以 DNA 字母而非文字作为训练数据的大语言模型。Radical Numerics的基础押注是,AI可以“读写 DNA”,从而揭示“生命织物”中的规则——而科学家目前仍只理解其中一部分。

  • 第一阶段目标是功能预测:给定一段未经处理的序列,推断其调控效应及其他生物学属性。由于不同 motif 可能跨越很远距离发生相互作用,有用的模型不能只捕捉局部模式,还必须学会理解连接基因组远端区域的长距离“语法”。

  • HyenaDNA用基于卷积的 Hyena 算子替代传统 attention,解决了这一约束。它可以处理最长100万 token 的上下文——当时在语言模型中已属异常长——并证明 DNA 模型能够保留跨长序列的信号。Nguyen用“上下文腐化”类比聊天机器人输入变长后的性能下降。

  • 规模之所以重要,是因为早期基因组模型通常一次只能看到1,000–2,000个碱基,而即使是典型的人类转录本也约有3,000个碱基,完整人类基因组则约有30亿个。HyenaDNA建立了读取能力,真正更关键的问题是:同一套机制能否写出合理的生物学。

2. Evo将序列预测变成生成式基因组学

  • Evo的设计目标,是从预测功能进一步走向生成新的 DNA。Nguyen的论点简单但最初并不受欢迎:如果生成能力改变了自然语言模型,那么把生成引入基因组学,或许能让科学家探索实验室搜索和人类规则无法触及的设计空间。

  • DNA是跨模态共享的底层载体,因为 RNA 和蛋白质都由 DNA 产生。与其为每种模态分别维护生成器,Evo可以在统一序列框架内建模 CRISPR-Cas 这类多组件系统;其运行同时涉及 DNA、RNA 和蛋白质。

  • 在从自然样本中学习后,Evo被要求生成新的 CRISPR-Cas 系统,并产出了一个新候选,引发广泛关注,包括登上 Science 封面以及促成Nguyen随后发表 TED 演讲。原因在于,这一结果让“写 DNA”从概念变成了具体产出。

  • 此后,科学家展示了Nguyen所称的首个由 AI 从零创建的功能性基因组:一个噬菌体基因组。这成为“关键转折点”——它既证明了设计潜力、显示模型有可能创造自然界不存在的生物,也说明操纵生命底层载体的模型可能带来陌生的生物风险。

3. Omni把对齐方法论应用于生物学

  • Evo和 Evo 2 能力广泛,但专用系统仍可能在特定任务上胜出,尤其是人类遗传学。这留下了一个合理问题:“既然有这些更小、更专门的模型,为什么还要用一个巨型 LLM?”Omni就是Radical对这一可用性和性能差距的回答。

  • Nguyen区分了预训练与对齐。预训练通过下一 token 预测或掩码重建,提供“生成 embedding 的原始能力”;中间训练和后训练则教会模型用户真正想要什么,比如比较野生型序列与突变,并返回与疾病相关的结果。

  • Omni引入特殊 token、精选任务数据集、示范样本以及问答格式,用于标识请求执行的操作和预期输出。具体细节仍被有意模糊地称为“秘方”,但概念转变很清晰:科学家应该直接查询一个准备好的模型,而不是先提取 embedding、再训练另一个 head,最后单独运行回归。

  • Radical同时试验了任务专属 head 和单一统一 head。Nguyen表示,两者都可能在个别场景胜出,但战略方向是统一化:一个在 DNA、RNA、蛋白质及未来模态之间共享表征的模型,应能创造更多迁移和泛化机会。

4. 变异效应预测为Omni提供首个实际验证

  • 绝大多数单个 DNA 变化不会产生影响,但特定的替换、缺失、倒位或更大规模改变可能导致疾病。由于在约30亿个字母构成的基因组中,临床已知意义的变异只占很小一部分,患者经常拿到“意义未明的变异”结果,却无法获得致病原因。

  • 语言模型可以分别对参考序列及其突变打分,再比较两者的似然。Nguyen将这个比值称为“意外因子”:如果一个序列偏离人类遗传学中常见或保守的模式,可能更有致病性;但对齐训练在这一零样本信号之外,又加入了任务专属证据。

  • Omni声称最强的优势,出现在非编码及长距离调控区域。蛋白编码 DNA 只约占基因组的1.5–2%;其余序列帮助控制基因何时表达、表达强度如何,但这些区域的疾病效应在历史上一直更难预测。

  • 基准测试包括 Evo 2 和 Borzoi。Borzoi是一个监督式模型,直接将 DNA 映射到染色质可及性、基因表达等功能轨迹;Radical还将 Caduceus作为目标,Nguyen称其长期以来是“厨房水槽式”基准,因为它把领先方法与 SVM 结合起来。内部目标是击败总体结果,而不是挑选一个方便、较弱的比较对象。

5. 更好的基准既需要监督,也需要控制数据泄漏

  • Evo 2 的原始似然评分代表零样本基线。其他研究人员此前已经证明,对 Evo 衍生输出进行微调可以达到当前最先进水平;Omni则更进一步,把基准的结构和要求的答案格式嵌入中间训练与后训练。

  • RJ指出一个核心可信度风险:基准变异或几乎相同的序列,可能已经存在于大规模基因组预训练语料中。Nguyen表示,Radical会明确审查和整理数据,删除重复项及可能相似的基准序列,并执行生物信息学质量控制;但他没有在对话中提供量化的数据污染审计。

  • 医院系统和持有患者基因组的非营利机构已经提出需求,商业牵引正在显现。它们可能知道患者的表型,却无法识别究竟是哪一种 DNA 改变导致了疾病;Nguyen将尚未解决的意义未明变异,视为Omni最清晰的潜在诊断应用之一。

6. 生物学链式思考意味着学习一条优化轨迹

  • 自然语言中的链式思考依靠“展示推理过程”:中间 token 暴露通往答案的步骤,也为模型提供更多推理空间。生物学没有对应的文字,因此Radical测试了能否用逐步改善的序列充当中间步骤。

  • 该实验使用与实测适应度配对的 RNA 适配体。模型看到按评分从低到高排列的序列,其中一部分最佳样本被留作隐藏数据,随后模型被要求延续这条轨迹。它生成了合理的适配体,其中一些获得了高于训练样本的评分。

  • Nguyen谨慎界定了结果边界:“我们目前正在实验室中检测这些序列。”在湿实验完成前,这项实验只能说明模型可以外推评分模式,不能证明它已经生成了更优的实际分子。

  • 底层筛选过程提供了一个可复用模板。研究人员会生成规模巨大的文库——RJ估计其中一项实验涉及约10^11条序列——测量结合能力或其他表型,保留更优候选,进行突变并反复迭代;如果记录下这些中间轮次,模型或许就能在计算机中学习同样的渐进式优化过程。

7. 上下文是其在治疗和工业生物学中的优势所在

  • RJ提出尖锐质疑:设计单个蛋白质通常看起来是一个结构问题,在这类任务中,蛋白质专用模型应该更有优势。Nguyen承认,孤立结构设计不是Radical的天然强项;只有当生物体、基因组邻域、调控序列和进化来源实质性约束答案时,Radical的优势才会显现。

  • 在稀土提取领域,Radical正与一家国家实验室合作,设计能够结合一种目标稀土元素、同时避开其他元素的蛋白质。模型可以利用来源微生物以及相关基因上游的非编码区域作为上下文,生成合理变体,再通过比较测试其选择性。

  • Nguyen称 DNA 是“物理世界的印记”。目标蛋白只是其中一个组件;周围序列记录了它源自何处、如何受到调控以及发挥什么生物功能,使基因组模型能够以孤立结构模型无法做到的方式收窄设计空间。

  • 第二个应用是抗菌耐药性。设计出的噬菌体可能选择性杀死特定细菌菌株,而不是像传统抗生素那样发挥作用,解决Nguyen所称全球每年约200万例细菌感染死亡的问题;逐步增强的噬菌体基因组也可以适配链式思考式的优化框架。

8. 统一生物模型必须延伸到虚拟细胞之外

  • Radical公开的 Omni 工作重点放在人类,因为外界认为 Evo 和 Evo 2 在人类基因组嘈杂、重复且复杂的语法上相对较弱。但Nguyen描述的目标是覆盖“生命的所有领域”,包括与治疗和生物安全相关的原核生物及病毒。

  • DNA是首选基础,因为 RNA、蛋白质和其他分子状态最终都与 DNA 相连。适配体实验颇具启发性:模型预训练使用的是基因组和 DNA,只有在该任务中才接触 RNA,但它似乎把隐含的结构信息迁移到了新模态。

  • Nguyen认为,许多“虚拟细胞”项目过度聚焦 RNA 转录本。真正严肃的细胞模型应结合 DNA、转录组学、蛋白质组学、代谢组学、表观基因组学、染色质可及性和甲基化;Radical不想止步于细胞,而是要整合生物学中的“所有这些传感器”。

  • 自然语言目前还不是模型的模态之一,但Nguyen预计它最终会加入。他认为文本—图像和文本—视频的整合已经相对成熟;更难的配方,是在不丢失共同结构的前提下,把异质的生物学信号连接起来。

9. 长上下文从研究执念变成公司的起点

  • RJ询问,合成生物学设计如今是否需要约200万的上下文长度——这仍远低于30亿个碱基的人类基因组。Nguyen将这一差距视为仍在推进的研究前沿,而不是已经解决的扩展问题:更大的生物体需要架构、系统和硬件创新,而不只是再做一个开源模型。

  • 长上下文自Nguyen在 Stanford 攻读博士以来就是他的研究重点。他的团队甚至会沉浸在 GPU 实现细节中——“有人提到 kernels 吗?”是他对研究人员如何迅速投入长序列运算加速的调侃。

  • 首个由 AI 生成的噬菌体基因组并不需要人类基因组级别的上下文,其基因组只有约6,000个碱基对。病毒“效率极高”,但这一案例也限制了它能证明的范围:在一个异常紧凑的基因组上成功,并不能解决细菌或人类尺度的全生物体设计问题。

  • Nguyen曾花6个月询问 Stanford 科学家会如何使用生成的 DNA,得到的回答包括这个想法没用、无法验证,或者因为生物学规则过于嘈杂而不可能实现。但 Arc 的人同意为该实验投入 GPU;随后 Evo 的首个 checkpoint 在 ProteinGym 上证明了竞争力,尽管此前从未被明确告知什么是蛋白质。

10. 可解释性可能把模型内部转化为生物学发现

  • Evo意外的跨模态结果促使 NVIDIA 支持规模更大的 Evo 2 项目;Greg Brockman从 OpenAI 休假4个月后加入深夜调试,有时一直工作到凌晨3点。这段起源故事与其说是预先规划好的产品路线,不如说是一连串出人意料的能力,迫使团队进行实际验证。

  • Radical如今把机制可解释性视为生物学的潜在分支。模型将反复出现的结构压缩进权重、激活值和 embedding 中;检查这种压缩,可能揭示模型使用了哪些 motif 和长距离关系,包括科学家尚未明确表述的模式。

  • 早期目标从简单走向复杂:GC含量、重复序列、转录因子 motif,以及疾病多样性的表征。转录因子会结合 DNA 并改变基因表达,同时自身也由基因编码和调控,形成一个人类无法手动绘制完整图谱的组合系统。

  • Nguyen将模型表征中的疾病“景观”视为起点,而不是完成品。把可解释性扩展至数十种模态,可能将预测模型转化为机制发现工具,形成所谓“全是绿地”的空间;但本期节目给出的仍是可视化和假说,而非经过验证的新生物学定律。

11. 生物安全将同一套模型变成明确的防御体系

  • Radical的“双重使命”始于一个对称性:能够生成具备功能的序列,也应该擅长判断一条序列是否具有致病性。Nguyen认为,让自然语言模型拒答——比如聊天机器人拒绝讨论病毒——有用但不够,不能替代对生物学底层载体本身的检查。

  • 他将生物安全分为4层:检测与环境监测;判断威胁来自自然、意外还是人为工程;抗病毒药物或抗菌药物等对策;以及主要由政府负责的威慑。Radical计划集中在前三层。

  • 传统筛查会将排序后的序列与已知病原体数据库进行比较。这种方法可能漏掉全新的或经过刻意改造的对象:不同字母可能保留相同结构或功能,Nguyen以 Microsoft 的相关工作说明生物学中的“改写”。具备功能感知能力的模型,目标是在字面层面的相似性消失后,仍能识别危险能力。

  • 最近的部署场景包括 DNA 合成公司:它们可以制造客户提交的数字设计,并像送来“亚马逊包裹”一样返还实体 DNA。现有供应商已经会筛查订单,但Nguyen认为其工具通常不是 AI 驱动,而且可能不够可靠,因为主要还是把序列与已知样本进行比较。

  • RJ的反对意见仍然成立:覆盖数十亿条序列的筛查系统,需要异常优异的 ROC 曲线,否则误报会阻碍正常科学研究。Nguyen并不声称可以做到完美预防;“标准是改善”——为制造商、获许可实验室、监管机构和监测系统提供一项比精确序列匹配更强的起始工具。

  • 网络安全类比也会失效,因为人类拥有无法在每次漏洞利用后打补丁的“固定基因组”,而把打印出的 DNA 变成成功病原体仍然很难。Nguyen承认这些差异,但仍认为这“本质上是一场军备竞赛”:设计能力持续进步,攻击者不断适应,防御也必须持续前进。

  • 他的威胁模型既包括国家项目,尤其是战时项目,也包括研究人员在缺乏充分遏制措施的情况下操纵生物功能所造成的意外释放。他认为,近期意外事件可能更容易发生,因为 AI 降低了所需专业门槛并加快实验速度,增加了尝试总量。

  • 即便如此,Nguyen表示这一前景不会让他彻夜难眠,他仍然“更加乐观”。他相信健康和科学发现带来的收益显著超过潜在伤害,研究界和政策界也能够动员起来;Radical的目标,是在能力进一步扩大之前缩小防御差距。

  • 当被问及如果能移除一个瓶颈会选择什么,Nguyen给出了前沿实验室的标准答案——GPU——随后又给出一个文化层面的答案。深厚的专业知识可能让人对每一种新方法都感到悲观;Radical想要的是既有领域经验、又保有改变既有科学工作流程想象力的专家。

  • 他的结束语是,AI研究人员“不必在前沿技术和推动人类进步的工作之间二选一”。Radical Numerics的目标,是把生物学本身变成一个前沿 AI 问题,将架构、硬件感知优化、多模态建模和湿实验相关性结合起来,而不是把顶尖人才都投入另一个聊天机器人。