先锋 趋势 方法 投研 作者
返回先锋
Nicholas Carlini
研究员 2 场深度对话收录

Nicholas Carlini

Google DeepMind · 研究员

前沿洞察

Nicholas Carlini 战略研判综述

大模型虽在“为世界建模”,但本质仍脆弱不堪,对抗训练的局部收敛绝非安全,最简攻击即可击穿梯度遮蔽与安全对齐。开放权重的危险清除尚未攻克,单纯依赖内在防御已彻底失效;唯一可行路径是假定模型必被攻破,转向构建外部动作约束、多层异常检测与动态红队的纵深防御。同时警惕“效率幻觉”:AI 虽能提升编码生产率,却也在系统级放大安全债务。治理与工程必须告别通用能力神话,直面非对称对抗的现实成本。

观点集合

对抗性思维:击败 AI 防御——Google DeepMind 的 Nicholas Carlini

  • 🗓️ 日期2025-02-27 | 🎙️ 节目:The Cognitive Revolution

Carlini指出,对抗训练即使保住50%–70%准确率,仍不等于安全;攻击者拥有后手,并能用最简单的损失函数击穿梯度遮蔽。开放权重模型的能力控制和危险知识删除仍未解决,现实防线只能依靠分层检测、外部动作约束与人工红队,同时承受误报和效用成本。

查看访谈对话精读提要
  • 图像分类器防御提供的是机器学习精度,而不是安全级可靠性。 对抗训练面对训练时使用的攻击类型,通常能保住约50%–70%的准确率,这相较于从零起步已是实质性进展;但在实际运行中,70%的准确率意味着攻击者“试4次,大概率有1次成功”。这解释了为什么分层控制和外部约束仍然重要。

  • 攻击者的结构性优势,既来自更低的成功门槛,也来自后手优势。 Carlini 将大多数技术攻击归结为两个选择——损失函数和优化器,并认为“最简单的目标通常最好”,因为可调试性胜过数学上的优雅。防守方必须在部署前预判大量攻击;攻击者则可以观察眼前的具体系统,利用其精确的损失地形,把6个月时间投入到唯一重要的失效模式上。

  • 许多所谓全新的防御,只是在把梯度变得丑陋、归零或难以追踪。 蒸馏技术一度看似稳健,是因为数值饱和让其损失“实际上恒等于零”;改用浮点数或重新缩放 logits 后,信号便恢复了。RepNoise 认为噪声激活阻止了有效微调,而 TAR 则针对弱的一步攻击训练,因此容易被多步优化击穿——调整学习率、随机重启并加入 warmup 后,“深度学习接管一切,剩下的都很容易”。

  • 开放权重模型的安全控制在技术上仍未解决,这使未来模型能力成为发布风险的核心变量。 Carlini 把永久受限的模型比作一把能建造有用东西、却不知为何不能用于7种危险用途的锤子:一旦用户掌控工具,工具通常不会保留这种区分。他仍倾向于开放源代码,因为开放模式历来有利于安全,也能限制权力集中;但他承认,未来若出现一个能攻破政府的“魔法盒子”,答案可能需要改变。

  • 删除危险事实或训练数据,并不能可靠地删除危险能力。 记忆高度依赖重复:GPT-2 的例子可能在一份文档中出现约20次,并经过约10个 epoch,即约200次暴露;但模型会抓住某些序列、忽略另一些序列,原因始终没有令人满意的解释。更根本的是,一个具备通用能力的模型可以在上下文中从教材重新学会被删除的生物学知识,就像据报道 Gemini 从上下文中的一本稀有语言书籍里学到足够内容,并回答练习题一样。

  • 现实路径是在易错模型周围构建纵深防御,并明确承受效用成本。 外部软件可以无论模型怎么说,都禁止代理把秘密输入 input type="password" 字段;跨多层部署检测器,则能让规避行为逐步损害任务表现。这些控制仍会面对误报疲劳、自定义界面和陌生攻击,因此实际技术栈更像是人工复核、外部动作约束和分层检测的组合,而不是单一的对齐技术。

  • AI 还不能自动完成 Carlini 式的安全研究,因为难点在于从混乱系统中隔离真正的漏洞。 如果把防御改写成一份干净的20行作业题,模型可以发起攻击;但把它放进一个约1,000行真实代码组成的陌生仓库后,模型就会失败。“安全的核心”是剥掉具有说服力的故事,找到唯一真正产生后果的机制。因此,人类研究者和红队仍然有价值;攻击自动化则是一个双用途前沿,如果未来几年能力大幅提升,Carlini 会重新评估它。

  • 🔗 原始收听与视频来源: 对抗性思维:击败 AI 防御——Google DeepMind 的 Nicholas Carlini

收听完整访谈 →


语言模型正在“为世界建模” [Nicholas Carlini]

  • 🗓️ 日期2025-01-25 | 🎙️ 节目:Machine Learning Street Talk

Carlini 的实际判断是,必须围绕仍然脆弱的模型设计安全系统:下一个 token 预测能够重建棋局状态,但分布偏移仍会击穿能力,普通攻击者也能利用 ML 失效。当前模型让他的编程生产率在 N=1 结果中提高约 50%,却可能生成不安全代码并放大安全债务;漏洞披露规范和通用能力声明的可信度仍未解决。

查看访谈对话精读提要
  • Carlini 的基准情景不是打造完全稳健的模型,而是围绕未来可预见时期内仍“极其脆弱”的模型设计安全系统。 传统安全体系本就容忍不完美,但 ML 还没有发展到“街上随便一个人”都无法运行现成代码、迫使系统任意失效的程度。实际含义是,系统设计不能只依赖模型本身。

  • GPT-3.5 Turbo Instruct 下棋让 Carlini 相信,仅靠下一个 token 预测,也能在没有明确棋规或围棋专用自博弈强化学习的情况下,重建出异常丰富的内部状态。 仅根据着法记谱,它几乎总能走出合法棋步,而且往往质量很高,说明“内部必然存在某种准确建模世界的东西”。但离奇的棋局历史会诱发离奇的下法:基础目标是模仿数据,而不是争取胜利。

  • 围绕模型是否“推理”的争论,掩盖了一个更有助于决策的问题:哪些行为能在什么条件下保持。 怀疑论者通常把语言模型排除在外,AGI 倡导者则预测到2027年模型将取代人类工作,双方的定义都高度可预期。Carlini 转而测量输入—输出行为,并指出,棋力会在陌生记谱法下崩溃,正如分布偏移一直以来都会击穿 ML 系统一样。

  • 后训练让潜在能力更容易被诱导出来,但也可能损害投资者误以为等同于能力的属性。 Carlini 回忆,GPT-4 的一份报告显示,基础模型校准度很好——一个答案若有30%的概率为真,实际约有30%的概率正确——但后训练把这种校准“搞乱了”。指令遵循能力大幅提升,但模型可能只是看起来更聪明,并没有学到多少新东西。

  • Carlini 报告称自己的编程生产率提高了约50%,并明确将其视为一个 N=1 的结果。 对专家程序员而言,当前模型可以成为代码、API 和陌生语法之上的更高层接口。他会在任务大约有50%成功概率时先问一次,确认方向,再自行补完剩余错误:“95%的解决方案仍然只是95%的解决方案”,但修好最后5%可能带来“20倍的性能提升”。o1 甚至在2分钟内解决了一道动态规划题,代码速度是他自己版本的10倍。

  • 这种生产率提升可能会叠加安全债务,因为模型会复现常见漏洞,同时扩大能够交付软件的人群。 Carlini 见过模型生成本应直接调用 API 的加密代码,也见过容易受到 SQL 注入攻击的数据库代码。他担心未来“代码量增加10倍”,但安全专家不会同步增加10倍——只要常见路径能跑通,不安全的部署就会继续推进。

  • 披露实践仍是一个悬而未决的运营风险,因为部分 ML 缺陷是可以打补丁的软件漏洞,另一些则更像长期存在的科学性漏洞。 一项模型窃取 API 弱点适合90天的协调披露流程;对抗样本则不适合,因为研究人员已经攻击这个问题10年,再多90天也无法解决它。Carlini 预计“1到2年内”会形成更清晰的规范,但目前还没有定型框架。

  • 模型 API 无法完全保护专有架构,基准测试领先也不能可靠证明通用能力。 Carlini 的团队利用 API 输出和线性代数恢复出一个真实生产模型的最后一层及其未披露宽度,虽然没能恢复完整模型;与此同时,训练者受到激励,会直接针对 HumanEval、MMLU 及类似榜单优化。“多得多的基准测试”会让这种定向优化更难,也会让能力声明更可信。

  • 🔗 原始收听与视频来源: 语言模型正在“为世界建模” [Nicholas Carlini]

收听完整访谈 →