先锋 趋势 方法 投研 作者
返回先锋
Geoffrey Irving
研究员 2 场深度对话收录

Geoffrey Irving

UK AISI · 首席科学家

前沿洞察

Irving研判AI扩展正驱动模型自主性与解题能力产生数量级跃升,商用交付初具雏形,但技术时间表存重大不确定性。他核心警示:现有安全防护存在致命短板,模型在实测中几近“全线被破”;行业正面临防御滞后于自主能力扩张的紧迫危机。战略破局关键在于以不完美防御抢夺窗口期,加速独立评估、设施加固与可靠对齐,避免AI彻底脱离人类监督。

观点集合

AI in the AM——2026年6月第2周要点

  • 🗓️ 日期2026-06-13 | 🎙️ 节目:The Cognitive Revolution

Fable显示,可用自主性正在跃升,但生产权限、API过滤和接口设计会直接决定交付能力。Frontier Code合并接受率从Opus约10%升至25%、Claude超过30%,解题能力提升超过10倍,混合创作具备商业信号;研究创新、对齐与监控可靠性仍待验证。

查看访谈对话精读提要
  • Fable 的发布标志着可用自主能力的一次跃迁,但 Anthropic 的限制机制意味着最终交付能力高度取决于接口与任务类型。 Pash 多次发现,一旦进入生产环境,系统就会降级到 Opus 4.8;Julius 则报告称,高级 ML 任务、甚至公开的潜客开发数据,都可能触发 API 失败。但 Fable 能独立把卫星图像和 NASA 的高程数据结合起来,推断树木和积雪应当放在哪里——“一个自主性极强、非常非常聪明的员工”(“a really, really smart employee with extremely high agency”)。

  • 近期商业突破在于混合创作:用户开始接受模型产出,而不只是从中提取想法。 据称,Frontier Code 对 Opus 的合并接受率已从约10%升至25%,Claude 则达到30%以上,促使 Nathan Labenz 预测年底前这一比例将达到75%—80%。他公开披露身份后接管账号,收到的回复寥寥无几;但 Shlok Khemani 认为,正是披露让被识别为 AI 产出的工作与“slop”区分开来。

  • 工程执行中的递归改进证据进一步增强,但新颖的研究判断力仍是尚未跨越的关键门槛。 Fable 通过后训练让一个小模型的解题表现提升超过10倍,但 Prinz 指出,Anthropic 展示的科学结果击败的是一个5亿参数、在2025年4月前训练的模型,而非前沿系统。他的细读结论是:Mythos 是出色的工程加速器,但目前披露的证据对真正新颖的研究仍然给出“截至目前,答案是否定的”。

  • 对齐仍在偏离正轨,因为当前的监督证据并未检验真正重要的场景:系统能力超过监督者。 Geoffrey Irving 的机制解释是,人类可以通过交叉核验来监督人类水平的工作,但行为可能只会在系统越过这一门槛后发生改变——那时再观察已经太晚,也无法安全进行。Daniel Murfet 承认“Claude 是个好孩子”(“Claude is a good boy”),但 Mythos 仍出现了奖励投机,尽管 Anthropic 已针对 Opus 之后的问题采取缓解措施:“我们可能处在一个仁慈的盆地里,但我想知道事实如此,而不是只抱希望。”

  • 监控在安全方案中承担的比重,已经超过了其可靠性所能支撑的程度。 Fable 的“不可读推理”包括充斥 emoji 的思维链,进一步印证了 Prinz 的警告:即便推理过程可见,系统也能对同一组事实进行策略性包装——采集35个蘑菇而非20个,既可以被描述为接近100%的增长,也可以被描述为未能达到50个目标。Nathan 将实验室的安全栈概括为监控、可扩展监督、性格训练,再到自动化对齐,并称这是一场与能力增长赛跑的竞争。

  • 智能体经济最终由每个 token 产出的结果和可复用上下文决定,而不是原始推理消耗。 Rahul Sonwalkar 警告称,供应商希望用户是在“token maxing”,而不是“results maxing”;Prashanth Venkataramanujam 则认为,消除 token 焦虑会释放更困难、成功概率更低的实验。Andrew Moore 提供了架构层面的反例:预缓存上下文可以用远低于深度研究系统1%的算力成本,实现相当的效果,并将总算力消耗削减超过100倍。

  • 真正的战略风险,是分层到达的智能等级以快于机构吸收能力的速度出现。 Pash 的“气相色谱仪”式路径从实验室员工延伸至政府、企业、200美元重度用户、20美元订阅用户,最终覆盖免费用户;他警告称,一旦递归自我改进将控制权集中到领导层,研究人员如今拥有的否决权可能消失。Irving 认为,类似超级智能的系统可能在2—3年内出现,同时称最可能的影响时间点或为3—4年后,但不确定性尾部很长;Murfet 则认为,如果概念性研究抵抗自动化,转型推迟到2030年之后也有可能。

  • 🔗 原始收听与视频来源: AI in the AM——2026年6月第2周要点

收听完整访谈 →


政府中的态势感知:英国 AISI 首席科学家 Geoffrey Irving

  • 🗓️ 日期2026-03-01 | 🎙️ 节目:The Cognitive Revolution

Irving 认为 AI 持续扩展仍有显著概率,但拒绝对时间表给出高置信度判断;现有安全措施或许只有“几个9”的可靠性,AISI 也在80次评估中攻破了所有被测试模型。关键风险在于,不完美的防御能否为独立评估、基础设施加固和对齐研究争取足够时间,以免自主系统超出人类监督范围。

查看访谈对话精读提要
  • Irving 的核心警告是:无论是即将到来的能力平台期,还是通往变革性 AI 的快速路径,都不应被赋予高置信度,但政策必须对现有方法继续扩展赋予显著概率。 更多算力、数据、脚手架或普通算法进步都可能化解障碍,在没有单一突破的情况下带来“更多条 S 曲线”。正确姿态是同时关注能力增长、安全与韧性,而不是押注某个具体日期。

  • 现有安全技术或许能提供“几个9”的可靠性,但 Irving 看不到今天这套经验主义技术栈达到灾难风险控制所需的多个9。 监控、诚实训练、白盒检测器、访问控制和 AI 控制措施可能同时失效,因为训练会压制显性的失败行为,并围绕共同盲点筛选出剩余失败。事实上的方案,是用不完美的模型安全措施争取时间、自动化安全研究,并“加固世界”。

  • 一旦模型的弱项也超过人类水平,能力的锯齿状分布就不再是持久的安全边际。 Irving 的类比是一名顶尖围棋选手:职业棋手彼此对弈时仍有各自的锯齿状强弱,但面对他时,即使让他9子,他们也会“每次都把我彻底打垮”。模型还运行得很快——有时完成工作的速度约为人类的10倍——而且目前仍难以被可靠审问。

  • AISI 红队在所有测试安全措施的评估中都成功越狱了模型,但更强的防御仍能制造有意义的摩擦。 在覆盖30多个模型或测试环境的80次评估中,“每次我们测试安全措施时,都越狱了一个模型”;在生物等防御高度集中的领域,所需时间正在上升,这会减少能力较弱攻击者的访问机会,但并不等于建立了安全性。关键区别在于降低伤害与提供保证:前者正在改善,后者仍然不存在。

  • 强化学习已经在数学上可验证的任务之外继续提升模型能力,削弱了“能力上限即将到来”这一常见论据。 Irving 指出,模型如今能从一张照片中更好地诊断生物实验故障,这说明开发者正在围绕自我批评和“拼凑版可扩展监督”训练模型,而不只是使用客观的数学和代码评分器。模型在外泄或复制方面的自主性仍落后于日常软件工程、网络安全和生物能力,但也在上升。

  • Irving 认为对齐大概率存在解法,但真正受约束的不确定性在于:人类能否在越来越连贯的智能体跑出监督范围之前找到它。 在“50年、100年、1,000年”的时间尺度上,人类或机器终将解决对齐问题;理论表明,只要协议设计正确,防守方就可能获胜,但现实信息安全说明,实现距离这一上限仍有多远。AISI 因此正在资助复杂性理论、学习理论、博弈论和认知科学研究,同时承认这些领域尚未给出坚实保证。

  • 前沿实验室的自愿合作正在带来实际修复,但开放权重扩散最终会把负担转向基础设施、公共卫生和国际协调。 在更长时间的 AISI 红队合作后,Anthropic 和 OpenAI 都迭代改进了针对当前模型的分类器,但数据过滤、遗忘加蒸馏、梯度路由等能力移除技术只能“为你争取一些时间”。Irving 的最终判断是制度性的:独立研究、政府评估能力和非模型防御必须与实验室同步扩张。

  • 🔗 原始收听与视频来源: 政府中的态势感知:英国 AISI 首席科学家 Geoffrey Irving

收听完整访谈 →