先锋 趋势 方法 投研 作者
返回先锋
Dan Hendrycks
研究员 3 场深度对话收录

Dan Hendrycks

AI安全研究员

前沿洞察

AI安全本质是地缘与国家战略博弈,而非实验室技术对齐。模型向生物武器与完全自动化研发闭环演进,正将技术迭代推向不可逆的“机器速度”,令微弱时间领先具备决定性杀伤力。面对权重窃取与算力效率跃迁,单边技术封锁已难以为继。唯有以硬件追踪核查构建威慑平衡、直面自动化引发的经济相变与人类议价权丧失,方能防范相互确保的系统性崩溃。

观点集合

相互确保的 AI 失灵 [Dan Hendrycks]

  • 🗓️ 日期2025-08-14 | 🎙️ 节目:Machine Learning Street Talk

若模型解决Humanity’s Last Exam的数千道专家问题,传统封闭式基准可能终结,但测试仍未覆盖自主行动、记忆、实验和经济执行。Hendrycks认为,美国版超级智能项目会引发竞速、破坏和人才排除,因此威慑、芯片防扩散与竞争比谋求垄断更可信;部署能力、诚实、自我保存和人类议价能力仍是未解风险。

查看访谈对话精读提要
  • Humanity’s Last Exam 的目标,是标志着封闭式 AI 评测这一类型走到尽头,而不是认证 AGI。 MMLU 的成绩已经远超 90%,而 Humanity’s Last Exam 约为 26%;一旦模型解决其中数千道专家撰写的问题,后续单个问题就应当“值得单独写一篇论文”。但它仍未覆盖自主行动、长期记忆、物理实验和具备经济价值的执行能力。

  • Hendrycks 认为,美国版超级智能 Manhattan Project 将引发军备竞赛和破坏,而不是确保美国取得优势。 一座价值 1万亿美元的数据中心不可能合理地长期保密;安全审查要求会缩小并重塑人才池;中国会将美国谋求垄断解读为生存威胁——无论美国控制住系统,还是失去控制,“不管是哪种情况,我们都要阻止它”。结果很可能是多个项目竞逐、内部威胁、基础设施遭袭,以及各方转向验证机制。

  • 真正的战略护城河是算力和部署能力,而不只是拥有最聪明的模型。 Hendrycks 认为,当前建设前沿系统的临界规模约为 10,000 张尖端 GPU;中国一支低于 100,000 张 GPU 的集群只能服务相对少量的客户;而持续运行的实用型智能体,所需算力大约是每天运行几分钟的聊天机器人所需算力的 100 倍。“如果要花 100亿美元,就做不到”概括了他的判断:复制前沿芯片供应链,比获得核能力更难。

  • 他的替代方案结合了威慑、芯片防扩散,以及与中国进行常规经济竞争。 相关基础设施包括数据中心所需的能源、台湾受扰时仍具韧性的半导体产能、安全的机器人供应链,以及超大规模云服务商的部署能力;竞争目标应是全球市场份额,而不是“让我们第一个造出超级智能”。出口管制应把最危险的能力挡在朝鲜、伊朗等行为者之外,同时保留对愿意接受威慑的国家的供应。

  • AI 安全是一项持续的风险管理职能,因为能力和失效模式会不可预测地跨过有用性阈值。 Hendrycks 最希望看到的技术突破,是在不增加推理成本、不损害其他性能的前提下实现可靠诚实;但他反对“一次性解决对齐”的想法:AI 越来越像一个不断出现“新问题”的复杂系统,而人类的适应能力有限。在讨论 utility engineering 时,主持人概括了偏好一致性、自我保存压力,以及政治和人口偏见等发现;Hendrycks 将其视为警报,而非正在发生的灾难,因为今天的模型还无法可靠地自行窃取信息、自我维持或自主入侵。

  • Hendrycks 怀疑单纯扩大 LLM 规模会通向 AGI 或递归式超级智能,但如果出现人类水平的 AI 研究员,他认为可能出现条件性的不连续跃迁。 现有系统已经能以较弱的方式辅助编程、芯片设计、散热、数据标注和 Constitutional AI;一旦移除人类瓶颈,研究就可能切换到机器速度,世界级研究员智能体也可以被复制。记忆、规划、流体智力和多智能体信任仍是瓶颈,今天的算法加上更多算力并不足够。那些公开讨论这种递归、却没有可信控制方案的公司,让他说:“我觉得有些东西出问题了。”

  • 一旦劳动力可以被替代,算力的政治分配就会成为维持人类议价能力的机制。 “你最好事先谈好条件”:当自动化企业和无人机集群拥有生产与强制优势时,工人将无法再以罢工相威胁。Hendrycks 认为,正面路径是广泛分配算力或其收益,让人类始终处于优先位置,保留认知能力、自主权和多种生活方式,而不是把所有收益留给“2027年”拥有数据中心的人。

  • 🔗 原始收听与视频来源: 相互确保的 AI 失灵 [Dan Hendrycks]

收听完整访谈 →


爆炸式 AI 时间线预测 [Gary Marcus, Daniel Kokotajlo, Dan Hendrycks]

  • 🗓️ 日期2025-06-24 | 🎙️ 节目:Machine Learning Street Talk

真正的AI红线是完全自动化的研究闭环,它可能让进展从人类速度切换到机器速度,使六个月领先也具备战略决定性。前沿实验室的竞速逻辑削弱了自愿自律,而训练成本若延续当前趋势,到2030年可能达到约5000亿美元,并在缺乏彻底自动化时拖累进展。

查看访谈对话精读提要
  • 真正的关键红线,是实现完全自动化的 AI 研究闭环,把人类从开发过程中移除,让进展从“人类速度”切换到“机器速度”。 Kokotajlo 认为,递归式改进可能带来持久的战略优势;他援引 Dario Amodei 对智能爆炸的讨论,以及 Sam Altman 关于将10年的发展压缩到1年、甚至1个月的设想。如果某个国家控制了由此产生的超级智能,竞争对手可能被碾压;如果没有任何一方能够控制它,“所有人的生存”都可能受到威胁。Hendrycks 另行指出,率先触发递归的一方,即使只领先很短时间,也可能获得决定性优势。

  • 拟议中的遏制方案包含3条具体红线:不得启动爆炸式 AI 递归;不得部署缺乏充分安全措施、具备专家级病毒学或进攻性网络能力的智能体;必须强化高能力模型权重的安全防护。 Kokotajlo 倾向于渐进式机制:各国透明地发展能力,研究每个层级,再讨论是否继续推进。Hendrycks 认为,协调可能先从公开表态和威慑开始,之后才走向核查或条约:“这场对话必须推进得远得多。”

  • 时间线分歧很大,但在场没有人把风险视为可以安全置之度外。 Kokotajlo 已将超级智能的中位时间从2027年底推迟到2028年底;其他同事的中位预测大约在2029—2031年。Hendrycks 认为,到2030年达到人类水平的认知广度“不仅可能,而且相当有可能”;Marcus 则把2030年视为最快的合理情形,并将大部分概率放在10年之后,因为若要很快实现 AGI,就必须同时解决“无处不在、无所不包的一切问题”。

  • 当前的资本开支趋势意味着:要么本十年内实现彻底自动化,要么 AI 进展将明显放缓。 Kokotajlo 估算,训练成本已从2020年的约300万—500万美元升至目前约10亿美元;如果保持同样速度,到2030年单次训练成本可能达到约5000亿美元。届时电力、晶圆厂、芯片产量、有限的互联网数据和企业预算都会成为约束;如果没有 AI 驱动的经济转型,他预计进展至少会逐步放缓,甚至出现“有点像 AI 寒冬”的局面。

  • 前沿实验室最核心的治理失败,是一个被道德例外主义伪装起来的集体行动问题。 Kokotajlo 的说法是,DeepMind、OpenAI 和 Anthropic 的领导层都理解失控风险与权力集中的风险,但最终都接受了同一个“诱人的论证”:“如果我们不做,别人也会做。”他们相信自己是更负责任的一方,于是把已被承认的危险转化为竞速理由,使自愿自律不足以成为基准情形。

  • 技术对齐仍明显落后于能力进展,尤其是在“差不多合理”远远不够的场景。 Hendrycks 认为,像拒绝生物武器请求这样的狭义防护,可靠性或许可以达到多个9;但如果稳健方法会让 MMLU 下降“一两个百分点”,实验室可能不愿采用。更广泛的要求——避免犯罪行为、侵权行为或可预见的伤害——仍然模糊;而智能递归是流程层面的问题,事先无法消除其中未知的未知。

  • 乐观情形下的收益极其巨大,但产出充裕并不意味着所有人都能广泛拥有财富或保持政治自主。 Kokotajlo 描述了超级智能快速设计工厂、实验室、机器人、药物和定居点,直到物质需求得到满足;他还设想,不仅分配收入,也分配由密码学控制的“算力切片”。Marcus 则变得更加悲观:财富持有者或许会资助基本生存,却仍然保留“海滨地产”和权力,使得正向均衡取决于一套尚未有人提出的机制。

  • 架构之争同时也是护城河之争:开放权重能让所有人站上同一条起跑线,却无法让所有人共享会复利增长的前沿。 Kokotajlo 认为,即使每个人拿到完全相同的权重,拥有大量 GPU 的参与者仍会率先利用 AGI 推进到 AGI+ 和 AGI++,形成强烈的规模报酬。Marcus 则预计会出现一次神经符号式的状态变化:到2035年,今天的 LLM 可能会被视为“不错的尝试”——仍然有用,就像智能手机出现后的功能手机,但并不是那个解决了推理、世界模型和稳健泛化问题的系统。

  • 🔗 原始收听与视频来源: 爆炸式 AI 时间线预测 [Gary Marcus, Daniel Kokotajlo, Dan Hendrycks]

收听完整访谈 →


超级智能前夜的国家安全战略与 AI 评测:Dan Hendrycks

  • 🗓️ 日期2025-03-05 | 🎙️ 节目:No Priors

AI安全首先是国家战略问题:实验室对齐无法消除军事融合、劳动力自动化与风险承受度上升,推理模型却已逼近专家级病毒学能力。MAIM以共同脆弱性配合芯片追踪和最终用途核查,但DeepSeek式效率与模型权重窃取削弱能力封锁;代理可靠完成数字工作将触发经济相变。

查看访谈对话精读提要
  • Hendrycks 的核心判断是,AI 安全首先是国家战略问题,而不只是实验室层面的对齐问题。 实验室“注定要竞速”;它们可以低成本限制专家级生物学能力的访问、应对网络风险,但即使美国和中国的系统都服从指令,战略竞争、军事快速融合、劳动力自动化以及不断上升的风险承受度仍然存在。

  • 眼下的国家安全图景参差不齐:推理模型正逼近专家级病毒学能力,但 Hendrycks 不认为 AI 目前已足以帮助恶意行为者发动毁灭性电网攻击。 这“很可能在1年内改变”。讨论还涉及网络防御、无人机、电子战、指挥控制可靠性和算力安全等近期应用与风险领域。

  • Hendrycks 否定自愿暂停,也否定美国单方面冲刺超级智能,因为两者都经不起对手反制。 条约需要核查机制或武力保障,模型权重可能被窃取,而一座“从太空完全可见的1万亿美元沙漠算力集群”会被视为争夺支配地位的行动,中国将试图加以遏制。

  • 他提出的“相互确保 AI 失灵”(MAIM)机制建立在共同脆弱性之上:各国不会推进破坏稳定的超级武器项目,因为对手可以监视或瘫痪其数据中心。 芯片和无人机竞争仍将继续;协调重点在于阻止流氓行为者获得能力,类似核、生化武器机制将大国竞争与共同防扩散利益分开。

  • DeepSeek 式效率削弱了对华能力封锁,因此 Hendrycks 会主要用出口管制追踪芯片、约束流氓行为者,再用威慑约束大国意图。 他的80/20方案很具体:设立 CIA AI 间谍小组,由网络司令部准备破坏选项,实施许可和发货通知制度,并核查最终用途——包括调查此前提到的10% NVIDIA 芯片究竟流向何处。

  • 当模型从令人印象深刻的“预言机式能力”迈向可靠的代理能力时,经济将迎来相变。 Humanity’s Last Exam 的目标是在封闭式学术基准接近上限时让其退出历史舞台——这将意味着模型在部分数学和 STEM 领域达到超人水平——但代理仍然“接近地板”;一旦它们能够完成数字化工作,Hendrycks 预计“整个氛围会彻底改变”(the vibes really shift)。

  • 🔗 原始收听与视频来源: 超级智能前夜的国家安全战略与 AI 评测:Dan Hendrycks

收听完整访谈 →