Mechanistic Interpretability
观点集合
机制可解释性:与 Goodfire 的 Daniel & Tom 谈哲学、实践与进展
- 🗓️ 日期:
2025-05-29| 🎙️ 节目:The Cognitive Revolution
机制可解释性已围绕特征、叠加和回路形成原型范式,但行业仍缺乏共识。稀疏自编码器和端到端方法改善分解,“暗物质”却表明重构可能无法完整。Goodfire以科学发现、推理时护栏和创作控制商业化这一缺口,已融资5000万美元,但算法与多模态监督仍有风险。
查看访谈对话精读提要
机制可解释性如今已具备“原型范式”的原材料,尽管这个领域仍未形成共识。 Tom McGrath 的框架非常具体:神经网络包含可理解的特征;线性方向编码这些特征,大小承载强度;叠加让模型能够打包远超维度数量的概念;特征彼此连接形成回路。但这些基础并不能证明现有工具已经能够完整还原模型。
Goodfire 认为,算法是当前相对较软的瓶颈,同时坚持现有工具已经能够创造客户价值。 Tom 表示,检验标准是:这个领域能否从“一次100万美元的解释器模型训练运行”中提取价值100万美元的信息;如今它可以花掉这笔钱,却无法高效利用。Daniel Balsam 的商业表述更直接:SAE 是“模型的一扇窗”,而训练它“是工作的开始,而不是终点”。
稀疏自编码器正在改进,但未被还原的“暗物质”意味着不能把它们视为完整的模型审计工具。 JumpReLU、BatchTopK、端到端 SAE、Matryoshka 式分解及其他新方法都在改进或扩展 SAE,但一项规模化研究显示,还原曲线在达到99.99%或100%之前就开始弯折。缺失的方差可能来自记忆、高阶几何结构,或与输出无关的噪声;Tom 仍倾向于让解释器模型逼近实际上完美的还原。
科学发现是一个重要应用场景,因为高能力科学模型可能包含人类方法尚未发现的抽象结构。 Goodfire 与 Arc Institute 的合作已经找到了与已知基因组概念高度相关的特征,并正转向在 Evo 2 等模型中无监督搜索新的生物学信息。Dan 更进一步认为,即便是“数据中心里的天才”也可能偏好机制可解释性:在芯片上模拟物理系统,从学习到的计算中提取原理,再在湿实验前更好地筛选假设。
推理时护栏提供了一个清晰的近期企业应用场景。 提示词规则会变成“打地鼠”,1,000条规则会损害任务表现,前沿模型裁判又会增加一次昂贵调用,而小型分类器需要数据和机器学习专业能力。Goodfire 的方案是低成本监测模型的内部认知:当模型似乎正在处理个人身份信息(PII)或禁忌话题时,触发程序化响应;同时明确承认越狱及其他局限仍然存在。
创作控制有望把潜在理解转化为新的交互层,但更广义的多模态超级智能论仍有争议。 Paint with Ember 展示了对图像特征的直接操控,视频和音乐则提供更高价值的延伸,例如要求“让萨克斯独奏里的萨克斯再多一点”。Nathan 预计,整合约20种模态、其中许多涉及科学或自然世界领域的推理能力将产生超级智能;Dan 和 Tom 则警告,稀缺的奖励信号可能最终只会得到“穿着同一件风衣的两个模型”,而非真正的跨领域理解。
Goodfire 已融资5,000万美元,意在把可解释性发展为独立品类,而不是扩展实验室内部的附属功能。 Menlo Ventures 领投本轮,其中包括 Anthropic 的100万美元投资,Dan 称这是 Anthropic 的首次企业投资;主持人披露自己是种子轮投资人。这笔押注覆盖科学发现、护栏和创作工具,背后是 Dan 的判断:“可解释性和 AI 本身一样大。”
🔗 原始收听与视频来源: 机制可解释性:与 Goodfire 的 Daniel & Tom 谈哲学、实践与进展