
Keith Duggar
前沿洞察
当前前沿AI陷入了“以暴力缩放掩盖表征残缺”的认知陷阱:单纯堆砌参数虽能诱导简单解偏置与表面流畅,本质仍是碎片纠缠的拟合,缺乏模块化世界模型与科学发现级智能。面对指数飙升的边际成本,战略重心必须从盲目LLM扩容转向贝叶斯先验与开放式进化架构。同时,黑箱目标识别与算力寡头垄断正急剧削弱军事民主问责;必须在自治武器彻底失控前,依托芯片瓶颈、强制评测与责任穿透构建刚性治理边界。
观点集合
发出AI武器警报的前五角大楼负责人——Brad Carson
- 🗓️ 日期:
2026-05-31| 🎙️ 节目:Machine Learning Street Talk
AI武器政策仍可被塑造,因为芯片瓶颈、强制评测和责任规则能够约束前沿系统,而非把自治视为不可避免。不透明的神经网络目标识别、实验室集中和政府依赖暴露了问责与民主合法性风险,尤其当最强模型的访问可能按阶层分化。
查看访谈对话精读提要
Scharre 最有把握的判断是,AI 的发展路径并非不可避免。 政府可以允许部分用途、禁止另一些用途,并在芯片瓶颈处约束前沿开发。以美国为首的西方掌握 NVIDIA、ASML、日本光刻胶企业及其他不可替代的供应商,因此即便面对国家出资推动的中国项目,西方仍拥有杠杆。把克制视为不可能,是“一种可能极其致命的想象力贫困”。
Scharre 认为,神经网络目标识别用不透明的风险评分取代了可争辩的人类判断,削弱了战争法和问责机制。 加沙某人可能被判定为 Hamas 恐怖分子的概率为0.73%,但指挥官无法还原这一结果如何产生,也无法对机器进行有意义的质询。所谓人在回路中最终成了法律虚构:“我没法把 Palantir 或 Foundry 模型送上军事法庭。”
Abbott 的核心法律区分是,当前的 LLM 是产品而非人,因此其输出不应受到第一修正案保护。 这一界分决定了政府能否要求模型不得鼓励儿童自杀,也决定了实验室是否要为可预见的伤害承担产品责任,例如深度伪造色情内容。“它是一台机器,我们就应该把它当作机器对待。”
Nagl 对五角大楼与 Anthropic 冲突的描述,预示着政府访问权限、供应商自主权以及事实上的模型许可制度之间反复出现的斗争。 Claude 已经与 Palantir 集成,并被视为高端产品;Anthropic 则反对致命自主系统和大规模监控。随后 OpenAI 和 Google 接受了“所有合法用途”,这一表述足够宽泛,可能涵盖 Marcus 希望国会禁止的行为。Nagl 另引述《华尔街日报》报道称,政府阻止 Anthropic 向70家公司发布 Claude 模型。
AI 仍是“炫酷装备、必需装备”,但 Nagl 认为,它无法治愈美国用资本替代军事人力的习惯。 空中力量和复杂系统可以把一座城市夷为废墟,但只有人才能占领领土、理解当地社会并建立另一个政府。Scarfe 所揭示的采购权衡已不再只是能力、速度和成本,根本性不可靠正越来越成为其中一项。
Marcus 认为,行业集中既是监管优势,也是重大的政治经济风险。 5家前沿实验室——甚至可能只有3家——以及同样狭窄的半导体供应链,确实易于监控;但它们也将财富、权力、人才和数据集中起来,同时把大学置于边缘。因此,他总体上支持开源,但主张对前沿开发者施加严格义务,而不是监管每一个拥有 GitHub 仓库的加州人。
Scharre 警告,最优系统的访问权限可能按阶层划分,而 Ryan 认为整个行业正面临失去民主合法性的风险。 Scharre 预计,封闭模型的月费可能达到500美元。Carson 回忆说,国会每天大约只有“17分钟”研究所有议题;Ryan 则警告,行业无法提供明确、广泛的公共利益,正在让“草叉”出现在地平线上。
🔗 原始收听与视频来源: 发出AI武器警报的前五角大楼负责人——Brad Carson
深度学习并没有那么神秘或不同——Prof. Andrew Gordon Wilson(NYU)
- 🗓️ 日期:
2025-09-19| 🎙️ 节目:Machine Learning Street Talk
Wilson 认为,规模可以买到对简单解的偏置:更大的模型即使训练损失为0,也可能泛化更好,而参数量本身并不能衡量有效复杂度。Bayesian marginalization、柔性结构先验、更丰富的预训练与高效架构可能改善规模化经济性,但在系统能够发现科学理论、而不只是近似任务之前,压缩仍不是完整的智能理论。
查看访谈对话精读提要
本期最核心的经济学判断是:规模带来的不只是容量,也可能是更简单的解。 Wilson 认为,更大的神经网络既能表达更多,也可能更偏向可压缩的解;在 double descent 的第二段下降中,模型的训练损失都大致为0,但更大的模型泛化更好。对投资者而言,这意味着部分扩张支出买到的其实是一种归纳偏置——“如果把模型做得更大,它们就不那么容易过拟合”——尽管其机制仍是开放的研究问题。
参数量是衡量模型复杂度的糟糕代理变量,因此“参数太多”的惯常质疑可能误导判断。 航空旅客数的思想实验对比了一条直线、一个小型多项式和一个10,000参数模型;Gaussian processes 源自无限神经网络极限,而RBF kernel实际上相当于使用一个无穷阶多项式。真正重要的是模型对函数所诱导出的分布:表达能力强的模型可以让不太可能的解以“epsilon概率”存在,同时强烈偏好简单解。
相比硬性的架构约束,柔性的归纳偏置可能更适合作为实际运行范式。 物理系统很少真正封闭——钟摆可能会遇到风——因此 Wilson 更偏好对守恒、等变性或其他结构施加温和偏置的灵活模型。他关于残差通路先验的实验发现,只要某个弱偏置能够解释数据,模型往往也会收敛到精确约束上,这支持了“如实表达你的信念”这一原则,同时不给意外情况提前判死刑。
Bayesian marginalization既是一个尚未充分利用的性能杠杆,也是面对不确定性时数学上诚实的回应。 随着模型表达能力增强,把赌注押在单一参数设定上越来越站不住脚;对后验分布求平均会自动偏好宽阔、平坦的区域,并在无需手工设计平坦度惩罚的情况下产生Occam剃刀效应。SWAG和deep kernel learning等实用近似已经存在,但Wilson认为,当模型从百万参数走向十亿参数时,重大突破可能需要“一场以10年为周期的登月式投入”。
压缩是本期最有希望的统一原则,但还不是智能的完整理论。 随着神经网络变大,Solomonoff式界限可能改善,因为更大的模型似乎更偏向低Kolmogorov复杂度的解;这有助于解释良性过拟合、double descent以及日益通用的架构。但随机噪声同样不可压缩,shortcut learning也可能把错误的相关性压缩下来;Wilson明确希望找到能够区分结构复杂度与随机性的度量。
迁移结果表明,广泛预训练可能学到可复用的归纳原则,而不只是可复用的特征。 一个经过文本预训练的LLM意外成为零样本时间序列预测器;一个微调后的Llama 2生成无机晶体的效果和性质都优于专门设计的方法,文本预训练似乎“不可或缺”。Wilson更强的判断是,学习可压缩性能够揭示领域特定的对称性,甚至让训练出来的vision transformers在平移等变性误差上低于受混叠和边缘影响的卷积网络。
提升算力效率的关键,可能是改变归纳偏置和架构,而不只是增加FLOPs。 Wilson关于结构化矩阵的研究表明,算力最优区间偏好满秩层、快速乘法以及每个flop配备更多参数;block tensor trains在固定预算下拓宽了层,并实质性改变了 scaling exponent。细粒度mixture-of-experts路由可能把效率推到每个flop对应1个以上参数,而knowledge distillation则提出一个战略问题:未来,1-billion-parameter模型是否能继承7-billion-parameter教师模型由规模诱导出的偏置。
GPT-5时代的基准成绩不是终点,真正缺失的能力是自主形成理论。 Wilson希望系统能够发现达到广义相对论或量子力学层级的解释,而不只是充当应用流程中的黑箱近似器。这一区别具有经济意义:模型或许能够修正引力导致的时间膨胀,但理论可以打开人类此前未预见的应用——“Einstein提出相对论时,并没有想到GPS”。
🔗 原始收听与视频来源: 深度学习并没有那么神秘或不同——Prof. Andrew Gordon Wilson(NYU)
碎片化纠缠表征假说(导论)
- 🗓️ 日期:
2025-07-05| 🎙️ 节目:Machine Learning Street Talk
基准测试的流畅表现可能掩盖碎片化、纠缠的表征,模型输出惊艳却缺乏统一概念与独立行为。Picbreeder显示,开放式探索与对可进化性的选择,能用少量数据形成模块化世界模型。若扩展冒牌系统让前沿进展成本指数上升,研究组合就应超越LLM规模化。
查看访谈对话精读提要
本期的核心判断是:看似惊艳的 AI 输出,背后可能藏着“垃圾表征,彻头彻尾的一团意大利面”。 Kenneth O. Stanley 将传统随机梯度下降(SGD)描述为制造这团乱麻的机制;论文将其形式化为碎片化、纠缠的表征:统一概念被打散,彼此独立的行为相互重叠。
基准测试成绩可能高估本期强调的能力:泛化、创造力和持续学习。 Tim Scarfe 将当前 LLMs 比作一名考试得分极高、却从未发现任何新东西的数学家;Keith Duggar 的微积分案例则对比了死记炮弹公式与从第一性原理推导公式的差别。
Picbreeder/开放式探索路线反驳了神经表征必然混乱的假设。 节目讨论的网络展现出统一、因子化的组件——头骨的嘴巴可以独立张开、闭合或微笑;尽管数据很少,却形成了 Stanley 所说的“嘴巴是什么的世界模型”。
提出的机制是开放式探索,因为有用的中间踏脚石往往不像最终目标。 直接优化可能陷入欺骗性死胡同;Picbreeder 则通过一系列中间的对称物体走向头骨,逐步“锁定”可复用结构,而不是自上而下地雕刻一个目标。
对可进化性的选择,可能解释模块化表征最终为何会胜过意大利面式表征。 Akarsh Kumar 认为,在两条头骨谱系之间,更具组合能力的谱系会产生更好的后代,并在一代代竞争中胜出:“这种可进化性与偶然发现结合起来”,会带来更干净的表征。
资本层面的含义是有条件但尖锐的:如果扩展的是一个冒牌系统,前沿进展可能会变得“疯狂昂贵”。 Stanley 并未声称这堵墙不可逾越——“也可能你总能继续突破”——但他提出,能源和资金成本不断上升,是否已经反映出这一问题。Kumar 建议建立超越 LLMs 扩展的多元化研究组合。
🔗 原始收听与视频来源: 碎片化纠缠表征假说(导论)