神经网络是有弹性的折纸![Prof. Randall Balestriero]
摘要
- Balestriero 的核心观点是,现代深度网络是连续分段仿射样条:一种“有弹性的折纸”,将输入空间切分成不同区域,拉伸每个区域,再通过线性输出映射分离不同类别。 这种几何结构揭示了容量、脆弱性、偏差和外推能力究竟藏在哪里,也提供了普通损失和准确率曲线无法展现的实际设计杠杆。
- 在包括 CIFAR 在内的更广泛计算机视觉场景中,干净训练准确率和测试准确率大致同时演化并见顶,但对抗鲁棒性要在更长时间的常规训练后才出现。 区域逐渐离开样本、聚集到决策边界,使数据周围形成更宽、近似仿射的邻域。训练过程中没有使用对抗样本,因此 Balestriero 认为这种保护能力应该不那么依赖特定攻击;但他也谨慎表示,对抗性顿悟出现在“我们找到的大多数场景”中。
- 在固定 FLOP 预算下,一个更小、训练更久的模型,可能获得一个在干净准确率见顶后就停止训练的最大模型永远无法达到的鲁棒性。 这是本期所谓的“聪明 FLOP”主张,但标准工具可能与之相悖:批归一化会让区域集中到样本附近,而更强的权重衰减偏好平滑的近零解,可能延迟甚至阻止稀疏终点的出现。
- 像素空间重建继承了数据集的频谱偏差,因为均方误差通过高能量、低频结构提供最强梯度,而与类别相关的细节往往以更低能量、更高频的特征在后期出现。 精心设计的掩码或噪声可以重新平衡学习,但需要任务知识;潜空间目标则更容易丢弃无关像素,这解释了为什么重建结果看起来很漂亮,感知特征却可能表现平平。
- 每个 LLM MLP 模块提取7个几何特征,即使是70B模型也只需约500个特征,就足以按领域和毒性对提示词聚类,并支持一个小型线性检测器。 在 OmniToxic 上,主持人援引的数据显示,某款流行检测器的曲线下面积约为73.5%,而 Llama 2 7B 的几何探针达到99.18%;读取前几层即可调节延迟。
- 这场讨论将对齐风险刻画为一个可能的复杂度上限:更长且语义相关的上下文会降低注意力稀疏性、提高提示词推断出的内在维度,并可能把它推到 RLHF 覆盖空间之外。 Balestriero 报告了 Llama 2 上的越狱结果,以及另一项 ChatGPT 实验;自然的相关句子可以优于随机填充,也更难过滤。因此,可扩展的对齐需要架构或几何层面的保证,而不只是更多偏好样本。
精读
1. 深度网络是“有弹性的折纸”,而不是不透明函数
Balestriero 在2018年前后的工作并不是发明样条。他说,样条可能早在1980年代甚至更早就已被使用;他的贡献是将样条理论应用于当代深度网络。仿射操作——全连接层或卷积——与 ReLU、最大池化或类似分段线性非线性的组合,会产生一个连续的分段仿射输入输出映射。
由此形成的几何结构,将高维图像或 token 空间切分成凸区域。在每个区域内部,网络只执行仿射映射;非线性行为发生在输入跨越边界时。他偏好的比喻是“折纸”,但空间还会被拉伸:“我会说这是有弹性的折纸。”
主持人提出的质疑值得保留:局部模板或局部敏感哈希看起来都不像推理。Balestriero 同意,每个区域看起来确实像模板匹配,但共享参数会耦合相距很远的区域:从一个样本中学到的东西,会改变数据不存在之处的行为,使隐藏规则能够迁移到“另一个训练时没见过的样本”。
他说,这一视角并不局限于 MLP 或视觉任务:卷积可以被视为带有循环、受约束矩阵的 MLP,而“仿射变换加非线性”的结构也延伸到当前的不同架构和模态。
2. 区域位置带来的收益,大于更丰富的局部多项式
经典样条逼近给出的关键设计启示是:如果必须在提高每个区域的多项式次数和围绕数据布置简单区域之间二选一,后者明显更好。因此,只要能把区域放在合适的位置,分段仿射函数也可以“在最优意义上成立”,尽管其区域内复杂度极低。
训练会同时学习仿射映射和分区边界,因为两者都由同一组权重决定。区域会集中在训练数据周围,也会沿着架构施加的外推模式分布;既不靠近数据、也不属于外推模式的远端区域,则会得到少得多的区域。局部区域越小,逼近就越精确。
这种分布让几何结构具有样本特异性。如果某个群体得到的区域更少、局部表达能力因此弱于另一个群体,Balestriero 认为,可以说网络在该处存在算法偏差。区域分布统计把“这个网络做什么”这一模糊问题,换成了“它在这个邻域里做什么”。
3. 干净准确率看似结束后,对抗鲁棒性才发生顿悟
传统意义上的 grokking 描述的是延迟泛化:训练指标达到平台期,测试表现却仍接近随机或只略高于随机;随后继续训练,远远超过通常的停止点,测试表现才开始上升。即使可见的训练指标已经结束,梯度信息仍在持续重排权重。
Balestriero 与合作者测试了更广泛的场景——包括 CIFAR 和其他计算机视觉任务、卷积网络以及 ResNet——而不是只挑选特定任务、模型和初始化。他们没有发现干净泛化存在延迟:干净训练准确率和测试准确率大致以相同速度演化,也大致在同一时间见顶。
延迟出现的属性转而是对抗扰动下的表现。白盒攻击利用网络梯度寻找一个足以导致误分类的极小输入变化;一个干净训练准确率可能达到100%的网络,在这种“肉眼看不出来”的变化下也可能跌到随机猜测。
继续进行常规训练,最终会提升对抗测试准确率,尽管训练过程中没有使用对抗训练。Balestriero 将其称为“对抗性顿悟”,并表示它出现在所研究的大多数场景中,而不是无条件地出现在所有场景。若在干净准确率见顶时停止监控,就看不到这一过程。
4. 后期训练将容量从样本转移到决策边界
训练早期,网络会积极地在单个样本周围堆叠区域。模型已经具备外推能力,但从几何上看仍类似记忆:大量参数用于拟合已观察到的点,复杂度则相对均匀地散布在周围空间。
训练时间大幅延长后,持续的梯度信息会启动局部“去复杂化”。区域逐渐离开训练点和测试点,在决策边界附近密集压缩。因此,样本周围的邻域变宽,模型会在更大的半径内表现为仿射映射。
这种重新分配解释了鲁棒性:小幅扰动不那么容易跨过非线性边界。容量被保留在真正需要曲率的地方,即类别之间的过渡区域,而不是反复用于编码稳定的样本邻域。Balestriero 说,在理论极限下,这种映射会趋向分段常数。
主持人指出,后期几何结构类似地形图或 Voronoi 图,许多边界在类别之间被“挤压到一起”。把这一过程称为复杂化还是去复杂化,取决于观察位置:样本邻域在简化,而类别边界则获得了高度集中的表示预算。
5. 稀疏性与双下降描述的是同一场几何迁移
Balestriero 将这一终点与剪枝、参数中的秩坍缩、神经坍缩以及稀疏网络联系起来。他说,这些效应、不同正则化方法及其对分区几何结构的影响之间,存在一一对应关系。
更精细的剪枝可以删除负责在样本附近产生多余边界的单元,从而简化分区,同时保留解析决策面的边界。他对彩票卷假说的几何解释是:迭代式幅度剪枝可能会强行把早期均匀复杂的解,替换成更接近后期训练稀疏解的形式。
即使大多数权重消失,鲁棒性仍可能提升,因为被删除的容量原本就位于任务不需要的地方。剩余几何结构会把表示容量集中到决策边界附近。
局部复杂度也会产生类似双下降的曲线。随着干净准确率提升,点周围的区域数量增加;在干净准确率见顶、鲁棒性仍很弱时,区域数量达到峰值;进入第二次下降后,区域逐渐远离样本,局部半径扩大,对抗鲁棒性最终出现。
6. 标准正则化可能阻断鲁棒性终点
正则化并非中性。Balestriero 说,批归一化会主动让区域集中在训练样本周围,与期望的迁移方向相反。权重衰减偏好接近零的参数,通常推动 L2 式平滑;而鲁棒性终点则更接近分段常数。
因此,提高正则化强度可能减慢对抗性顿悟,将其推迟到实际训练窗口之外,或者彻底阻止它出现。这一结果让“刻意让网络变简单就一定能改善泛化”的旧有经验变得复杂:真正需要问的是,正则化选择了哪一种几何结构。
在固定算力预算下,Balestriero 不会自动选择能装下的最大模型,再把剩余预算投入训练。如果目标是鲁棒性,“你可能应该使用小得多的模型,但把 FLOP 分配给训练时间”,这是对按目标属性分配“聪明”FLOP 的直接主张。
几何结构还提示了加速方法。点到最近区域边界的距离计算很快且可微,因此可以将其作为训练正则项。架构约束是另一条路径:去掉偏置会迫使分区居中,形成锥形结构。数据集规模、标签噪声、课程学习以及教师—学生训练,也可能改变 grokking 的到来时间。
7. 局部复杂度比准确率更早揭示训练进展
研究提出的局部复杂度代理指标,统计一个点附近包含多少个分区。对于大型网络,不可能精确枚举所有区域,因此该方法统计每层 epsilon 球内部的顶点数量,并验证这一统计量可以作为附近区域的代理。
关键在于,该指标会在干净训练准确率和测试准确率见顶时达到峰值,随后在对抗性顿悟发生之前很久就开始下降。因此,它比表层指标更能感知持续的几何变化:模型看起来已经训练完成,但内部划分仍在重组。
Balestriero 提议利用这一信号进行早停、调整超参数或选择架构,甚至不必计算训练或测试准确率。他引用的既有研究显示,仅凭分区统计就可以支持神经架构搜索,这意味着几何信息本身足以比较候选网络。
8. 重建先学到可见能量,再学到有用语义
重建论文从两个经验错位出发。自编码器表示是有用的基线,但通常仍需要下游微调;而视觉上令人信服的重建,往往早在学到有效感知特征之前就已经出现。
Balestriero 的解释从图像特征谱展开。在像素空间使用均方误差时,高能量成分产生最大梯度,也带来即时损失下降。其中大部分成分是低频的,因此梯度下降会先学习模糊的全局结构,再学习低振幅、高频细节。
视觉样本直接说明了这一点:低频图像仍然模糊、难以分类,而孤立的高频结构却可能让类别变得可识别。后者之所以较晚出现,只是因为它对均方误差的贡献更小,并不是因为它对识别更没有价值。
高频特征还包含更少的简单背景捷径:网络必须关注物体形状,而不是从草地或海滩推断标签。这取决于任务和数据集。在 MNIST 或 SVHN 上,重建与识别相对一致;但在具有颜色、背景和物体变化的 ImageNet 规模任务中,错位会变得严重。
9. 设计好的扰动可以修复重建的频谱偏差
去噪自编码器和掩码自编码器通过破坏图像、再要求模型恢复原图,改变了梯度的分配方式。各向同性高斯噪声和大块掩码是不同策略;经过精心选择的噪声策略,可以让数据集固有偏差中的特定无用部分更难被复制。
如果研究者知道哪些频率重要,就可以反向设计噪声谱——主持人以粉红噪声为例——压制无用特征、突出相关特征。Balestriero 的保留意见是,这需要对下游任务具备专家级知识。
合适的扰动未必能简化成“高频对低频”。深度估计或树木计数可能需要不同的不变性,而复杂的噪声生成器又可能抹掉重建之所以有吸引力的计算简洁性。如何自动发现有用且易处理的扰动分布,仍是开放问题。
无重建的对比或非对比方法,则在嵌入空间比较增强后的视图。它们不必复现每个像素,因此可以丢弃无关细节,同时将不同视图映射到同一个表示。Balestriero 将其视为一种更可控的代理目标,而不是证明所有重建目标都不可用。
10. 少量样条特征就能把 LLM 几何结构变成毒性检测器
每个标准 LLM 层都包含多头注意力和一个 MLP 模块;而 MLP 再次表现为样条。论文为每个模块提取7个描述提示词所处区域的简单几何特征。即使是70B模型,也只需要约500个特征,而不是数百万个原始激活维度。
在没有监督的情况下,仅凭二维可视化,这些特征就已经按提示词模态聚类——数学、法律、医学——并区分有毒与无毒提示词。因此,即使这些特征并不是专门为这些类别设计的,区域几何结构仍然包含丰富的语义信息。
一个线性头可以将这些特征转化为低延迟检测器。主持人对 OmniToxic 的比较显示,一款据称在前一个月被下载120万次的流行模型,曲线下面积约为73.5%;而 Llama 2 7B 上的样条探针达到99.18%。Balestriero 确认了这一比较,同时强调该方法具有灵活性。
只使用前3层,可以用信息换取更低延迟;使用1层或2层会更快,使用更多层则可能提高准确率。由于这些特征可微且能够在线计算,它们还可以用于数据过滤、模型比较、正则化、新训练目标或对抗性提示词操纵。
11. 高维提示词暴露了 RLHF 的覆盖问题
对于注意力模块,团队从注意力稀疏性推导出一个提示词子空间内在维度的标量代理指标。更长、相互关联更多的上下文会降低稀疏性、提高有效维度,并把提示词推向对齐训练覆盖较少的区域。
人为提高这一维度后,原本会拒绝提示词的模型产生了有毒回答。Balestriero 的解释是外推:RLHF 教会模型“在这里不要说那个”,但在巨大的高维空间中,它无法自动控制每个遥远区域。
讨论引用了 Llama 2 和另一项 ChatGPT 实验,因此 Balestriero 不认为这一结果只属于某种特定架构。用相关的自然语言概念进行填充,可能比随机 token 更有效,因为它会形成更密集的注意力;同时也比简单重复某个短语更难检测。
他在 Brown 的更大目标,是用可理解、可在行业规模落地的保证,替代经验式修补,覆盖训练动态、稀疏性、正则化和数据集偏差。失败的方法应当给出精确解释,而不是“换个超参数,两天后再来找我”;要实现安全外推,需要更好的参数化或几何控制,而不是穷举式采样。