先锋 趋势 方法 投研 作者
Nvidia CTO Michael Kagan:突破摩尔定律,迈向百万 GPU 集群
返回节目精读

Nvidia CTO Michael Kagan:突破摩尔定律,迈向百万 GPU 集群

摘要

  • Kagan 的核心判断是,AI 已将扩展能力从芯片级摩尔定律推向系统级扩展:模型规模和能力每3个月翻倍,要求年化性能提升约10X–16X。 因此,NVIDIA 优化的是“单一计算单元”——算力、网络、软件以及数据中心级整机——而不只是晶体管密度。Kagan 称,如今每年的产品迭代在机器层面带来约一个数量级的提升。
  • Mellanox 让 NVIDIA 突破单节点扩展:它延伸了纵向扩展互联,并提供横向扩展所需的高性能网络。 如今的“GPU”可能已经是一台机架级机器——36台双 GPU 计算机中的72块 GPU,通过 CUDA 呈现为一个可编程系统——“得用叉车才能把它吊起来”。集群性能取决于延迟是否受到严密控制,而不只是带宽峰值:延迟抖动幅度过大,就会迫使每块 GPU 等待。
  • 当 GPU 数量达到100,000时,零部件可靠并不意味着系统可靠,因为数百万个部件会让“所有部件都正常工作”的概率归零。 硬件和软件必须假设始终有部件损坏,同时维持服务、利用率和能源效率。Kagan 更广泛的答案还包括 BlueField DPU:将基础设施计算与应用分离,并显著缩小攻击面。
  • Kagan 认为,随着 AI 从一次性感知走向生成和多步骤推理,推理算力需求已经“不低于训练”,实际上还要更高。 训练只发生一次,而每位用户、每个 token 都会反复触发推理。Prefill 是计算密集型,decode 是内存密集型;NVIDIA 的押注是,专用 SKU 仍应沿用统一的 CUDA 编程模型,从而让算力容量可以在两者之间调配。
  • 对数据中心规模的现实约束,与其说是抽象的网络定律,不如说是能源和散热。 Kagan 提到约100–150 MW的大型部署,业界讨论正转向 GW 乃至10 GW级设施,液冷则是提高密度的必要条件。将一个工作负载拆分到相距遥远的站点,会引入光速延迟和拥塞;Spectrum-X 通过端点遥测应对这一问题,而不是使用会制造抖动的“超大缓冲区”。
  • Intel 合作体现了 NVIDIA 的判断:加速计算将扩张,而不是消灭通用计算。 Kagan 将其描述为一种“共赢文化”:NVIDIA 的目标是“把蛋糕做大,让所有人都受益”,x86 与加速计算将为双方打开渠道和市场。Mellanox 的先例尤其显眼——主持人将其概括为支付70亿美元、6年价值增长45X、员工留存率约85%–90%。
  • Kagan 将当前性能斜率定在“每年10X或几个数量级”,但也明确承认:“能持续多久,我不知道。” 他的长期上行空间不止于生产率:Earth-2 可以让历史成为“实验科学”,AI 或许能够推断出人类从未设想的物理定律,而一种充当“心灵飞船”的技术,可能让人们想要完成的工作增长得比可用资源更快。

精读

1. Mellanox 将算力单元从芯片推向数据中心

  • Kagan 的起点是两种指数增长的错位:摩尔定律大约每隔2年翻倍,而 AI 模型的规模和能力开始每3个月翻倍。这意味着性能每年必须增长10X–16X,优化对象因此不再只是基础部件。

  • 纵向扩展如今意味着使用 NVLink,把36台各搭载2块 GPU 的计算机中的72块 GPU,在同一软件接口下变成一个系统。客户口中的 GPU 因而不再是芯片,而是“一台机架大小的机器”:“得用叉车才能把它吊起来。”

  • 横向扩展则将应用拆分到多台这样的机器上。Kagan 举例说,把一个1秒的任务拆到1,000块 GPU 上,可能在1毫秒内完成——但前提是任务分发和结果汇总不能暴露通信耗时。

  • Mellanox 在网络侧的贡献是延迟稳定性,而不只是峰值带宽这种“漂亮数字”。如果计算无法掩盖网络抖动,每个 worker 都要等待;一个原本可扩展到1,000块 GPU 的作业,实际可能只能高效利用10块。“从根本上说,网络决定这个集群的性能。”

2. 达到100,000块 GPU 后,故障、距离和散热成为架构变量

  • 某个部件即便有99.999-whatever%的时间正常工作,但一台包含100,000块 GPU 的机器拥有数百万个部件;Kagan 直截了当地总结:“所有部件同时正常工作的概率为零。” 硬件和软件必须在确定有部件损坏的情况下,维持服务、性能和能源效率。

  • 普通数据中心网络连接的是松耦合微服务;AI 算力网络可能在“100,000台机器上运行一个单一应用”。因此,调度器需要硬件和底层软件提供接口,才能高效安排任务的每个部分。

  • 跨数据中心会增加光速传播时延,并带来截然不同的延迟分布。Kagan 不接受老式电信网络的缓冲逻辑——“更大并不更好”,因为缓冲区会制造抖动;他称 Spectrum-X 提供遥测,让端点区分短通信和长通信,并围绕拥塞进行调整。

  • Pat 追问:如果核电站提供充足能源,数据中心本身是否还能继续扩张?Kagan 诚实但不完整地回答:“我不知道”,因为输入电力最终仍会变成输出热量。NVIDIA 已基本转向液冷;当前100–150 MW规模的设施,与业界讨论中的 GW级及拟议中的10 GW级站点并存,但部署速度仍可能取决于“混凝土多久才能稳定”。

3. 推理正成为规模更大、形态更多元的算力市场

  • 训练由前向推理、反向传播组成;在数据并行下,还要跨模型副本汇总权重更新。AI 主要还停留在感知阶段时——识别一只狗或认出一个人——训练需求占主导;但生成式 AI 会针对每个 token 重复执行推理,而推理过程还可能比较多条候选路径。

  • 推理本身又分为两种截然不同的工作负载。Prefill 将提示词和背景材料编码进上下文,属于计算密集型;decode 逐 token 生成答案,属于内存密集型,即便有些技术已经可以一次生成不止一个 token。

  • Kagan 的结论是,推理需求“实际上比训练还大”,因为每次响应所需的工作量都在增加,而且“模型只训练一次,但推理要进行很多次”。推理可以在手机或更小型的部署上运行;数据中心则可以混用为 Prefill 和 decode 优化的 GPU SKU,统一的 CUDA 可编程性让任一 SKU 都能承接另一种工作负载的需求变化。

4. NVIDIA 的下一轮扩张,将加速计算与通用计算结合

  • Kagan 对加速的论证始于显式编程的局限:冯·诺依曼机器可以执行指令,但“我无法解释如何区分猫和狗”。AI 解决的是另一类问题,但通用计算和占主导地位的 x86 工作负载并不会消失。

  • 因此,Intel 合作是将“加速计算与通用计算融合”。Kagan 对商业逻辑的概括是生态扩张:NVIDIA 不是要从既有市场中切走更大份额,而是“为所有人把蛋糕做大”,打开两家公司单独服务时更难触达的客户和渠道。

  • Pat 指出,2019年 NVIDIA 与 Mellanox 合计约值1,000亿美元;6年后,这一数字约为4.5万亿美元。Kagan 曾对 Jensen 说,“1+1会等于10”;他承认,自己的估算“差了4倍”。

  • 组织和财务数据都显示了整合效果:Kagan 估计,Mellanox 原有员工的85%–90%留了下来,NVIDIA 在以色列的员工人数翻了一倍以上,并计划建设新园区。BlueField DPU 还通过将数据中心操作系统和基础设施工作负载从应用处理器上剥离出来,扩大了 Mellanox 的作用,在最大化应用算力的同时缩小攻击面。

5. Kagan 认为,指数增长正将 AI 变成科学基础设施

  • Kagan 的科幻式目标是“让历史成为实验科学”。Earth-2 可以模拟今天的行动将如何影响50年后的全球变暖;更广泛地说,AI 的观察和归纳能力可能帮助揭示“我们今天甚至还想象不到”的物理定律。

  • 被问到摩尔定律的继任者时,Kagan 给出的答案是“每年10X或几个数量级”。2、3年前,NVIDIA 已将加速产品的发布节奏从每隔一年一次提速至每年一次,让客户可构建的机器获得数量级提升——而不仅仅是单颗芯片性能提升;但他明确对持续时间留出余地:“我不知道。”

  • 他的乐观类比从 Steve Jobs 将电脑称为“心灵的自行车”(bicycle of the mind),走向将 AI 称为“心灵的宇宙飞船”(spaceship of the mind)。效率提升并不会让需求止步于原有水平:给项目负责人2X的资源,他可能做出4X的工作量,同时还想要10X的资源。就像电力一样,AI 可能成为不可或缺的基础设施,而其应用无法从平台诞生之初就被预测。