先锋 趋势 方法 投研 作者
29.直击 2025 GTC(下)|王冠之重,黄仁勋如何回应一切质疑?
返回节目精读

29.直击 2025 GTC(下)|王冠之重,黄仁勋如何回应一切质疑?

摘要

  • 英伟达在 2025 GTC 上把核心增长叙事从 training 切换到了 inference。 姚欣称,行业从 2024 年六七月起已意识到训练侧 scaling law 边际减弱,DeepSeek 的出现则把这一判断推成大众共识:下一阶段要卷性价比、应用与 token 成本。黄仁勋几乎不再讲 training,而是反复讲“token token token”,并用单次回答约 20 倍 token、可能 100 倍算力的口径证明推理仍需要海量计算。
  • Blackwell Ultra、Rubin 与三年路线图背后,是资本市场要求英伟达立刻证明出货与增长。 GB200 首批产品曾传出散热和系统稳定性忧虑,DeepSeek 又引发架构变迁疑问,因此机器人让位于更近的交付承诺:主流云厂商去年买了约 120 万张 Hopper,如今已订约 360 万张 Blackwell。“告诉我今年能出多少货,明年能出多少货”才是当下压力,姚欣的概括是:“英伟达急了。”
  • DeepSeek 冲击的关键,不是算力需求消失,而是英伟达能否把训练时代的垄断复制到推理市场。 卫诗婕引用袁金辉的比喻:“训练所需的算力是一池游泳池,推理所需的算力可能是一条河”;但河里的计算更分散、更重调度,也让 AMD 等性价比方案获得了挑战空间。GTC 后股价仍跌,说明市场尚未接受“买得越多,省得越多”的全部逻辑。
  • Dynamo 是英伟达对推理时代最具体的软件回应,也可能是一次受中国开源实践推动的快速追赶。 它把数据中心包装成生产 token 的“AI 工厂”,其介绍中出现 PD 分离、专家并行等术语,并用于管理集群、优化部署与利用率;姚欣认为其思路与 DeepSeek 二月开源周的组件“异曲同工”。卫诗婕还猜测部分架构像 Kimi 的 Mooncake,姚欣则表示开源项目之间可能存在借鉴。NVL72 卖出 72 张卡组成的集群,Dynamo 则补上部署、调度和利用率优化。
  • DeepSeek 展示的是系统工程挖潜能力,而不是绕开了英伟达。 幻方的量化背景使团队长期重视底层效率;其调用 CUDA 内近似汇编语言的 PTX,把硬件性能压得更深,却也意味着代码可能更“only for 英伟达”。姚欣不同意“全球只有屈指可数的人能做”的说法,认为许多拥有十年以上 infra 积累的团队都具备类似能力。
  • CUDA 的生态壁垒仍强,但基座模型集中化正在降低跨硬件适配成本。 英伟达曾靠免费送卡、工程师驻场和 cuDNN 培育开发者,形成“先调通 CUDA,再迁移别的平台”的默认路径;未来基座模型若收敛为少数几款,AMD 等厂商逐一适配便容易得多。姚欣因此判断,十年尺度上软件护城河会逐渐消融,百分之八九十的毛利率与 25—30 倍 P/E 很难被视为永久状态。
  • perception、generative、Agentic、physical AI 四阶段,把英伟达的长期 TAM 一直推到物理世界。 姚欣把它比作生物从感官、大脑到数字手脚、实体手脚的进化,卫诗婕则理解为感知、思考、代理、行动的完整反射链。physical AI 若要模拟摩擦、弹跳和全部物理定律,最终瓶颈不是想象力而是能耗:“英伟达最终要对抗的,是物理定律。”
  • 中国既是英伟达失去的一块重要市场,也是迫使硅谷加速迭代的技术压力源。 姚欣称,从财报印象看,中国曾占英伟达全球芯片销售约 24%;卫诗婕补充禁售后跌至 10%以下,姚欣解释说这是因为很多芯片被禁售。本届现场除联想外几乎没有中国展台,China AI Day 也转到线上。可硅谷仍在争抢 Manus 的邀请码,并开始正视中国在性价比、应用场景与数据上的优势:“虽然大家不讲中国,但是中国对于整个硅谷产生了冲击。”

精读

1. 英伟达的基本盘,是提前押注哪里会需要海量计算

  • 姚欣把起点追溯到约 2000 年:GPU 原为 Graphics Processing Unit,Bill Dally 等学者却提出 GPGPU,把并行结构用于视频、科学计算和生物模拟。黄仁勋将 Dally 挖为首席科学家,英伟达由显卡走向通用计算。

  • 约 15 年前,英伟达曾尝试把整块芯片放进移动设备,但因耗电转向掌机,后来用于 Switch、汽车和早期自动驾驶模拟;2016 年黄仁勋又向初创期 OpenAI 捐赠 AI 服务器,由 Elon Musk 签收——姚欣称这是一家公司“持续下注未来”的缩影。

  • GTC 因而不只是产品会,更像技术展望会,甚至被吐槽成“期货发布会”:今天宣布,明年才可能看到。黄仁勋售卖的并非单一芯片,而是下一批会吞噬计算量的场景。

  • 姚欣用“分久必合,合久必分”概括底层周期:IBM 大型机的集中计算被 PC 集群分散,Google 云又把百万服务器集中;自动驾驶、物联网、机器人和手机端模型则可能再次把算力推向边缘。英伟达抓住的是并行、分布式与加速计算这条二十年主旋律。

2. 四种 AI 把增长终点推向物理世界,但能耗决定上限

  • 黄仁勋给出的路径依次是 perception AI、generative AI、Agentic AI 和 physical AI:从人脸、声音识别,到 ChatGPT 式生成,再到能在数字世界完成任务的 agent,最后让 agent 借机器人进入物理世界。

  • 姚欣的个人解读是“像一个生物的进化的四个过程”:先长出感官,再发展大脑和神经系统,然后拥有数字世界的手脚,最终拥有实体手脚。卫诗婕补充了另一套理解——接收信息、计算思考、形成代理行动,最后真正改变物理世界。

  • physical AI 的野心,是把弹跳、反射、摩擦等物理规律全部纳入模拟;这也引出两人的终极追问:“我们今天的所谓真实,到底是真实还是一个模拟?”但商业瓶颈更现实:大型数据中心仅散热就可能占约 40% 能耗,英伟达必须在固定能源下把 token 产出提升十倍、百倍。

3. 机器人让位于出货路线图,因为黄仁勋先要回答眼前质疑

  • 两人原本预期大会会大讲人形机器人,实际篇幅却低于预期。姚欣认为,不是英伟达放弃 physical AI,而是投资者此刻不愿只听十年故事:“告诉我今年能出多少货,明年能出多少货。”

  • 一年前预告的 GB200 已开始出货,但首批产品传出散热和系统稳定性忧虑,DeepSeek 又让市场怀疑算力架构是否生变。黄仁勋因此集中推出 Blackwell Ultra,并把原先称为 X100 的下一代正式命名 Rubin。

  • 更异常的是,英伟达一次性列出未来三年的产品和交货时间。姚欣反复强调这是压力信号:“英伟达急了”,路线图也是写给美国东岸资本市场看的答卷。

  • 现场气氛也从去年的“摇滚顺风球”转为务实商业会。黄仁勋称自己没有提词器,表达中停顿、口误更多;姚欣感觉部分产品线“匆匆在推出”,反映 AI 行业以三个月为周期逼迫巨头快速调整。

4. “1·27”把行业内共识突然传导给了资本市场

  • 卫诗婕把 DeepSeek R1 发布后的英伟达暴跌称为资本市场口中的“1·27 惨案”,并提到一份被称为“史上最成功”的做空报告:它质疑低成本模型会否击穿英伟达的高市占率与高利润率。

  • 姚欣指出,AI 从业者与外部投资者之间存在时间差。2023—2024 年行业仍在建设智算中心、争训更大的模型;但从 2024 年六七月开始,业内已在讨论训练侧 scaling law 变弱,到了 11 月底,OpenAI 的 Ilya 又表达过数据“都快被用完了”的判断。

  • 真正的迁移是从模型训练走向模型推理和应用,只是资本市场较晚才看见。DeepSeek 的破圈让企业决策者意识到:开源模型能力已经不错,接下来要卷的是性价比、使用成本和落地,而不只是更高的性能指标。

  • 卫诗婕引用硅基流动袁金辉的形容:“训练所需的算力是一池游泳池,推理所需的算力可能是一条河。”推理总量可能更大,却不再完全遵循集中训练的同一套架构,这正是英伟达机会与风险同时放大的地方。

5. 黄仁勋用订单和 token 回应 DeepSeek,市场仍追问垄断性

  • 发布会开场先报商业数字:按黄仁勋所述,主流云厂商去年购买约 120 万张 Hopper,目前已订购约 360 万张 Blackwell。其潜台词是,客户并未停止投入,订单反而仍在大幅增加。

  • 黄仁勋随后把 reasoning 模型改写成算力利好:一处对比称,同样回答下 DeepSeek 类模型可能多用约 20 倍 token、消耗约 100 倍算力;另一处又用“单位时间百倍级 token”强调增长。他把结论浓缩为“buy more, save more”——买得越多,省得越多。

  • GTC 后股价仍下跌,说明疑问尚未消失:训练市场几乎由英伟达定义,但分布式、成本敏感的推理市场是否仍只能选它?姚欣认为,这个问号而非“推理不需要算力”,才是估值震荡的核心。

6. Dynamo 把数据中心变成以 token 计产量的“AI 工厂”

  • 黄仁勋把 IDC、AIDC 再升级为“AI factory”:传统工厂送入原材料、产出锅碗瓢盆;数字工厂送入数据,产出文字、音频、视频及各种 token。token 由此成为数字商品的最小计价单位。

  • 工厂竞争的关键不是装了多少卡,而是在特定能耗和时间内能产出多少 token,能否让设备 24 小时运转。姚欣认为,这个看似不性感的表述,标志着行业从“造神”转向生产效率和投入产出比。

  • Dynamo 可以理解为 AI 工厂的操作系统:它管理大量 GPU,优化数据中心的部署、调度和利用率;其介绍中出现了 PD 分离、专家并行等术语。

  • 姚欣明确把“受 DeepSeek 推动”标注为个人解读:他认为 Dynamo 与 DeepSeek 二月开源周展示的组件“异曲同工”;卫诗婕还猜测其部分架构像 Kimi 的 Mooncake,姚欣回应说这些都是开源的,可能存在借鉴和参考。由于这些内容在半年前沟通和年初 CES 均未出现,他推测英伟达可能快速吸收了近一两个月的行业成果。

7. 分布式推理把大模型拆成专家,也把单机生意改成集群生意

  • 姚欣以 DeepSeek 满血版 671B 解释 MoE:它可理解为由数百个小专家组成,不同专家可能是 7B、20B,分别擅长内容整理或逻辑推理,而非每次请求都调用全部参数。

  • 若把一百个专家平均放在一百台机器上,热门专家会拥堵,冷门专家则闲置。DeepSeek 的办法是按调用率重新分配,把低频专家集中、高频专家分散,让十台乃至一百台机器共同服务;卫诗婕称之为“共享经济”,姚欣也认可这是“算力的共享经济”。

  • NVL72 把 72 张卡作为集群出售,Dynamo 再交付自动部署与调度实践。英伟达由此不只卖单卡,还卖集群及其软件管理层;这是一套“明显为推理优化而生”的路线,与训练大模型的技术重点不同。

8. AI 预期降温不是终局,而是应用开始接管产业链

  • 姚欣借 Gartner Hype Cycle 解释 GTC 气氛转暗:新技术诞生时预期上涨快于实际进步,随后会出现预期落空、曲线滑落;“泡沫破灭根本不是个坏事”,它会挤掉水分,让技术在合理预期中走向成熟。

  • 从 scaling law、超大模型转向 AI 工厂、成本和 token 产能,表面上不再性感,却意味着能力已经验证、价格足够便宜。姚欣预计,未来一两年 AI 可能像互联网和移动互联网一样“润物细无声”,进入大量日常场景。

  • DeepSeek 之后,国内政企、教育和医疗等此前较慢的行业也开始拥抱 AI。基础设施厂商必须既让 token 更便宜,又能弹性承接一千万乃至一亿用户;受益者将从卖卡者扩展到模型服务、算力调度、垂直模型和应用软件厂商。

9. CUDA 曾靠开发者习惯筑墙,模型收敛正在降低这堵墙

  • 卫诗婕提到一个早期反例:约 2011—2012 年,Jeffrey Hinton 曾写信表示,只要英伟达送卡,他便会在学术会议上推荐大家使用,但英伟达拒绝了。姚欣认为那时仍太早,深度学习尚未真正进入行业视野。

  • 深度学习浪潮被行业接受后,英伟达反应迅速:工程师进入初创公司协助使用 CUDA、cuDNN,高校还能免费申请 1080 等显卡。它由此“捕获了大量开发者的心”,形成先用 CUDA 调通、再迁移其他平台的默认习惯。

  • 过去两年有上百个模型,每个模型适配不同卡的成本极高,CUDA 因而极具优势;但百模大战结束后,基座模型可能像 iOS、Android、Windows、Linux 一样只剩少数几款。硬件厂商逐一兼容的难度下降,Agent 编程又进一步遮蔽底层。

  • 姚欣判断,AMD 等性价比方案会随标准化获得机会,CUDA 壁垒在十年尺度上“慢慢消融”。英伟达当前百分之八九十的毛利率、25—30 倍 P/E 能否持续十年二十年,仍是极高要求;卫诗婕引用 Kevin Kelly 的判断:“没有任何一个科技巨头会长期在一个垄断地位。”

10. DeepSeek 的优势来自量化式系统工程,但 PTX 并未绕开英伟达

  • 姚欣认为,DeepSeek 不是常见的纯算法科学家团队,其母公司幻方来自高频量化:交易快 0.1 微秒或零点几毫秒都可能产生收益,因此会自建数据中心、优化全栈,并在大模型热潮前就持有大量 A100,市场还曾传其约有一万张卡。

  • 对于“世界上能胜任底层优化的人屈指可数”的评价,姚欣明确不同意。他以自己 2004 年创办 PPTV 的经历反驳:当时没有公有云,团队从服务器、操作系统一路做到云架构;许多拥有十年以上 infra 积累的企业同样具备底层优化能力。

  • 技术上,DeepSeek 并未摆脱 CUDA,而是调用其中近似汇编语言的 PTX,更直接地操控英伟达硬件。性能因此提高,绑定也可能更深;真正的行业启发是,系统架构与深层工程仍有巨大挖潜空间,而非只有扩大模型规模一条路。

11. 中国从 GTC 舞台上淡出,却已进入硅谷的竞争假设

  • 姚欣援引自己对财报的印象称,出口限制前中国约占英伟达全球芯片销售的 24%;卫诗婕补充称后来跌至 10%以下,姚欣解释说这是因为很多芯片被禁售。黄仁勋前段时间还穿花袄参加英伟达公司年会,也说明中国仍是不可或缺的消费与开发者市场。

  • 地缘政治在现场留下明显痕迹:China AI Day 实际安排在北京时间、以线上中文形式进行;GTC 展区除仍销售服务器的联想外,几乎没有中国模型或应用公司的展台。

  • “虽然大家不讲中国,但是中国对于整个硅谷产生了冲击。”姚欣称,硅谷产业人士在寻找 Manus 的邀请码,也开始认真比较中国公司的性价比和产品服务;这与国内部分负面讨论形成反差。

  • 姚欣最后判断,目前只有中美具备较完整的 AI 综合竞争能力。中国仍在追赶,但差距正在缩小,进入应用、专业场景和数据优势阶段后,中国企业的相对优势反而增加:“我们也需要对自己更有自信一些。”