先锋 趋势 方法 投研 作者
Vol.154 产业观察26|“DeepSeek开了第一枪,更值得期待的是AI普惠”:与季宇聊AI产业新机遇
返回节目精读

Vol.154 产业观察26|“DeepSeek开了第一枪,更值得期待的是AI普惠”:与季宇聊AI产业新机遇

摘要

  • DeepSeek 的降本核心是 MoE 架构+为 MoE 定制的 infra:671B"满血"模型每生成一个 token 实际只激活 37B 参数,读取的参数量"甚至可能不如一个七十B的模型",叠加 DeepSeek 在推理框架上针对 expert 维度的联合优化,R1 的 API 调用成本约为 GPT o3 mini 的近十分之一。 季宇的判断:降本空间还没挖完,针对 MoE 的深度优化"本身又可以进一步的去降本"。
  • 为什么是中国公司做出来:芯片禁令制造的"选择压力"。 硅谷可以无限量买 H100、并预期拿到 GB200,沿 Scaling Law 惯性狂奔"没有选择压力";国内不一定能拿到 H100,拿到的一般是阉割版,被迫在"小 dense 或超大 MoE"之间二选一,DeepSeek 针对极致 MoE 的重新设计反而形成巨大竞争优势——“是被这个禁令产生的环境的变化倒逼出来的”。
  • 算力资源护城河可能"不堪一击":季宇认为云厂商围绕 OpenAI 算法+NV GPU、以万卡集群为门槛"人为创造技术门槛"的路线已被 DeepSeek 打破,“资源的护城河是容易被技术打破的”,在 AI 大规模经济化之前构筑门槛"本质上都是对这个行业的拔苗助长"——真护城河往往建在商业模式、生态与组织文化上。
  • 投资主线是"AI 普惠"对"大型机化"的博弈:NV+Scaling Law 体系在重演上世纪大型机——几百万上千万的机器才能跑最好的模型;季宇押注 x86 式颠覆重演,“IBM 这样的蓝色巨人,就是被看起来很弱的、很低端的 x86 芯片给颠覆掉了”。 若几千到几万元芯片能跑满血 DeepSeek,集群总服务能力反超昂贵大机,DeepSeek 只是"开的第一枪"。
  • 国产芯片的真机会不是"兼容 DeepSeek":人人宣布"国产芯片能跑 DeepSeek"只是追随逻辑,“很难真正意义上冲击”;破局要塑造比 NV 体系"更有吸引力、更有竞争力的体系"。 具体空白:端侧(8B 模型 200 token/s)和万卡训练两头都有人做,laptop、迷你主机、home lab 的中间档"还没有满足需求"——但切入卡点在生态(必须跑 Windows/macOS),不在技术。
  • Scaling Law 预训练路线确实遇阻,下一范式在推理时探索:季宇认为 GPT-3/4 的跃升"不能指望这条路径持续帮你不断获得提升",O1/R1 依赖数学和 coding 这类可快速验证 reward 的场景,泛化到无 reward 的开放领域"可能未来也会慢慢撞到新的墙";更大的探索空间在语言本身的自我思考能力,而非"不断找更多 reward"。
  • 组织与文化是重要护城河:季宇高度认同梁文锋"技术优势是短暂的"——DeepSeek 的成功是 infra、算法、模型的联合创新,梁文锋对 CUDA 算子"每一个线程到底在干什么事情都了如指掌",用的多是国内在校研究生而非大厂标签人才;中国过去四十年靠经验主义高效成事,但创新需要反经验主义之后"build up 一个新的组织方式"。

精读

1. 行云把自己变成客户:私有化部署 DeepSeek 做 AI 编程,“从不屑到惊喜”

  • 季宇团队从去年八九月 AI 编程火起来后开始私有化部署——云端方案有高额订阅费和信息安全问题。内部把千问、DeepSeek 等模型全部试了一遍,“私有化部署之后跑的效率非常高,比云端的 API 还要高得多”,最终选定 DeepSeek 2.5,因为效果确实最好。
  • 关键发现:小模型做代码补全 OK,但一上到 Continue、Cline 这类 Agent 流工具,“只有这种特别大规模的模型能够比较稳定的工作”,小模型会"指令跟随丢失,导致插件开始崩溃"。芯片公司写 Verilog 语料稀少,研发同事起初"想尽一切办法去考验它",但"每个人都经历过从完全不屑到使用了之后感觉还不错,甚至有点惊喜,再到高强度使用"。
  • 李翔的消费者侧补充:在线模型除 OpenAI 外"都非常的吝啬",号称长上下文实际用搜索方式读,几万字全文翻译做不出来;自己用 3090 本地跑 32B 量化模型,“虽然会越跑越慢,但它能把你的任务给完整执行下来”。

2. 出圈的配方:开源免费 + R1 不需要你会 prompt + 春节

  • 季宇不意外 DeepSeek 会火——工程能力和基座能力一直很强,加上开源免费;但"火成这个程度确实是比较超预期的",被捧到"国运层面"、“中国特色的 AI 平权”。他点出一个被低估的因素:春节回家手把手教爸妈用,是大规模出圈的重要推手。
  • 技术上的易用性跃迁:以前的模型"你能很好的 prompt 你的模型,你才能够去使用它",父母问个简单问题模型答得一塌糊涂;R1 自己会思考,DeepSeek 的 tech report 甚至建议不要过度 prompt——“让模型自己去理解你”,于是大众"用千奇百怪的方式去问它"也能得到好答案。
  • 横向对比的细节观察:同期推出的 Kimi K1.5 语言"非常方言化,有非常多北方的口语化用词",DeepSeek 则"更板正"、更书面化。真正有深度推理能力的开源模型稀少,因为"深度推理的能力很依赖模型本身的质量要足够高"——把市面上的各种模型筛了一遍后,大模型+reasoning 目前可能只有 DeepSeek 达标,Llama 最大版本相比 70B"可能没有特别大的提升"。

3. 成本十分之一的机理:MoE 稀疏激活 + 为 expert 维度重写 infra

  • 核心账目:671B 参数按 8bit 算就是 671GB 存储,但 MoE 是稀疏模型,每生成一个 token 只激活 37B 参数;而传统 dense 模型 70B 可能要为每个 token 读满 70G。结果是"看起来是六七百 B 的模型非常大,但每次推理一个 token 需要读的参数量甚至可能不如一个七十 B 的模型"——这是 R1 调用成本接近 o3 mini 十分之一的第一性原理。
  • 第二层是 DeepSeek 的 infra-算法联合创新:行业受 dense 路径惯性影响,习惯 TP 并行等分布式方式,DeepSeek 把训练和推理的分布式"完全转向为 MoE 的 expert 这个维度去做",整个推理框架为此定制,“这里面还有更大的空间可以挖掘出来”。季宇归因于团队"跨领域协同、原创性的能力可能更强"。
  • 李翔的总结定性:MoE 把更大规模的模型能力下放到相对低成本的硬件上,加上思考推理带来的长输出提升答案质量,合成一个"中国特色、高性价比、高质量"的模型,天时地利人和。

4. 为什么是中国公司开的枪:禁令制造的选择压力

  • 季宇的框架值得完整保留:美国公司"随时可以买到大量 H100,而且有预期未来可以拿到比 H100 更强的 GB200",“它是没有选择压力的,所有的路径都在往前走”——在硅谷,Meta 会训练超大规模 dense 模型;硅谷整体上 MoE 与 dense 大体各占一半。国内受禁令影响不一定拿得到 H100、“拿到的一般都是阉割版”,于是长期基本上就是两条路:要么小规模 dense,要么超大规模 MoE——“这个其实就是选择压力带来的”。
  • 既有技术栈都是沿"小 dense 做大 dense"的 Scaling Law 路径挖出来的,所以 DeepSeek 针对性优化 MoE"就会带来巨大的竞争优势"。结论直白:“为什么是一家中国公司来做的?我觉得反而是被这个禁令产生的环境的变化倒逼出来的。”

5. Scaling Law 确实遇阻,新范式是承接而非替代

  • 对"OpenAI 训练受阻、GPT-5/4.5 一直拖"的传言,季宇的判断是"实际上是遇到一些阻碍的":GPT-3/4 相对上一代深度学习的提升很大,“但你不能指望这条路径可以持续的帮你不断的获得提升”,去年九月坊间已传 Scaling Law 受阻——这与 DeepSeek 杀出来是相对独立的事件。
  • 他很早就认为推理时扩展是必然:预训练给了模型自然语言的基础能力平台,“它自然要往下一个范式去走,才能再创造下一次跃迁式的提升”。范式之间"不是非此即彼,是承接的关系"——就像后训练建立在 V3 这样足够好的基座上迭代出 R1。
  • 但现有路线有明确边界:O1/R1 都建立在数学、coding 这类"可以快速获得大量可靠 reward"的场景上,语言的强泛化让思考能力扩散到未经强化学习调节的领域,“但如果光靠这两个领域去驱动,在更多领域的泛化会变得越来越弱,可能未来也会慢慢撞到新的墙”。反过来,“正是因为资源受限,大家才会寻找新的解决方式”。

6. 下一步要的不是数据,是 reward——但语言本身才是底座

  • 对"数据是否耗尽、AI 自己生成数据训自己"的追问,季宇换了坐标系:R1 这类推理模型"可能要的并不是数据,要的其实是 reward"——强化学习的方法论就是随机生成一堆,靠外部信号分好坏再调整自身;数据只是"非常非常强的监督信号",广义信号可以弱化到"这个好一点,那个稍微差一点"。
  • 他标注了这是个人观点的关键分歧:“大家可能认为这里面最重要的是强化学习,我其实认为最重要的还是自然语言本身,语言本身才是提供思考能力的底层基座。“人可以"闷头思考一下午,脑海里自己做逻辑演绎,得到更深刻的结论”——这是语言带来的自我验证、自我迭代能力,而 AlphaGo 式左右互搏"并不是一个被充分定义、可以落入已有工具箱的方法论”,这里"还有更大的空间可以去探索"。
  • 两条路不冲突:找到更多领域做强化学习,能"因为不同领域数据特征的差异把模型不同方面的能力激发出来"——ChatGPT 的突破正是"把代码跟自然语言放到一个模型里去训",之前分开训"效果都不是特别好"。

7. 护城河审判:资源门槛是拔苗助长,商业生态才算数

  • 季宇的核心命题:“资源的护城河是容易被技术打破的”,靠一万张卡、数据量、GPU 数量建的门槛"可能都会逐渐被打破";真正的护城河往往是商业模式和生态。DeepSeek 对 NV 最大的冲击,就是打破了云厂商和巨头"围绕 OpenAI 的算法、围绕 NV 的 GPU,以万卡集群为门槛人为创造技术门槛"的狂奔路线。
  • 更进一步的判断:AI"还没有进入到经济系统当中发挥出巨大的商业价值",此时构建门槛"本质上都是对这个行业的拔苗助长";而像 DeepSeek 这样先让行业发展起来,“只要你有经济循环,自然就会有商业结构,有商业模式以及相应的新的护城河”。在技术大规模经济化之前,“这些所谓的门槛可能不堪一击”。
  • 对"有人叫嚣完全封禁显卡在中国或少数发达国家使用"的解读只有一句:“明显反映出他们有点着急了,面临挑战的第一反应就是更加的固步自封。”

8. AI 普惠 vs 大型机:x86 颠覆 IBM 的剧本重演

  • 这是季宇也是行云的核心投资叙事:NV+Scaling Law 体系"本质上在推动一个大型机化的计算机体系",越来越像上世纪八十年代"几百万上千万的机器才能跑一个今天最好的模型"。而历史的另一边,“很多人可能都不知道 IBM 在八十年代以前是什么样的行业地位,但这样一个蓝色巨人,就是被看起来很不起眼的、很弱的、很低端的 x86 芯片给颠覆掉了”——PC 革命和互联网革命都建立在那套"更经济性的计算机底座体系"上。
  • 推演到 AI:如果几千块、几万块的芯片就能跑满血 DeepSeek,“用这种几万块钱的芯片组一个集群,总的服务能力可能比那一台非常昂贵的高价值机器还要强”,大型机体系就会"越来越失去价值"。DeepSeek"肯定是开的第一枪",但掘掉护城河"这可能只是一个起点"——后面是 AI 普惠的产业结构与靠硬件资源形成垄断体系的小圈子之间的博弈,芯片是必然的参与角色。
  • 落到行云自身:私有化部署从"大家觉得需求到底在哪儿、这个市场可能今天是零"变成共识;当前市场只有"几百万的满血模型"和"低精度蒸馏模型"两极,行云要做的是把满血、不量化压缩的模型变成人人用得起的标配——“其实没有必要凑合”。

9. “国产芯片能跑 DeepSeek"不是破局,“酷大"生态也不是口号能成的

  • 对市面上扎堆宣布"接入 DeepSeek、国产芯片兼容 DeepSeek"的降温:“如果是’美国有 OpenAI 我有国产模型,美国有英伟达我有国产芯片’这种简单的逻辑,这不是今天 DeepSeek 真正出圈的原因。“DeepSeek 出圈是因为找到了比既有路径更好的新路径——极致 MoE 在软硬件综合取舍上"取得更好的经济效应”。硬件若只是"Nvidia 可以跑 DeepSeek,我们的芯片也可以跑”,“很难真正意义上冲击”——那还是过去两年国产模型追随美国路径的老逻辑。真正的破局是塑造"比今天围绕 NV 的体系更有吸引力、更有竞争力的体系”。
  • 开源模型的标准化确实给了国产芯片一个出口——“不管你用什么样芯片,只要能把它很好的跑起来,都可以接入 API 作为服务”,但发酵之后"肯定还是会回归到谁的方案最好、更符合经济逻辑”。
  • 李翔盘点出的空白档位:端侧推理已被覆盖(8B 模型 200 token/s)、服务器私有化和万卡训练都有人做,“中间这块好像还没有满足需求”。李翔认为 laptop、迷你主机有挺大机会,“核心其实不在于技术本身,还是在生态你怎么切”——手机 SOC 外人切不进去;laptop"你不可能自己做个芯片上面跑 Linux,你得跑 Windows 或 macOS";home lab(买台迷你主机专供大模型能力)的需求"今天可能还没有真正意义上激活"。

10. 梁文锋的示范:反经验主义之后,还要 build up 新的组织方式

  • 对梁文锋"技术优势是短暂的,真正的护城河是文化和组织",季宇"高度认同":OpenAI 刚出来时所有人的技术都追不上它,但"全世界有这么多优秀的人,一定可以把这件事情复现出来,你很难去通过技术挡住别人"。DeepSeek 的成功是 infra、算法、模型的联合创新,对组织能力要求极高——核心成员很多是国内高校研究生或刚毕业的博士。季宇从在 DeepSeek 的师弟处听到的细节:“他们老板对于他写的这个库或算子里面的每一个线程到底在干什么事情都是了如指掌的”——而今天很多做 infra 的人都不一定深入了解 DeepSeek 的优化到底是怎么回事。
  • 创新的方法论:“不是简单的说把一堆不同领域最聪明的人聚在一起,他们就可以迸发出价值”,单纯脑洞试错"效率其实是很低的,创新本身也是需要效率的",保障就是第一性原理的通盘思考——而组织者"要能深入到细节里面,知道每一层到底要干什么,才能打破每一层的边界条件去看"。
  • 对国内惯性的诊断:投资也好创业也好都信经验主义——“相信行业专家,相信大牛,相信标签”,这方式不是有问题,“中国过去四十多年的经济腾飞本身就是靠这样的方式发展起来的”,成功率确实高。但"反经验主义并不是单纯的把这些东西抛弃掉就行,摧毁一个东西很容易",还要"build up 一个新的组织方式"。梁文锋连人才定义都不同——可能更多找在校学生,而非大厂标签人才——“他自己躬身入局,成为了第一个案例,是这个扭转的一个起点”。转变的确认不能靠单一事件:“一定是出现了大量类似的情况,我们才能真正意义上说这件事情发生了转变。”
  • 李翔的三十年断代史框架:2000-2010 中国制造(廉价成本大量生产),2010-2020 物美价廉(小米式,可能用 20% 的价格做到国外 80% 的性能或能力),最近五年 me better——“在某些行业里做到远超海外的能力,同时保持相对低的价钱”;投资上对应的就是投 AI native 的创始人。

11. 三年后的应用图景:生产力私有化,消费娱乐上云,交互傻瓜化

  • 季宇的第一步:让所有人用得起满血模型,“低精度压缩这些事情可以抛到后面”——类比今天的电脑内存,“你不会在乎浏览器吃掉了你一个 G 的内存,因为内存已经足够大而且足够便宜”。普及后 AI 会像手机/PC 生态平移一样渗透所有行业,从愿意付费的高价值场景(AI 编程)入手,做到"大家不用考虑值不值得花钱,因为成本基本上可以忽略不计"。
  • 终局不全是私有化:“云一样是有巨大的机会”,互联网拼的就是体验-流量-商业回报的循环;DeepSeek 天天"服务器繁忙",泼天流量下服务器要扩很多倍、商业回报会变低——出路是像"以前 Google 攒一堆 x86 攒搜索引擎基础设施"那样,用非常便宜的机器攒大规模集群,“你这个时候才有可能去服务成千上万的应用”。原则:“不要以硬件资源来划分商业结构,而是以哪种商业结构最适合”——生产力工具私有化部署,消费娱乐类适合互联网。
  • 李翔的畅想:短期 OpenAI 仍有"指路效应"(Deep Research 式个人助手会普及);终端连屏幕都不需要、有个扬声器接云端大模型就能实现很强的功能;交互代际演进——“我们这代人打字打得很溜,零零后全是触摸操控,一零后的时代就是纯语音”。但他也保留了一个当下的清醒:惊艳应用背后仍在调 OpenAI 的 o1 且限制使用量,上下文也还不够长,“今天其实没有看到大家比较好的利用起来大模型的能力,可能还是要等一下基础设施的变化”。