
Vikram Sekar
观点集合
为什么内存是 AI 最大的瓶颈:Vikram Sekar|第170期
- 🗓️ 日期:
2026-10-03| 🎙️ 节目:Frictionless
Vikram Sekar 判断,AI 的核心瓶颈是内存而非原始算力,低内存架构或可同时缓解带宽与网络约束。铜缆在400Gbps失效后,光互联与DRAM-on-logic或受益;但 Anthropic S1 涉及超过5000亿美元投入,过度部署风险仍待观察。
查看访谈对话精读提要
Vikram Sekar 的核心判断是,内存而非原始算力,是 AI 最深层的系统瓶颈。 LLM 没有用满 GPU 算力,是因为内存和网络无法足够快地供给数据;因此,内存占用更低的模型架构可能同时缓解多重约束:“内存瓶颈,也就是内存带宽瓶颈,进而也是网络瓶颈。”
面向消费者的智能体应当扩大推理需求,但不会沿着 Mac mini 热潮所暗示的那条永久专用处理器曲线增长。 大多数个人任务用 Sonnet 级别或开源模型就能完成,处理器和内存则可以共享,或在需要时即时启动。需求仍会增长,但 Vikram 警告说,“一切都会因为智能体而爆发,而这可能并不会真的发生。”
即便今天的财务投入最终被证明过度,AI 仍然是一项具备长期韧性的技术。 Vikram 预计这项技术未来10年仍会“向右上方增长”,但他提到 Anthropic 的 S1,称其有义务投入的资本和算力资源对应金额似乎超过5000亿美元。实验室可能订购过多内存、制造供给过剩并遭遇崩溃,但这并不会推翻底层的采用逻辑。
训练仍是统一集群问题,而推理正变成一片“狂野西部”。 从72块GPU、约200 kW的 Blackwell 机架走向144块GPU,意味着功耗超过400 kW,同时冷却和网络难度进一步上升;如果再把576块或1,152块GPU分散到多个机架,连接距离就会超出铜缆的能力范围。推理则缺乏同样的秩序:混合专家模型会从不同位置调用不同权重,让数据搬运变成“彻底混乱”,也为 Cerebras、Groq、Microsoft Maia、Meta MTIA 及其他专用架构留下空间。
短期内,扩展规模的技术路线越来越偏向光互联,因为铜缆正在逼近物理极限。 铜缆在机架内部可以支持200Gbps,但无法跨越8个机架、约10米的距离;到了400Gbps,Vikram 认为它“已经彻底失效”。共封装光学可以在降低转换功耗的同时提供传输距离,但对于包含100,000块GPU的系统而言,可靠性、替换和大规模部署仍是问题。
内存层级的优化目标应是每个 token 产生的有效工作量,而不是让所有场景都追求最高 token 吞吐。 对于上市时间至关重要的编码任务,1,000–2,000 tokens/秒和昂贵的带宽可能物有所值;而在后台读取 PDF 的智能体,则可以用更慢、更便宜的方式处理大量 token。真正的经济问题是:“每个 token 实际完成了多少有用工作?”
HBM 目前提供了最佳的带宽—容量平衡,但堆叠继续扩大正面临成本和扩展限制。 目前堆叠已经达到16层,Vikram 质疑继续推进到20层或24层是否仍具备经济性和技术合理性,并关注晶圆键合的 DRAM-on-logic 方案,后者有望实现“类似 SRAM 的带宽,但拥有类似 DRAM 的容量”。不过,任何效率突破都可能触发杰文斯悖论:单位任务的资源消耗下降,会刺激足够多的新需求,最终“我们的计算资源还是不够”。
🔗 原始收听与视频来源: 为什么内存是 AI 最大的瓶颈:Vikram Sekar|第170期