第002期——InferenceX 2.0发布(技术团队)| Cam Quilici、Bryan Shan、Doug O'Laughlin、Jordan Nanos
第002期——InferenceX 2.0发布(技术团队)| Cam Quilici、Bryan Shan、Doug O'Laughlin、Jordan Nanos
摘要
- InferenceX 2.0的头号结果是:在低交互性场景下,GB200/GB300单GPU的DeepSeek-R1吞吐量达到完全调优H100的20倍;在100 tokens/sec/user下则达到80–100倍,而H100基本无法提供这一速度。 关键机制在于NVLink域:DeepSeek的256个专家分散在“72块GPU组成的一台机器”上,而不是跨InfiniBand通信;Cam Quilici称这直接“碾压”其他方案(“frame mogs”)。Jordan Nanos强调,100 tok/s是实际生产需求——Cerebras上的Codex Spark等“快速”层级已经超过这一速度,而标准模型约为40 tok/s。
- 软件的复合增速不亚于硬件:AMD的MI355多节点DeepSeek方案,在约1个月的ROCm优化后,于20 tok/s交互性下,单GPU吞吐量大致从约1,000提升至约3,000 tokens/sec,接近翻了3倍。 Cam对现有基准测试的核心批评是“刷榜”——只截取某个时间点、Pareto前沿上的某个位置,每3到6个月提交一次结果,而且供应商可以撤下落败成绩。InferenceX每晚运行一次,结果“一旦上线,就不会被撤下”。
- 多token预测基本是“免费优化”:开启MTP后,B300通过Dynamo + TensorRT以68 tok/s/user提供DeepSeek服务,单百万tokens成本从25美分降至5.7美分——成本下降约80%,GSM-8K准确率没有损失。 DeepSeek普及了预训练MTP头,如今“基本人人都在用”,包括GLM-5和Qwen 3.5;它现在确实已经进入生产环境。
- 如果看TCO而不是原始吞吐量,MI355反超B200:两者在FP8 SGLang吞吐量上“实际上完全相当”,但MI355约50美分的价格差使其每百万tokens便宜约20美分——大约25%的优势,在“利润率本就很薄”时意义重大。 但AMD的问题在于软件可组合性:FP8单节点能与B200匹敌,FP4则明显更差,再叠加解耦和MTP后性能进一步恶化——说明单独有效的开关,组合起来未必有效。
- Doug O’Laughlin从经济学角度得出的结论是,推理利润率偏乐观:当前基准使用随机单轮数据,完全没有前缀缓存,因此“这已经是最差情况——接下来只会变得更好”。 随着MTP、多轮缓存等优化叠加,价格可能下降约50%;相较SemiAnalysis最初的tokenomics估算,他现在认为Max“可能没有你想象得那么不赚钱”。Jordan的制约因素是:前沿模型可能比DeepSeek更大,而且这些收益只适用于最新GPU,不适用于仍在承担推理任务的大量老旧GPU集群。
- 路线图包括:V3/V4覆盖Trainium和TPU,并计划为DeepSeek V4提供day-zero支持;团队目前正争取为Qwen 3.5、Minimax和Kimi 2.5提供day-zero支持。 他们还计划针对多模态智能体工作负载实现EPD(encoder-prefill-decode)解耦,并推出真实世界多轮前缀缓存基准。当前瓶颈是,公开可用的智能体/多模态数据集基本不存在——最好的现成数据是WildChat,但“已经3年历史了……都是让GPT当心理治疗师的人”——因此团队计划自行生成轨迹。
- 整个AI交易的尾声,是Cam给出的一个坦诚对冲:他承认自己“有过一个转瞬即逝的念头——如果模型就这样不再变强了怎么办?” 那又怎样?“那我们就完蛋了,老兄。”他的答案正是InferenceX本身所记录的主线:即便“模型不再变聪明”,它们仍在“变得更便宜、更快、性能更强”,因此扩散仍会继续扩大。Cam结合自己使用Codex 5.3的体验——“处理针对性问题更好”,而Opus 4.6“更适合泛化的整体感觉”——Doug也表示认同,认为这说明他们会根据证据更新判断。
精读
1. InferenceX 2.0将基准测试从单节点部署推进到前沿级推理服务
- Doug O’Laughlin拿更名开了个玩笑:InferenceMax改成InferenceX,“向HBO Max致意”。Cam Quilici表示,1.0花了3个月,只测试DeepSeek、GPT-OSS和Llama 70B的“单节点部署”;但“大型实验室、新型云厂商和无服务器服务商都在使用更先进的技术”,包括prefill解耦、广泛专家并行和投机解码。2.0将这些技术连同GB300和B300硬件全部纳入,目的是更准确地呈现“前沿模型在生产环境中的推理服务形态”。
- 技术核心是NVLink规模的专家并行:DeepSeek的256个专家分散在多块GPU上——单节点内是EP8,而在GB200 NVL72域内则是“72块GPU组成的一台机器”;相比之下,8个B200节点需要通过InfiniBand扩展。MI355多节点及其Pollara网卡也已纳入测试。
- 所有内容均已公开:inferencex.com上有仪表盘,代码仓库也已开放,任何人都可以fork并运行。
2. GB200/GB300在DeepSeek上“碾压”H100,单GPU吞吐量领先20–100倍
- Jordan Nanos对头图的解读是:即使H100已经叠加所有调优,GB200/GB300在低交互性下的单GPU吞吐量仍达到H100的20倍;在100 tokens/sec/user下,“它做的事情H100根本做不了”,单GPU吞吐量高出80–100倍。
- 为什么100 tok/s重要?所谓“快速模型”已经以高于这一水平的速度提供服务——Cerebras上的Codex Spark,以及疑似运行在Trainium/TPU上的Opus 4.6 Fast(Doug补充说:“他们也有GPU”);标准模型则在约40 tok/s。“这是真实需求”,因此这一代际提升“显而易见”。
3. 持续运行的基准:每晚测试、不撤榜,以及MI355一个月翻3倍
- Cam批评此前一些未点名的联盟基准存在“刷榜”问题:只选取某个时间点、Pareto前沿上的某个位置,用一个吞吐量数字做宣传,但“推理问题远比这复杂”。InferenceX按照vLLM、SGLang和TensorRT的发布节奏,每晚或每周运行;不同于以供应商为中心、落败公司“可以撤下结果”的基准,InferenceX的结果“一旦上线,就不会被撤下”。
- 以AMD的一套多节点方案为例,据Cam所知,该方案于1月8日首次公开;截至2月中旬,MI355在FP8、20 tok/s交互性下的单GPU吞吐量已从约1,000提升至约3,000 tokens/sec——软件层面的优化在约1个月内带来近3倍提升。Cam说,硬件每18–24个月才更新一次,“这些都只是工程问题”。
- 两位主持人也提前回应了偏袒质疑:方案直接来自AMD和NVIDIA的工程师——Cam向Dynamo、TensorRT-LLM和AMD Distributed Inference团队“致以全部功劳”——但无论谁胜出,结果都会照常发布。
4. 开关组合的难题——以及AMD的具体短板
- Cam描绘了现代推理引擎的现状:vLLM、SGLang和TensorRT-LLM的规模“已经膨胀”,留下“1,000个不同的环境变量”;要为每种部署找到正确组合,“需要对这些框架有非常深入的理解”。Bryan Shan进一步指出:“问题不是把好用的开关简单叠加,而是找到彼此组合后仍然有效的开关。”
- Bryan表示,AMD的具体问题在于:单个开关能够实现标称增益,但叠加后无法复现。Cam概括道,普通单节点FP8“与B200相当”,FP4则“明显更差”;加入解耦和MTP后,性能甚至比前一步更差——“软件的可组合性目前是AMD的问题,但我认为他们可以做得更好”。
5. MTP带来80%的免费降本;在TCO维度,MI355胜过B200
- Bryan解释说,DeepSeek普及了预训练多token预测头,利用decode受内存带宽限制的特性,用已经生成的logits验证推测token——这几乎是“免费优化”,且在GSM-8K上验证了准确率没有下降。它“确实已经进入生产环境”,Jordan还指出,GLM-5和Qwen 3.5也已支持MTP。
- 最有冲击力的数字是:B300通过Dynamo/TensorRT以68 tok/s/user提供DeepSeek服务,开启MTP后,在3:1输入/输出比例下,每百万tokens成本从25美分降至5.7美分,降幅约80%。Cam不愿把这说成成本完全传导:“我不了解这里面的经济学……我假设部分节省会让终端用户受益,但并不完全确定。”
- 从TCO看,B200和MI355在FP8 SGLang上的吞吐量相当;但SemiAnalysis把服务器、电力等全部成本纳入模型后发现,MI355便宜约50美分,在现实交互性下每百万tokens的成本低约20美分。Jordan说,这是25%的变化,“在利润率本就很薄的情况下”相当关键。
- Doug更新了他的tokenomics判断:当前运行使用随机单轮tokens,没有任何前缀缓存,因此Cam认为这已经是“最差情况——接下来只会变得更好”。Doug的结论是:“从推理利润率角度看相当乐观……Max可能没有你想象得那么不赚钱。”Jordan则给出制约因素:DeepSeek可能小于前沿模型,最新优化还没有覆盖整个GPU集群,而老旧GPU仍在承担推理任务——“你需要优化所有这些东西,而不只是GB300 NVL72”。
6. 路线图要经过尚不存在的数据集
- V3的目标包括覆盖Trainium和TPU(“等我们做到时一定很棒”——可能是V3,也可能是V4)、为DeepSeek V4提供day-zero支持,以及目前争取为Qwen 3.5、Minimax和Kimi 2.5提供day-zero支持。Bryan还提出EPD(encoder-prefill-decode)解耦,用于测试图像场景,因为Browser Use和Playwright式智能体工作流都需要视觉能力。
- Cam坦言,真正的多轮、智能体、多模态数据集在公开渠道“基本不存在”,因为这类数据对训练太有价值。“现在网上最好的数据集是WildChat,但它已经3年历史了……都是让GPT-4o当心理治疗师的人。”团队计划在OpenCode实例中启动前沿模型,模拟编程环境并捕捉轨迹,形成可重复的内部流程,而不是一次性的黄金数据集。
7. 尾声:Codex的180度转向、人的瓶颈,以及Cam对模型停滞的担忧
- Doug希望把这次认知转变记录下来,以回应Rune在Twitter上的嘲讽:Cam遇到一个Opus无法解决的FFmpeg问题,切换到Codex 5.3后,“15分钟内我就说,老兄,这个更好”——“Codex更适合针对性问题,Opus更适合整体感觉。”Doug的更高层判断是,锯齿状前沿——一次性解决明确问题,与搭建完整项目之间的差异——是智能体基准测试中“最有趣的问题”,而且“这是一个多极世界”。
- 对于如今是否轮到人类成为瓶颈,Doug说,在大多数简单任务上,他觉得自己就是瓶颈;模型现在想主动写代码,他只需要给出提示。但Cam有所保留:如果模型“走上了错误的路径,老兄,那就完了”。
- Cam经历了一个看空时刻:每档CEO播客都默认模型会“无限、永远地变好……但如果事实不是这样呢?那我们就完蛋了,老兄。”Doug的回答是:强信念、弱持有;即使模型进入平台期,也“足以永远改变我们的生活”。Cam最后回到节目的主旨:“也许模型没有变得更聪明……但它们正在变得更便宜、更快、性能更强”,无论如何,扩散都会继续扩大。