先锋 趋势 方法 投研 作者
[紧急节目] Moonshot 的 Kimi K3 来了!中国有了前沿模型
返回节目精读

[紧急节目] Moonshot 的 Kimi K3 来了!中国有了前沿模型

摘要

  • Max称Kimi K3是全球第3强模型,而Dylan认为就自己的实际使用而言,它可能排第2。 Max表示,基准测试综合结果显示,前3名格局清晰且稳定,其中包括Soul 5.6和Kimi K3,领先于Google、Meta和SpaceX;他称Google应该感到尴尬。K3目前仍更慢,官方口径也落后于Fable 5和GPT 5.6 full,但Dylan发现,在访问被拒或受限时,K3没有Opus那么令人抓狂。
  • K3的2.8万亿参数让推理产能立刻成为瓶颈。 Dylan表示,K3无法装入B200,在单台8路HGX系统上提供服务需要B300、GB300或MI355X级别硬件;跨节点的流水线并行会拖累性能。Max推测,约10天的权重延迟可能是为了给服务团队留出准备时间,也可能让Moonshot有机会与Together、Fireworks、Nebius和CoreWeave安排授权及GB300产能。
  • K3的定价凸显了前沿模型颇具吸引力的单位经济性,但买家基础有限。 价格已从此前2.7 Code模型每100万输入/输出token收费0.95美元/4美元,涨至3美元/15美元。Max认为,如果K3大概率并未亏损运行,同等规模的Fable若收费10美元/50美元,就意味着惊人的利润率,甚至可能优于SaaS。注重成本的用户可能选择GLM-5.2或MiniMax M3,而SemiAnalysis这类用户会继续使用GPT-5.6和Opus;Max怀疑大型企业会认真采用K3。
  • Dylan认为,开源与闭源模型差距收窄,根本原因就是美国限制了用户接触Anthropic最好的模型。 他以Mythos对比Fable,称自己无法使用Opus,只能偶尔使用Sonnet,并认为Soul 5.6可能并非OpenAI训练的最大模型。他预计,政策变化或另一轮前沿突破可能在夏末前后改变局面,同时认为开源模型最终可能达到真正的前沿水平。
  • 西方开源模型在降本之外,还有主权计算机会。 Max认为,市场强烈需要一款“不拉胯”的西方模型,并预计即便是在物理隔离系统中运行,中国模型权重也会被许多美国企业拒绝;他还称,美国可能即将出台中国模型禁令。Dylan表示,西方模型必须同时击败中国绝大多数开源模型,以及前沿实验室的2/3线模型,政府将是更大的市场。K3在SFT期间进行量化,采用MXFP4权重和MXFP8激活值,有助于广泛兼容硬件,也支持中国国产加速器的发展。
  • Harness、路由和尚未释放的用户需求,仍在支撑前沿实验室的收入。 Max表示,在最高、高和中等思考力度下,模型质量在日常使用中越来越难以区分,因此OpenCode、Hermes和Pi等工具的功能成为关键。Dylan认为,按结果定价可能带来95%以上的利润率,Max也认同路由器和可调节的思考力度可以实现这一点。Max认为,编程、音频、视频、深度研究、机器人和世界模型等领域仍有大量新用例空间;Dylan和Max相信,新用户的涌入会压过任何K3替代效应,避免ARR增速放缓。

精读

1. Kimi K3进入前沿模型竞争

  • Max明确认定K3是全球第3强模型。他表示,基准测试综合结果虽然只能提供方向性参考,但仍显示出清晰且稳定的前3名格局,其中包括Soul 5.6和Kimi K3,领先于其他开源模型以及Google、Meta和SpaceX。他称Kimi的成绩非常惊人,并表示Google应该感到尴尬。

  • Max明确给这一排名加了限定:K3整体仍弱于Fable和Soul 5.6。发布博客称,K3与Fable 5及GPT 5.6 full之间仍存在明显的用户体验差距。Max猜测,这种自我降调可能源于中国式谦逊,也可能是为了避免引发美国审查。

  • Dylan表示,K3速度较慢,但能力足够强,自己还没找到多少它处理不了的复杂工作。他称K3是自己实际使用中的第2选择,因为Opus的访问体验可能非常令人沮丧:无论是Web控制台、深度研究还是Coding Plan,他有时会被拒绝或受到限制。不过,使用付费API key后,他表示自己没有再遭遇同样的拒绝。

2. 2.8万亿参数模型让硬件成为发布策略的一部分

  • Dylan将K3描述为全新的基础模型和架构,规模约为此前模型的2倍,并加入Kimi Delta Attention、attention residuals和Stable Latent MoE。其2.8万亿参数无法装入B200;若在单台8路HGX系统上提供服务,需要B300、GB300或MI355X级别硬件。跨节点进行流水线并行虽然可行,但会牺牲性能。

  • Max强调,他对权重延迟约10天的解释纯属推测。一种可能是,服务栈团队需要时间把模型调到足够好的表现,再由Moonshot大规模放出;另一种可能是,Moonshot正在与Together、Fireworks、Nebius和CoreWeave讨论授权和算力容量,其中可能包括部署GB300。

  • 这一规模对比也影响了Max对闭源模型的判断。他表示,如果闭源模型真的拥有约10万亿总参数,却只能达到K3的水平,那就该“收拾包袱走人”,相关公司的股价甚至可能应该下跌50%。但他反而认为,K3大概率并没有比领先闭源模型小多少,甚至可能略大。

3. K3的定价揭示了惊人的利润率,但买家仍不确定

  • Dylan将K3每100万输入/输出token收费3美元/15美元的价格,与此前2.7 Code模型的0.95美元/4美元进行对比,后者价格涨至3倍以上。Max怀疑Moonshot还有多少继续涨价的空间:对普通任务而言,注重成本的用户可能会转向GLM-5.2或MiniMax M3。

  • Max将客户分成两类。SemiAnalysis这类用户愿意在Opus或其他高端模型上大量消耗token;但包括Tesla和Uber在内的一些大型企业,可能把员工每周的token额度限制在约200美元。这些用户更可能选择更便宜的GLM档位。Max表示,即便不考虑部分用户在理念上偏好开源,他也不会对K3在大型企业中几乎没有严肃采用感到意外。

  • 但这套经济账反而强化了闭源实验室的商业逻辑。Max表示,如果Kimi在3美元/15美元的价格下大概率没有亏损,那么同等规模的Fable若收费10美元/50美元,就意味着惊人的利润率。Dylan补充称,主要成本是GPU,而不是员工;Max则认为,token API甚至可能是比SaaS更好的生意。

  • Dylan预计,未来几个月内K3会推出2或3次后训练更新,间隔可能为1或2个月;由于近期不太可能发生能显著提升吞吐量的硬件迁移,价格大致会维持不变。他表示,基于K3打造Composer肯定不会发生,因为Cursor似乎已经决定从头训练自己的模型。

4. 政策正在压缩前沿差距,也在推动开源模型国家化

  • Dylan表示,当前开源与闭源模型的差距之所以收窄,根本就是因为美国对Anthropic的限制让用户拿不到实验室最好的模型。他以Mythos对比Fable,称自己无法使用Opus,只能偶尔使用Sonnet,并认为Soul 5.6不是OpenAI训练的最大模型。他预计,政策变化或另一轮前沿突破会改变这一局面,时间可能就在夏末前后。

  • Max表示,市场对一款不拉胯的西方开源模型有巨大需求。他对美国没有一家公司的能力至少达到中国第5强公司的水平感到意外。他预计,即便有人认为模型权重可以在物理隔离的数据中心内运行,许多美国企业仍会拒绝中国模型;美国全面禁止中国开源模型,可能只是时间问题。

  • Dylan表示,西方模型必须同时击败中国绝大多数开源模型,以及前沿实验室推出的2/3线模型。低成本应用已经可以通过Bedrock或Foundry等服务调用这些接近前沿的模型,因此他认为,西方开源模型更大的市场是政府,而不只是企业的降本需求。

  • Dylan和Max将开放权重视为主权计算战略。Max表示,Xi鼓励中国公司保持模型开放,是因为中国政府部门希望下载权重、部署到自有服务器上,并带动国内生态。Dylan认为,美国政府也应该采取同样务实的做法。

  • Dylan指出,K3的博客介绍了SFT期间的量化方案,使用原生MXFP4权重和MXFP8激活值,以实现广泛的硬件兼容性。Jordan列举了包括Huawei Ascend、Baidu、Kunlun Haxen和Moore Threads在内的一系列中国加速器;随着中国优先推动在国产芯片上运行前沿模型,这种兼容性变得更加重要。

5. 工具编排层、路由与未释放的需求仍支撑前沿实验室收入

  • Max表示,在日常使用中,已经越来越难区分最高思考力度下的绝对前沿模型,与高或中等思考力度模式之间的差异。因此,测试K3时必须考察周边产品——OpenCode、Hermes和Pi——而不只是模型本身。

  • 工具编排层的一些小功能会影响Max把token发给哪个模型:例如能否在远程SSH服务器上安装工具、能否使用顺手的快捷键,或能否编辑此前的命令。他还表示,Slack机器人和Perplexity Computer等产品可以在K3、GLM、Sonnet和OpenAI模型之间路由任务,用户并不在意底层到底是哪一个模型;对于这些首轮任务而言,工具编排层的质量更重要。

  • Dylan由此提出按结果定价的逻辑。路由器可以把简单任务分配给更便宜的模型,把最高思考力度留给更难的工作,从而有可能实现95%以上的利润率。Max认同,动态调节思考力度可以捕获其中大部分机会。

  • 针对Dylan提出的担忧——政策强制形成的模型同等水平可能摧毁Anthropic和OpenAI的定价权——Max的答案是否定的。他认为,这些实验室仍可以继续在内部训练更强模型,在不对外发布的情况下推进coding RSI,并探索视频生成、audio-to-audio、深度研究、机器人和世界模型。他的概括是,所谓“中产阶级模型”(“bourgeois”)可以继续彼此训练,同时只向公众释放少量能力。

  • Max表示,他身边的科技从业者使用AI的频率大约只有自己的1/10,而自己可能处于用户群前10%、前1%甚至更小的分位。随着这些用户转向更大模型,以及非技术用户发现新的应用场景,他认为前方可能仍有1000倍的需求增长空间。Dylan认同,现有Opus或GPT-5.6用户转向K3带来的迁移,都会被那些几乎还没尝试过这项技术的人淹没,因此K3不应导致Anthropic或OpenAI的ARR增速放缓。

  • Max最后开玩笑说,如果市场因为所有人都拥有一个“DeepSeek R1……第2部”而崩盘,大家就应该买入这些股票,同时补充这不是投资建议。Dylan最后说:“请自行尽调”(“Do your own due diligence”)。