先锋 趋势 方法 投研 作者
返回先锋
王铁震
开发者 4 场深度对话收录

王铁震

Hugging Face · 中国区技术生态负责人

前沿洞察

美顶尖模型仍在体验与体量上领跑,但优势仅靠安全语料与算力堆叠,而非范式壁垒。中国开源生态正凭极高扩展效率与架构优化发起“斩杀”:下载份额反超、多场景追平顶流、实战价值迫近闭源。然而,高光之下暗藏危机,开源的长期商业化变现仍悬而未决,随着闭源巨头IPO与极致价格战打响,开源阵营的盈利退潮风险才是真正的生存大考。

观点集合

E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿

  • 🗓️ 日期2026-08-01 | 🎙️ 节目:硅谷101

Kimi K3在多项场景追上甚至超过Fable,且不到3T参数、scaling efficiency较K2扩大2.5倍,显示开源推理的成本优势具有结构性。蒸馏指控目前证据薄弱,但K3 license的商业化执行、OpenAI与Anthropic IPO及价格战,将检验闭源估值与开源货币化。

查看访谈对话精读提要
  • 开源已经追平最强闭源。 铁震复盘:DeepSeek V1 之后一年其实是"狼来了的故事"——闭源月更、开源季更,Opus 4.6、4.7、4.8 远远领先;转折先是一款名称存疑的 GM 5.2 模型(他已用它"完全取代了 Opus 4.8 的一些功能"),再是 Kimi K3——“不是跟 Opus 评级的问题,它基本上已经追上了 Fable,甚至在某些场景上要比 Fable 做的还好”。“闭源模型瞬间就发现自己没有一个护城河了”,而 MiniMax、千问的 2-3T 模型和智谱还在路上。

  • 蒸馏指控技术上站不住。 闭源模型不暴露 logits 也不暴露思维链,经典蒸馏根本做不到;Fable 5 七月初上线、K3 十五天后发布,“连模型发布的准备都来不及,何谈收集到足够多的语料”。Kis 把主张拆成三层:违反服务条款、系统化 API 抓取、窃取权重——证据倾向"可能存在未授权的大规模数据抓取",但不等于核心能力来自蒸馏;蒸馏只能到及格线,“K3 已经远远超过及格线”,只盯蒸馏是"只见树木不见森林"。

  • 开源便宜是结构性的,不是补贴出来的:闭源 API 内含模型溢价,Fireworks、Together AI 只收硬件加推理服务的钱;K3 比 K2 大一倍多但 scaling efficiency 扩大 2.5 倍(KDA 等 linear attention 技术,“主要都是由华人 researcher 主导”);传言 Fable 本体 8-10T,K3 不到 3T 打出同等效果。 叠加 infra 优化,“未来三年同样的智能成本又下降一千倍”。

  • K3 license 是开源货币化的新模板:Model-as-a-Service 厂商十二个月收入超两千万美元须与月之暗面另签协议,配 Vendor Verification 认证。 铁震的判断——“赚钱的开源模型才是好的开源模型”(Stability 之死为鉴),且云厂应欢迎交钱换官方认证;若走通"这就是无本万利,你只要把模型做好,大家都直接给你上供"。Kis 提醒执行端"有很多很多的灰色地带"。

  • 闭源估值体系承压,恰逢 IPO 之年。" 今年 OpenAI 和 Anthropic 都要上市"——垄断智能曾"比垄断任何商品威力要恐怖的多"、天然值万亿市值,但智能变成流通商品后,margin、scaling law 无限投钱的故事"这个饼就没有那么容易画得圆"。价格战苗头已现:neocloud 拿开源模型互相卷价,ChatGPT 开始发券,Anthropic 封号"没有那么疯狂"了,“最后都会反映到他们的财报上”。

  • 阵营已按商业结构分裂:七月二十四日《开放权重和美国AI领导力》公开信从 25 家发酵到约 75 家,是黄仁勋加入 X 后第一条推文,Anthropic 拒签、Dario 另发文。 卖铲子的(NVIDIA,CUDA 护城河本就是开源生态筑成)、有分发的(Meta、阿里)都能拥抱开源,纯卖 API 的 OpenAI、Anthropic 利益"完全不会对齐"。Agent 应用层同步遭挤压——VC 朋友的反直觉标准:“估值越高,我们反而会越愿意投”。

  • 安全叙事被反转:K3 在网络攻防测试 Exploit Bench 只得百分之三十几(frontier models 在 75 以上);Hugging Face 被 OpenAI 测试智能体攻击后,闭源模型拒绝帮它分析攻击语料,只有开源模型可用——“为什么我们能够让他们又做运动员又做裁判?” 监管应过滤训练语料而非用户行为,而闭源随时可被政策断供,“不管怎么看,没有开源反而是这个时代最不安全的事情”。

  • 🔗 原始收听与视频来源: E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿

收听完整访谈 →


43.「26Q2」大模型半年报:RSI,Fable,5.2,混元3,龙猫,到处都是斩杀线 - 王铁震

  • 🗓️ 日期2026-07-21 | 🎙️ 节目:苔藓之火

中国模型迭代明显加快,GLM-5.2在王铁震实战中基本取代Opus 4.8,若优势延续,超过Fable只是时间问题。Fable优势归因于攻击型安全语料和模型尺寸而非范式;混元3架构不变仍实现性能飞跃,开源与免费模型可能压低第二名定价。

查看访谈对话精读提要
  • 王铁震的期中考判断:中国模型迭代速度已经上来;在后续中国模型持续超过 GLM-5.2 的前提下,超过 Fable 只是时间问题。 GLM-5.2 在他的实战工作流里“基本把 Opus 4.8 取代了”——Fable 做任务拆解、GLM-5.2 干活。王铁震认为 Fable 没有范式变化,给足算力、语料、研究人员和时间就能做成。Raymond 转述的市场对话是:马斯克称中国模型将在 2027 年一季度达到 Fable 水平,唐杰回“不用那么久”;次日智谱股价涨了“20% 还是 30%”,创近期新高。

  • 100% 的 RSI(递归自我改进)被认为很难达到:像熵增,完全自主的循环迭代会写出越来越大的屎山,复杂度最终超过模型的上下文和智能能力。 它必须持续从外界摄取低熵、很有价值的人类 input。Anthropic 文章被 Raymond 转述为称 Claude Code 里 80% 的代码由自己写;王铁震估计,其中“可能 60% 是人类直接下达的旨意”。衡量 RSI 进展的潜在指标是人类参与比例逐渐降低,但原话随后说“永远趋近 100%”,比例指向存在歧义。

  • 模型的根本天花板是“模型吃进的语料,实际上是它的枷锁”。 它能把 A 领域的方法迁移到 B 领域,但创造全新的 C 领域、使用完全独立的方法,在它的训练目标看来像幻觉。人类能通过抽象把复杂系统压缩成不变量和模块,这也是 researcher taste 值钱、Recursive 大额融资成立的重要背景;当前 RSI 至少更容易推进效率边界。

  • Fable 的国家安全式发布被王铁震定性为“非常好的 marketing”,而非范式上的巨大跳跃。 他用 Kimi K2.5、K2.6,在给出 hint 后找到了 Fable 宣传的 FreeBSD 漏洞。按他的猜测,差距主要在攻击型安全语料和模型尺寸,而不在范式;“开源模型的斩杀线已经上来了”,Fable 必须拉开一个身位并讲好故事。Anthropic 因此被 Raymond 比作训练了一个“黑化的爱因斯坦”。

  • 开源把模型推向商品化,投资含义直接:“第一名肯定还是茅台,还是卖得贵;但第二名的白酒,就很难提价了”。 中国至少有 10 家能做模型,包括美团和小米;赛道人太多、还有免费模型,第一名也未必能长期提价。开源在一级市场起过“一百进十”的过滤作用,但“去投第八名的白酒,是有点傻的事情”。

  • 中国“斩杀线到处都是”,数据孤岛则可能把行业推向“人均一个大模型”。 美团用 5 万卡国产卡集群训出 1.6T 的龙猫(LongCat)2.0,非模型厂商也在不断推高底线。由于中国各家 App 数据不打通,Raymond 担心每家大厂都做自己的模型;王铁震认为数据孤岛确实是各家必须出模型的原因之一,美国也有类似情况,xAI 收购 Cursor 与其编程数据有关。

  • 混元 3 是季度的重要信号:结构相比 preview 没有变化,只换数据和训练方法就实现巨大性能飞跃。 王铁震作为局外人的合理推断是,模型结构研究主要为了降本,不一定直接提升能力;这反过来说明数据的作用可能非常大。腾讯拥有 WorkBuddy、微信、公众号等数据端口,若能合理合法使用,混元 3.5、混元 4 可能还有质的飞跃;它比 GLM-5.2 小,国内单机 8 卡即可运行。

  • Raymond 的非共识:Coding 这个词用错了,“不应该叫 Coding,应该叫 Automation”。 所有模型厂转向 coding,是因为它能覆盖较高可替代时薪的工作、是许多数字任务的底座,并拥有编译和运行结果带来的天然反馈闭环。TAM 不是程序员工资,而是数字世界里一切可自动化的交互。关于 OpenAI 是否该用 600 亿美元、以自有股票换购 Cursor,王铁震认为 Sam 的动力不如拥有闲置算力的马斯克强;Raymond 则认为这笔交易主要看数据。三季度的悬念仍是:Anthropic 和 OpenAI 是否 very likely 上市、财报如何、AI 板块会否重估,以及斩杀线最终在哪里。

  • 🔗 原始收听与视频来源: 43.「26Q2」大模型半年报:RSI,Fable,5.2,混元3,龙猫,到处都是斩杀线 - 王铁震

收听完整访谈 →


31. 「26Q1」中美大模型差距过去一年变大还是缩小?- Hugging Face | 王铁震

  • 🗓️ 日期2026-05-11 | 🎙️ 节目:苔藓之火

王铁震称,美国前沿模型使用体验仍“远远领先”,算力、规模与闭源开发形成差距。排除大陆用户后,中国模型占HF下载量41%,高于美国的36.5%;DeepSeek V4的SSD缓存或降低推理成本,变现与2026年开源退潮仍待观察。

查看访谈对话精读提要
  • 王铁震的总判断:从实际体感看,美国前沿模型仍“远远领先”,且有三个结构性原因。 算力充足让美国进入“月更”而中国模型可能三个月一更;DeepSeek V4 的 1.6T 在对面“可能都是 Flash 或者 Nano 级别”;闭源造成单向透明——“美国可以学到中国最顶尖的探索,中国学不到”。

  • DeepSeek V4 一个尚未被完全发现的优点,是把 KV cache 从内存搬进 SSD,缓存命中与否价格可能相差十倍。 王称 DeepSeek 在“做公益”:在架构探索上投入很大,并实际推进华为适配;V4 发布页小字写明等华为 950 POD 集群上线后价格还要再降;他认为下一代 Kimi、智谱模型都会借鉴, “让智能在中国的价格变得更低”,功德无量。

  • 卡是制约,但估值与变现也决定训练规模。 王指出智谱四千亿元对 Anthropic 的万亿美元计价,MiniMax 与智谱过去十二个月收入都在约一亿美元,即使 B300 放开也买不起多少卡;“特别需要 VC 按一百倍、一千倍的估值来投,烧出一个未来”。Raymond 后来概括,中国模型在训练资源和收入端“可能”都只有对方的百分之一;付费意愿已被验证——“智谱的包月都卖断货了”。

  • 中国开源模型的全球份额被严重低估:HF 报告 41% 对美国 36.5%,且不含无法访问 HF 的中国大陆用户。 美国开发者经历三阶段——从 Reddit 名帖“千问很好,但是我没有办法用它”,到 Qwen 取代 Llama 成研究员默认基座,再到大厂说“开源模型”时八成指中国模型,Cursor 拿 Kimi 训出 Composer 2。

  • 闭源的数据飞轮是美国的护城河,但十二亿人的飞轮可能是中国的解法。 Raymond 判断,中国模型只要跨过可用线,就能在美国模型构成的“与世隔绝的孤岛”之外,像抖音一样在本土飞轮里越转越快。Raymond 的切换条件很具体:到 Claude 4.6 水平即完全切换。

  • 单向学习也曾反向发生:R1 用开源第一次教会全世界思维链。 o1 时代大家不知道思维链如何实现,猜过蒙特卡罗搜索;王认为“非常有可能”Anthropic 拿 DeepSeek R1 去训练它们第一个有思维链的模型,因为 DeepSeek 更早。

  • 王判断 2026 年运动式开源可能退潮:开源应是 go-to-market 手段而非技术理想。 他举例说,若已占据开源市场 80% 的份额,就没有必要继续投入那么多;开始赚钱后激励会改变,且赚钱才能持续开源——Stability“考虑赚钱考虑得太晚,CEO 都跑了”是反例;他引 MiniMax 闫俊杰,称开源是“打造公司先进技术品牌的核心手段”。

  • 回应 Hassabis“落后六个月 + mentality 问题”论:立场不同,“一个是王健林,一个是杨振宁”。 中国没有美国那样的资源和资本容忍 Thinking Machines Lab“据说”融资 50 亿美元、尚未做出产品的试错,大家太着急赚钱;但电动车、光伏证明后发制人可行,DeepSeek 的架构级创新让他“还是蛮乐观的”。

  • 🔗 原始收听与视频来源: 31. 「26Q1」中美大模型差距过去一年变大还是缩小?- Hugging Face | 王铁震

收听完整访谈 →


01.叫板李彦宏、Llama 3发布,什么是大模型的开源闭源之争?

  • 🗓️ 日期2024-04-26 | 🎙️ 节目:卫诗婕|漫谈 Light the Star

Llama 3将接近GPT-4级能力交给社区,但8B、70B与尚未发布的400B对应截然不同的成本、速度和部署门槛。王铁震判断闭源是开源能力天花板,却不认为差距会持续扩大;竞争或在越过“可用线”后转向代码、写作等生态位,商业化仍取决于开源项目的造血机制。

查看访谈对话精读提要
  • 王铁震的核心判断不是“开源必胜”,而是闭源是开源的能力天花板,但两者差距不会逐渐变大。 他同意李彦宏判断的前半句:闭源公司若没有优于免费开源模型的产品,收费逻辑就无法持续;但当开源、闭源都越过 GPT-4 级别的“可用线”后,竞争将转向代码、写作等不同生态位,很难再用单一榜单证明谁把谁“远远甩开”。

  • Llama 3 的意义在于把接近 GPT-4 的能力交给社区,而不代表企业会立刻部署最大的 400B 模型。 已发布的 8B、70B 与尚未发布的 400B 对应不同成本曲线:在同系列、同样训练方式和模型架构下,大模型的能力与知识肯定更强,但推理更贵、响应更慢,普通开发者甚至可能跑不起 70B。王铁震的趋势判断是“先变大,把能力做上去,然后再变小”,真正大规模落地更可能依靠 10B 以下乃至端侧的 2B、4B、8B。

  • 开源和闭源并非二元阵营,而是一条从训练全公开、开放权重到闭源服务的宽光谱。 企业可以用开源模型叠加私有语料,在“最后一公里”以闭源产品收费;也可以开放小模型引流、保留更强版本商业化。王铁震认为,可持续的开源往往必须找到造血机制:“最后能够转化然后产生一些商业模式的这种开源项目才能够走得更远。”

  • 开源的商业价值可以来自分发、生态与互补资产,也可能服务于授权或服务收费。 阿里可以借开源带动云端 compute 与 GPU 消费,硬件公司借软件开源扩大设备需求,Meta 则可能借模型生态补充元宇宙中的内容和交互。开源还可作为市场策略、技术品牌和招聘工具,因此“免费”不等于没有商业模式。

  • 开源真正压缩的是试错和协作成本:一个人不必理解全部数学、拥有大量 GPU,甚至不必受雇于某家公司,也能改善其中一个环节。 王铁震引用一项分析称,过去一年大模型推理成本下降约 100 倍,其中很多工作由开源社区推动;项目还允许复制、拆解并另建项目,使公司内部必须二选一的 A、B 技术路线在社区同时发展。“每个人都站在别人的肩膀上”,是他相信开放科学加速创新的原因。

  • “开放权重”不等于完整的 open source,Llama 更接近 open access。 完整开源要披露数据集、清洗方法、训练与推理代码、模型架构、日志和权重;只给权重,则像提供可执行的 .exe 而不给源代码。后者仍可微调、合并模型、量化或扩展 context window,但开发者无法完整复现它是如何被训练出来的。

  • 创业者最稳妥的路径是先用最强闭源模型验证需求,再决定是否迁移到开源。 王铁震建议先用 Claude 3 Opus 等模型测试 prompting,能解决就不要急着微调,提示词成本也低得多,产品可能一周上线;等真实 query 积累后,再整理语料做 SFT、私有部署,以降低成本和保护隐私。SFT 多数创业公司可能负担得起,continuous pretrain 则可能贵 10 倍以上,还依赖原厂训练数据配比等知识。

  • 算力仍是开源生态背后的硬约束,分布式协作也不会消灭人才中心。 Llama 3 据节目所述使用 24,000 块 GPU 和 15T token 训练,纯社区 grants 最多可能仅百卡级,千卡级支持很少;规模上升后,故障换卡、checkpoint 与自动恢复都成为系统工程。Hugging Face 可以全球远程、依靠 Slack 异步协作,但北京、硅谷、巴黎仍凭人才密度形成高地,“人才高地一定会存在”。

  • 🔗 原始收听与视频来源: 01.叫板李彦宏、Llama 3发布,什么是大模型的开源闭源之争?

收听完整访谈 →