先锋 趋势 方法 投研 作者
98: 李开复聊零一部分团队并入阿里:只有大厂能追逐超大模型
返回节目精读

98: 李开复聊零一部分团队并入阿里:只有大厂能追逐超大模型

摘要

  • 零一万物不是“被阿里收购”,而是主动退出超大模型军备赛:它与阿里云成立联合实验室,大部分预训练和 AI infra 团队加入其中并成为阿里员工,零一保留较小团队做模型和应用。 李开复明确说,超大模型预训练“这个我们是放弃了”,但 Yi-Lightning V2 仍会低频预训练,一年做一次还是两次要按回报决定。新的分工是阿里训练 teacher model,零一打造“够小、够快、够便宜、够厉害”的 student model。
  • 李开复判断,training-time Scaling Law 已进入投入回报递减区间,超大模型越来越只适合真心追逐 AGI、且能承受巨额成本的公司;在他看来,这通常是大厂。 他的比喻是:“一张卡加到十张卡,可能可以得到九点五张卡的价值;十万张卡加到一百万张卡,也许只能达到十三万张卡的价值。”国内他目前较确定看见阿里、字节能够继续,初创公司若没有“超长的长板”,再比谁烧得多很难成立。
  • 零一押注快模型,不只因为推理便宜,也因为 test-time Scaling Law 会放大速度的商业价值。 Yi-Lightning 当时打榜全球第六,速度比 Yi-Large 快数倍,价格约为 GPT-4o 的三十分之一;日常出 token 快五倍可能因超过人类阅读速度而没有明显体验增益,但若慢思考令双方都慢十倍,竞品可能“不可忍受”,零一仍可接受。超大 teacher model 再以标注和 synthetic data 提升小模型,构成李开复眼中的下一代主流架构。
  • 大模型创业公司的“灵魂拷问”已从过去四五年压缩到两三年,GPU 必须像招聘、电脑和差旅一样接受明确的回报核算。 训练 Yi-Lightning 花了 300 万美元,DeepSeek 称其花了 600 万美元;若把前期科研计入,李开复假设总投入达 1,000 万美元,而模型寿命只有约六个月,就必须回答新模型相较旧模型究竟新增了多少收入。“如果你一年烧四五亿美金,就算融了十几亿美金,这个拷问很快就会来了。”
  • 零一给出的初步商业化证据是 2024 年实际收入超过 1 亿元,海外 To C 产品基本打平,国内游戏、能源、汽车、金融已有多个千万元以上的软件订单。 李开复称其应该是 2023 年成立的“四小虎”中首家做到亿元收入者,但也提醒“离上市还远得很”;他对 2025 年的表述是“从一亿做到数亿”,并希望把模型训练压缩为每年一次、最多两次,使成本成为收入可以分摊的 business expense。
  • 零一的获客纪律是“不打打不赢的仗”:不应靠持续投放购买 To C 增长,也不应大量投入在价值低、难复制、连销售成本都摊不回的 To B 边角项目。 值得做的企业订单要么直接帮客户赚钱,要么由愿意拥抱大模型、拥有深厚行业 know-how 且有远见的 CEO 推动深度共创,要么首单虽不盈利、后续客户却能复用 60%—80%。零一还考虑以技术入股成立合资公司,让行业伙伴投入 know-how 与数据,把甲乙方压价关系改造成共同盈亏。
  • 李开复认为中国模型能力约落后美国六个月,却以更少融资和芯片限制做出了“90 分对 98 分”的成绩,下一场更适合中国的比赛是商业模式与 AI-first 应用。 他不认同创业公司会全军覆没,但预测“三年以后没有一个公司会被认为是大模型公司”,除非成为 OpenAI;成功者会像美团、字节一样摘掉技术时代标签,成为具体行业的巨头。不过他也承认,这是一个很长周期的预测,无法精准给出答案。判断创业机会是否成立的关键,是 AI 是否重新定义产品,而非只给 Office、搜索或既有平台加一个 Copilot。

精读

1. 联合实验室重划边界,但零一万物并未被阿里收购

  • 李开复对传闻的澄清是:零一万物与阿里云成立产业大模型联合实验室,追求超大集群和超大模型的人员进入其中,并成为阿里员工;零一则保留较小的训练、infra 和应用团队,继续经营独立公司。

  • 被明确放弃的是超大模型预训练,而非全部预训练。零一已有 Yi-Lightning V2,未来可能一年训练一次或两次,也可能沿用旧模型;判断标准只有一个:“它带来的价值提升值得去做吗?不值得我就用上一次的模型。”

  • 李开复把新分工比作大学与师范学院:阿里“培养老师”,零一“培养学生”,最终由“超级厉害的老师教出的超级学生”进入职场。原本想做 scaling law、万台级乃至更大集群的人,也因此去了更能承载其追求的平台。

  • 对并购,他说零一“没有去寻求被收购”,但承认任何创业公司若面对最有利于投资人的收购结局,都有责任考虑。业务 spin-off 同样只是开放选项:若能提高员工动力又不失去控制,可以讨论,但目前并未分拆。

2. 从 Yi-Large 到 Yi-Lightning,转向早在传闻前数月发生

  • 2024 年 5 月,零一面对的选择是继续以更多 GPU、更多数据追逐大模型,还是做能落地、能赚钱的产品。Yi-Large 排名不错,却“不快,也不便宜”;原计划中的 Yi-XL 随后在五六月被放弃,转向已在内部探索的 MoE。

  • 10 月推出的 Yi-Lightning 是完全不同的混合专家架构:表现比 Yi-Large 高一个台阶,当时打榜全球第六,而 Yi-Large 可能跌至约第十五至第二十;速度快数倍,价格约为 GPT-4o 的三十分之一。

  • 李开复称 Yi-Lightning 的表现只略逊于当时最新的 GPT-4,却超过 5 月时的 GPT-4。它由此重新定义了零一的目标:不争“世界上最大最贵、表现第一名”,而是在足够便宜、足够快的前提下把性能做到最好。

  • 程曼祺追问:阿里的通义也有不同尺寸,深度合作后零一为何还要自己做小模型?李开复的回答是,只要 Yi-Lightning 在成本和性能上仍不能被开源替代,它就值得存在;公司不是“给 Yi-Lightning 找应用”,而是“给应用找最好的模型”。

3. Training-time Scaling Law 仍有效,却已不符合创业公司的投资回报

  • 李开复的新认知不是 Scaling Law 失效,而是进入 diminishing return:“一张卡加到十张卡,可能可以得到九点五张卡的价值”,但十万张卡增加到一百万张卡,“也许只能达到十三万张卡的价值”。

  • 继续烧超大模型,适合的是坚定追求 AGI、必须做出世界最大最好模型、并能承受极高代价的公司;他认为这“绝对不是一个初创公司可以做的事情”,除非它确实拥有极难复制的超长长板。

  • 国内目前较确定能继续这一方向的,李开复点到阿里与字节,并保留“也许以后还会有一两家入局”的余地。零一选择合作的逻辑很直接:“你做一个很棒的手机应用,你不会说去重做一个安卓”,超大 teacher model 也会成为类似操作系统的底层能力。

4. 超大模型将退居老师,小模型才是进入市场的学生

  • 超大模型仍有关键用途:标注结果以增强后训练,并生产更适合 student model 的 synthetic data。李开复强调,合成数据若只是替代真实数据不会更好;真正价值是为一个约在 20T 数据饱和的模型,生成质量更高的 20T 数据,再把能力推上一个台阶。

  • 他预期市场主流会是 Yi-Lightning、较小尺寸的千问、DeepSeek、GPT-4o mini 等“能力足够”的模型。它们不必最顶尖,但应由更强的老师持续教学,最终以速度、成本和体验承担普及工作。

  • 李开复援引从朋友处听到的说法解释 Opus 与 Sonnet:Opus 太大、太慢,若开放销售,买家又可能拿去蒸馏竞品,不如留作老师训练 Sonnet,再销售 Sonnet。这是转述而非他亲自验证的结论。

  • 他还提到 GPT-4.5、GPT-5.0 的命名仍未定论,但模型已经做出来;内部测试虽有提升,却可能不值相应延迟和成本。无论是否出售,它都会承担“把所有的 GPT 小模型重新提升一遍”的老师功能。

5. Test-time Scaling Law 让推理速度从体验优势变成成本杠杆

  • 程曼祺提醒,Scaling Law 也可能转向 inference time 或 test time。李开复认为这是另一条曲线,并认为“慢思考、长思考”可能成为下一阶段突破,因此快速推理恰好更有价值。

  • 若零一平常比 GPT-4o 快五倍,但双方出 token 都已接近或超过阅读速度,用户未必得到五倍收益;若慢思考让双方都慢十倍,对方可能慢到“很多应用不可忍受”,零一却仍在可接受区间。

  • 快速 inference engine 还能做更多实验,加快对慢思考方法的摸索。因而零一选择“小、快、便宜”,不仅是防守性的成本控制,也是对 test-time Scaling Law 的前置押注。

6. 行业的灵魂拷问从四五年提前到两三年

  • 李开复把 AI 1.0 的路径概括为论文、比赛、订单、扩张,最终才看财务报表;AI 2.0 的一切都加快了,从信仰到怀疑 Scaling Law 只用一年,资本也会更早追问技术能否转成商业价值。

  • 商汤、旷视等上一代公司即使扣除早期低调阶段,也有约四五年才面对财务审视;这一轮可能两三年就必须回答。若公司一年烧 4 亿—5 亿美元,即使融资十几亿美元,“这个拷问很快就会来了”。

  • 答题顺序是:懂不懂商业运作、收入有多少、能否成长、能否控制成本;继而让亏损收窄,从单点盈利走向多点盈利。否则即使收入增长,若亏损仍是收入的五倍、十倍、二十倍,故事也很难被接受。

  • GPU 因此必须被当作 business expense。训练 Yi-Lightning 花了 300 万美元,DeepSeek 称其花了 600 万美元;若连前期科研合计假设为 1,000 万美元,而一般模型寿命约六个月,就要像已有旧车的家庭决定是否立刻换车一样,核算升级相较旧模型新增了什么。

7. 商业化第一原则是拒绝无法取胜、无法自生长的战场

  • 李开复的第一条纪律是“不打打不赢的仗”:没有 PMF、需要长期教育市场,或已有巨头形成碾压优势的领域,不应仅因技术看起来先进就投入。

  • To C 的危险是用投放买来用户,停止投放后增长同步消失;即使免费用户持续使用,也会消耗 GPU。国内 To C 收入难、巨头强,若产品尚未显现自然增长或变现路径,维持排名只会要求不断输血。

  • To B 若只做边边角角的功能,客户获得价值小、付款少,供应商又难做好,最后连销售成本都可能摊不回。值得争取的是能直接帮客户赚钱的核心项目,或由有远见 CEO 推动、行业 know-how 足够深、适合大模型且愿意拥抱这一方向的强强联合。

  • 另一种可行订单是首单不赚钱,但交付资产可复制:后续 5 个、10 个、20 个乃至 100 个客户,能复用首单的 60%、70%或 80%。在李开复看来,可复用性决定项目收入能否最终变成产品利润。

8. 亿元收入只是验证起点,2025 年目标是数亿元与可解释成本

  • 零一万物 2023 年成立,李开复称它应该是同年成立的“四小虎”中首家在 2024 年做到实际收入超过 1 亿元的公司。他同时降温:“一亿收入不代表什么,离上市还远得很”,但第一个运营年达到这一水平,证明商业纪律开始落地。

  • 海外 To C 产品已基本打平,并有机会盈利;国内游戏、能源、汽车、金融等场景已有斩获,大部分是千万元以上的软件订单。李开复以订单规模作为价值证据:能够打出千万元级软件单,说明确实创造了客户价值。

  • 对 2025 年,他称有把握实现“数倍的成长”,即从 1 亿元做到数亿元。除了放大已有垂直领域,零一还会在部分领域与行业伙伴共创;一种模式是成立合资公司,由对方投入 know-how 和数据、零一以技术入股,双方共同承担成败。

  • 最终希望形成的财务结构是:收入增长数倍,模型一年只训练一次、最多两次,由外部 teacher model 让模型不掉队,甚至保持在第一梯队。只要 GPU 训练支出能被收入合理分摊,财务报表就能让非大模型行业的投资人也看懂。

9. 调整是数月推演的结果,也重新暴露了人才与 CEO 的边界

  • 李开复给出的时间线是:2024 年 5 月萌芽,第三季度逐渐确认道路,随后与阿里达成联合实验室方案,最近一个月开始执行。变化来自行业、认知与实践共同更新,不是资金传闻触发的突然被动收缩。

  • 面对中高层离职问题,他说创业初期的核心团队基本仍在,但整个行业都有大厂以“天价”挖人。有人禁不住财务诱惑,也有人真心想训练 AGI 级超大模型;既然零一不再提供这种环境,就无法强留后者。

  • 程曼祺问功成名就后创业失败是否会损伤履历,李开复回答没有这种包袱:“我等了四十多年终于等到的 AI 时代”,若不亲自做擅长的事、试一把,才会成为终身遗憾;CEO 遇到调整就后悔,“是一个没有资格做 CEO 的人”。

  • 他对创业能力的复盘是:必须坚持的东西要坚持,但已经发生的变化要迅速响应,并根据对未来的判断大胆调整。原先的“AGI 时代微软”梦想没有宣布破灭,只是道路从模型起步改成应用起步:谁都可以仰望星空,但更重要的是脚踏实地。

10. 三年后“大模型公司”标签会消失,AI-first 才决定创业者能否跑出

  • 李开复不认为中国大模型创业公司会全军覆没:各家公司有资金和聪明团队,会找到方向。但他坚持“三年以后没有一个公司会被认为是大模型公司”,除非它真的成为 OpenAI;其余成功者会成为海外 To C、国内 To B 或某个行业的巨头。他也承认,这是一个很长周期的预测,无法精准给出答案。

  • 如果最后只有现有科技巨头获益,在他看来,这意味着 AI-first 应用没有发生预想中的颠覆。若所有变化都只是抖音、百度、淘宝的升级版,大厂会延续成功;若产品类别被重新定义,巨头就会因旧业务包袱给新公司留下窗口。

  • 他用 PC 到移动互联网解释这一分界:搜索变化较小,但出行、视频、支付、本地生活因定位和随身携带而重做。假如手机上始终只是 H5 版旧网站,新一代移动巨头也不会出现。

  • AI-first 的判据是没有大模型,整个应用便不能存在。Office 加 Copilot 不算;从“人写、AI 帮忙”变成“AI 主写、人调整”,从关键词与网站列表变成问题与答案,乃至社交圈同时包含人和 AI,才是结构性重做。

11. 中国以“90 分”进入更擅长的应用赛,2025 年仍会充满非共识机会

  • 李开复认为,中国在芯片受限、估值更低、融资更少的条件下,模型能力约落后美国六个月,却做得更便宜、更小,可打“90 分”,美国约“98 分”。第一场模型技术赛中国处于劣势,接下来的商业模式与应用赛则更符合中国执行和寻找 PMF 的长项。

  • 他对 2025 年最确定的判断,首先是中美都会出现大量 AI 应用,其中很多来自中国创业公司与大厂;其次是会出现更多 surprise,因为“很多过去被认为是真理的事情,很快就被推翻了”,预测必须给未知突破留空间。

  • To B 的非共识机会不会只是笼统的金融或保险,而是足够细的垂直行业:必须依靠大模型,不能只省一点钱,而要帮助企业赚钱,甚至令行业龙头的营业额或人效翻倍。这类细颗粒度 PMF 是他认为下一阶段最值得寻找的方向。

  • 对同行,李开复引用王慧文的话:“每一位都是勇士,我们应该彼此鼓励。”对 super agent,他把人的位置留给前所未有的创意、综合性的结合、无法仅靠数据推演的预测、人与人的温度,以及 AI 帮人创造的新机会;若时间被释放,他会继续做 AI 不能取代的热爱之事,并把更多时间留给所爱的人。