多数 AI 初创公司都在扩张中走向破产|Fireworks CEO Lin Qiao
摘要
Fireworks称其每日处理超过40万亿个提示词与生成 token,其中95%来自定制模型或定制部署。 Lin Qiao表示,据 Fireworks 所知,这一规模“大于 OpenAI API 和 Gemini API”,但也承认各家的统计口径可能不同。叠加15亿美元 D轮融资和175亿美元投后估值,这一说法意味着定制化已形成规模化需求,而非边缘实验。
Qiao的核心判断是,智能将碎片化为数百万个模型——“每个应用、每个用例一个”——而不是最终落入前沿实验室双寡头格局。 最有价值的数据存在于应用和企业内部,“绝不应该被共享”,因此企业可以把客户行为和业务逻辑转化为持续更新的专有模型。Fireworks预计,专业化智能与通用智能将长期共存。
AI 产品实现产品市场匹配,并不再保证商业模式持久,因为 AI 基础设施和推理成本可能让增长看起来像“扩张走向破产”。 开源模型的标价可能便宜约10倍,但生成内容的冗长度高出1.5–2倍,按完成任务计算,实际节省幅度更接近5–6倍。Qiao认为,行业正从“token 最大化”转向“价值最大化”,尤其是在上市公司必须为投资回报仍未确定的 AI 功能辩护之际。
强化学习微调正在把模型开发变成一套围绕专有评测、奖励和反馈闭环展开的产品方法论。 Fireworks既支持研究人员控制全部参数,例如 Cursor 的 Composer 模型,也为专业程度较低的团队提供 SDK;Doximity则结合 SFT、DPO、KTO 和 RL 等方法开展医学研究。Qiao在与 Jensen 交流后形成的关键判断是:“不存在专业化的通用公司。”
编程曾是 Fireworks 去年的主导工作负载,如今已成为更广泛应用周期的赋能层。 Qiao称,过去需要强大的产品团队、跨越多个季度完成的工作,如今一个完全不懂写代码的人也可能只需几周。由此催生的产品包括通用知识工作应用,以及覆盖法律、金融、招聘、营销、销售和客服等领域的垂直产品,明年甚至可能迎来面向消费者的搜索与推荐突破。
当被问及美国企业是否应担心中国模型时,Qiao拒绝把地缘政治问题压缩成开源与闭源之争。 她更强烈的主张是,美国公司应该发布最好的模型,并明确呼吁 OpenAI 这样做;Biewald的问题也提到了 Anthropic。Lukas追问了研发投入如何变现这一显而易见的矛盾,Qiao则表示,开放必须具备可行的商业逻辑。
Fireworks认为,其护城河不在通用推理,而在围绕“一个尺寸适配一个需求”共同设计的训练与服务系统。 公司宣称训练与推理可以做到按位等价,支持全球拆分、规模最高达数万张 GPU 的训练任务,并针对每个工作负载搜索超过10万个推理选项。首日发布能力之所以重要,是因为客户不再相信公开基准,必须在下一个模型到来前测试新的基础模型。
公司的开源模型倡议并不延伸至自身的专有训练和推理引擎,这一矛盾被 Biewald 反复追问。 Qiao称,内部变化太快,社区管理会变得低效,因此她更愿意支持 vLLM 和 SGLang,而不是再造一个竞争项目。她更广泛的经营方法包括极致主人翁意识、扁平团队、坦率的事前复盘、在数据不足时快速决策,以及保持足够真实、从而维护技术可信度的营销。
精读
1. 极致主人翁意识成了 Fireworks 的操作系统
Qiao大约在2015年开始考虑创办一家科技公司,此前她先后从事研究、内存数据仓库,以及离线和在线数据产品。她觉得自己技术上已经准备好,但“从人的角度还没有准备好”,于是从 LinkedIn 加入 Facebook,学习创办公司所需的人际与组织能力。
令她在 Facebook 感到震动的是一种“极致主人翁意识”:员工会修复并非自己编写的代码,会上报损坏的前台仪表盘,并把任何问题都视为自己的问题。Fireworks如今明确奖励这种行为,因为这类人“无需你开口就会脱颖而出”。
Fireworks的起点,是 PyTorch 团队此前在 Meta 搭建 AI 基础设施的经历。Qiao回忆,约在2017年时,系统还以 CPU 为主,算法规模很小,深度学习软件十分初级,也没有成熟的 AI 团队。5年后,外部公司开始向 PyTorch 工程师咨询训练平台、服务平台,甚至如何组建 AI 组织。
这种从移动端数据生成转向 AI 的产业迁移,让这次机会显得大于单一产品。Qiao和联合创始人认为,他们是一台已经知道如何帮助组织跨越同一基础设施转型的“影响力机器”。
2. 每日40万亿 token 验证定制化部署需求
Fireworks将自己定义为专用智能平台,采取与前沿实验室通用黑盒 API 平行的路径。其基本假设是,“智能是数据的导数”。全球数据中只有很小一部分位于公共互联网,公开数据和标注数据是前沿实验室从头训练模型的主要来源。
Qiao认为,绝大多数数据锁定在企业和应用内部,构成它们的“阿尔法”。这些数据应该成为企业独有的模型,而不是交给供应商;随着产品、数据和基础模型变化,专业化也必须每周、每天,甚至每隔几小时重复一次。
她对终局的判断十分明确:“世界不会成为双寡头。”通用智能仍然有用,但数百万个专用模型将服务于单个应用和具体用例,让每家公司掌握自己的知识产权、产品差异化和成本结构。
Biewald追问,这是否只是一个开源模型推理供应商的品牌包装。Qiao用规模回答:Fireworks每日处理超过40万亿个提示词与生成 token,其中95%来自定制模型或推理部署。她称,据 Fireworks 所知,这一规模大于 OpenAI 和 Gemini 的 API,但也承认各家公司可能采用不同统计口径。
3. 编程打开了不断扩张的 AI 原生应用栈
去年的需求“全部是编程”,但编程也加速了其余应用的开发。Qiao对比了旧路径:数十名优秀工程师和产品经理跨越多个季度协作;如今,一个可能完全不懂写代码的人,只需几周就能把产品推向生产环境。
下一层包括深度研究、幻灯片制作和其他通用工作工具,随后是覆盖法律、金融、招聘、营销、销售和客户支持等领域、颗粒度越来越细的垂直产品。Fireworks自身也同时使用开源和闭源模型进行财务预测及账务管理。
Qiao还看到消费公司开始把 LLM 的推理能力用于搜索和推荐。她的预测仍然保留余地:“可能明年”会成为面向消费者的 GenAI 突破点;目前可以确定的是,实验正通过越来越多样化的产品进入生产环境。
4. 微调成为产品方法论,而非实验室服务
Qiao表示,前沿实验室的经济模式天然不鼓励大规模定制:巨额预训练研发投入,最适合通过向大量客户规模化提供少数几个 API 来变现。支持数百万个微调模型需要完全不同的基础设施,实际上是“一门完全不同的生意”,这也解释了为什么早期微调 API 可以存在,却始终没有成为战略重点。
Fireworks覆盖多个控制层级。Cursor使用其训练栈开发 Composer 模型,控制底层 RL 参数,并将训练器连接至 Fireworks 管理的 rollout 推理;专业程度较低的团队则使用训练 SDK 选择算法、提供损失函数,并运行托管任务,无需知道所需 GPU 数量。
Doximity面向医生的深度研究产品展示了这一领域的应用。其研究人员结合 SFT、DPO、KTO 以及不同 RL 变体,教授模型医学术语和推理能力。这正是更广泛模式的一个例子:基础模型理解逻辑,却不理解某个应用的专业语言或 DSL。
Qiao给出的清晰区分是:SFT类似于把教科书交给模型,让它记住标准答案;RL则让不同模型变体与产品或模拟环境互动,获得奖励后再次探索。在这两步之前,企业需要先建立评测体系,相当于单元测试和集成测试;随后还要设计独立的奖励函数,决定模型沿哪个方向持续优化。
5. 私有数据是护城河,但成本决定它能否存续
奖励设计催生了一种介于研究员和产品工程师之间的混合角色。判断医生是否获得了高质量的药物检索结果,需要领域判断,因此研究员必须学习产品开发,或者产品人员必须学习模型;产品反馈与模拟环境随后闭合学习循环。
当 Jensen 告诉她“没有专业化的通用公司”时,Qiao的判断体系最终成形。每家公司都在用特定的品味和判断力解决特定问题,而这些东西没有任何一项是普遍共享的;将这种判断编码为企业自有智能,就能在模型和产品之间形成飞轮。
Biewald反驳说,更新权重只是其中一种机制。Qiao表示同意:企业应该使用提示词与上下文工程,激活私有数据,并在不同模型之间路由任务,以兼顾质量和成本。她更窄的主张是,权重依然不可或缺,因为专有的意图、偏好、参与度和业务逻辑不应被“留在桌面上”。
在 SaaS 领域,Qiao认为产品市场匹配与商业持久性基本同时到来;在 GenAI 领域,两者却彼此分离,因为智能的运营成本很高。一些用户喜爱且具备变现能力的产品正在“扩张走向破产”,而成熟公司则面临华尔街审视。Qiao称,把成本降低5–10倍可能很重要;考虑到开源模型更高的冗长度后,她称按任务计算的实际节省约为5–6倍。
6. 开放智能是 Qiao 应对模型集中化的答案
开源与闭源系统将长期共存。Qiao建议,在早期验证阶段使用最昂贵的 API,因为此时成本并不重要;产品规模扩大后,再进行优化。她也强调不同任务存在差异:Anthropic擅长编码代理和指令遵循,OpenAI擅长交互和深度研究,Gemini擅长多模态,而 GLM、Qwen 和 Kimi 的视觉能力各不相同。
在网络安全问题上,Qiao将目标定义为让攻击与防御保持对等:不对称是危险的,而开放模型可以为防御方提供可获得的工具,并扩大后训练社区。她举出的 Hugging Face 案例仍有争议:Biewald称 OpenAI 的某个模型在一次评测中“某种程度上黑进了” Hugging Face;Qiao表示,据她了解,失控的是网络安全攻击基准 CyberGym,而且该模型也拒绝修复问题。
当被直接问及美国公司使用中国模型的问题时,Qiao没有给出针对具体模型的风险评估。她转而将地缘政治关切与开放开发分开,并认为开源数据基础设施曾帮助整个行业创新;在当前这个“关键时刻”,对智能的集中控制无法带来同样均衡的演进。
她的呼吁异常明确:美国公司应该发布最好的模型,并直接点名作为市场领导者的 OpenAI 率先示范。Biewald追问谁来偿还研发投入;Qiao表示,任何发布都需要一个与变现相关的“理由”,同时预测更多美国公司参与后,开源与闭源之间的质量差距最终会缩小。
7. 首日支持让客户跑赢模型淘汰
即使没有提前获得模型访问权限,Fireworks仍建立了发布即支持的声誉。早期 Mistral 权重发布时并未附带模型代码,Qiao称团队根据此前版本反向工程出实现,并在 Mistral 发布自有 API 前就开放了该模型。
质量有时会压倒速度。Fireworks曾将 DeepSeek 的上线推迟3天,因为拿到的权重和代码未通过内部评测;团队与 vLLM、SGLang 社区并肩工作到不眠不休,修复漏洞并将补丁贡献回上游。“我们不能部署一个明知存在问题的模型。”
紧迫性来自模型极短的生命周期,以及事关重大的基础模型选择。Qiao称,客户已经不再相信公开基准,因此需要立即访问模型、运行私有评测;如果花太久才决定是否重新微调,“下一个模型就会出现”。
8. Fireworks的护城河是共同设计的质量,以及专有引擎
Qiao拒绝“推理公司”“新云服务”和“PyTorch 云”等标签。Fireworks围绕输出质量共同设计训练和推理,再针对速度和成本定制部署,因为她从未见过客户仅仅为了更低价格,就接受明显更差的结果。
公司宣称的一项质量里程碑是训练与推理之间“KL 散度为零”——即使使用不同的数值库,结果仍然按位等价。这在部署阶段很重要,尤其是在 RL 中,训练器与 rollout 推理之间的反复切换可能放大微小的数值误差。
Fireworks还会把分布在全球不同区域的 GPU 汇聚起来,执行规模最高达数万张 GPU 的训练任务。Qiao强调,难点不仅是让拆分式基础设施运行起来,还要在增加同步环节后保持模型质量。
Biewald揭示了核心矛盾:Fireworks倡导开源模型,却将两套引擎都保留为专有资产。Qiao称,其模块化推理设计形成了超过10万个选项的搜索空间,并会针对每位客户的独特工作负载进行搜索;在一家约200人的公司里,内部只有约10名引擎工程师,她更愿意支持 vLLM 和 SGLang,而不是管理一个快速变化的竞争性社区。
9. 扁平且带有偏执感的公司在数据到来前做决策
Qiao称,她每天都会思考自己是否应该采用更高调的创始人形象,但“我无法改变自己”。她后悔太晚开始营销 Fireworks——工程师曾以为产品会自己说话——但她不愿通过不真实的信息换取关注。
Biewald的反驳带有支持意味:没有产品实质支撑的营销会损害信任,企业买家归根结底也是能够识别真实感的人。他的实际诊断是,市场仍把 Fireworks 视为推理供应商;公司必须不断重复“专用智能”,并让官网围绕这一简单叙事展开。
在内部管理上,Qiao偏好共享上下文、少设层级的扁平组织。她与另外6名联合创始人共同创办 Fireworks,并将公司的“深层知识诚实”归功于这群人;团队经常进行“我们会如何死掉”的事前复盘,随后继续工作,不把这种练习视为不忠。
创业带给她最大的意外,是数据的缺席。在 Meta,团队可以围绕0.1%的提升持续优化;初创公司则是在一条无人走过的路上铺路,因此决策必须从直觉出发,再通过反馈验证。“不能因为缺少数据就不做决定”——这套理念与她最后的自白相伴而行:“我总是很偏执。”