趋势 方法 投研 作者
返回趋势

模型多了,选择就值钱了:Stripe 百亿买 OpenRouter 背后的编排层之争

2026/08/17

深度思想,谈 AI 与向往

—— 字节深思圈

两个月前,OpenRouter 以 13 亿美元估值完成 B 轮。两个月后,Stripe 报价 100 亿美元收购。涨了近 8 倍。

谈判还在进行,交易可能告吹。但报价本身已经说明问题:资本开始为"模型与用户之间的连接层"单独定价。

模型市场、编程应用、研究实验室,原本是三种生意。近一个多月,它们指向同一个方向:谁来决定每个任务用哪个模型、哪个工具、哪个 Agent。比起谁拥有最强模型,下一阶段更值得争的是这件事。

我的判断是:模型多了,选择就值钱了。但选择本身不是一门好生意,结果数据才是。

Stripe 买的不是路由算法,是需求地图加结算闭环

OpenRouter 的商业模式不复杂:充值手续费 5.5%,BYOK 管理费,不靠推理服务本身赚钱。

它特别在位置。截至 2026 年 6 月,接入了 400 多个模型、70 多家供应商、800 万用户。每周处理的 token 从一年前的约 5 万亿涨到 29.2 万亿。

站在这一层,它看得到单一模型厂商看不到的东西:哪个模型在哪类任务里被用,开发者愿意为速度还是质量付钱,哪些模型正在被替换。

过去一年,中国模型的 token 份额从 4.5% 涨到 46%,DeepSeek 独占 17.6%。美国模型从 70% 掉到 30%。但 Anthropic 用 12% 的 token 份额,拿走了平台上约 50% 的收入。

调用最多和最能赚钱,是两回事。这张实时变化的模型需求地图,就是 Stripe 最想要的东西。

它之前已经收购了用量计费平台 Metronome,做 token 计量和账单。OpenAI、Anthropic、Databricks 都是 Metronome 的客户。把 OpenRouter 纳入体系,模型选择、流量分发、用量计量、支付结算就连成一条链:开发者发起一次调用,到 token 被计量,到完成收费,几乎都发生在 Stripe 生态里。

OpenRouter 的 CEO Alex Atallah 不把自己叫路由公司。他的说法是"unplanned inference capacity"——帮企业兜住没预料到的推理需求。整个市场在低估自己的推理消耗量,当某个模型的调用量远超预算,OpenRouter 负责让这不成一场基础设施事故。

所以这 100 亿美元买的,是模型访问、流量分发、交易结算三者交汇的入口。

选模型,从工程问题变成了经济问题

路由、降级、故障切换,本来是工程系统的常规能力。变化在于,过去选模型不费劲,现在成了一笔经济账。

模型供给从稀缺转向过剩。仅 2026 年 7 月,OpenRouter 就上线了 70 个新模型,大约每 10 小时一个。同一个任务,不同模型在价格、速度、上下文、能力上差异明显,没有单一指标能代表全部。

最强的模型不等于每次调用都值得。复杂代码重构要前沿模型,简单分类和格式转换交给便宜模型就够。全用最贵的,成本失控;一味贪便宜,任务失败、重试、人工修正的隐藏成本更高。

Agent 把这个放大了一层。一个用户请求可能被拆成搜索、规划、写代码、调工具、验证、总结,每一步能力需求不同。编排的对象从"为一个 Prompt 选模型",变成"为一条任务链分配模型、工具、算力和权限"。

推理市场还在膨胀。GPT-5.6 Luna 降价 10 倍后,用量涨了 13 倍,而且是稳定增长。降价把整个池子撑大了,每一次模型选择牵动的成本差异也在同比放大。当模型账单能直接决定毛利,编排的商业价值就要用更接近业务的指标衡量:单次成功任务的成本、人工接管率、首次完成率。

别把所有 Router 混为一谈,编排至少有四层

“模型编排"已经装进了太多产品。先分清它们在调度什么。

第一层,供应商路由。同一个模型由多家供应商提供,按价格、吞吐、延迟、可用性分配请求。OpenRouter 的 Provider Routing 在这一层。

第二层,模型路由。按任务难度在不同模型之间选。Cursor Router、Microsoft Foundry、Bedrock 都在这一层。

第三层,Agent 与工作流编排。拆任务、分 Agent、调工具、定顺序、处理重试。Sakana 的 Fugu 接近这个方向。

第四层,企业控制与治理。权限、预算、审计、日志、评测、安全、隐私、故障切换统一管理。这更像 AI 时代的 Control Plane,路由只是其中一项能力。

四层互相覆盖。只做模型路由的公司,容易被做治理的平台顺手覆盖。真正值得看的是,谁能在关键一层掌握数据、工作流或客户关系,并延展成不易替换的控制权。

谁最有机会:掌握结果数据的应用公司

三类玩家,优势短板都清楚。

模型厂商和云平台想把路由留在自己生态里。AWS、Microsoft、Google 都把路由做进了企业产品。它们有客户、算力、账户体系、合规能力,部署摩擦小。但短板也明显:能看到 Prompt 和响应,看不到业务结果。AI 生成的代码有没有进仓库,合同有没有被律师采纳,客服回复有没有真正解决用户问题——这些信号都留在应用里。

独立 Router 和 AI Gateway(OpenRouter、Martian、Not Diamond)主打中立、多供应商、统一 API。客户选它们,为了不被任何一家模型厂商锁死。但这一层功能门槛不高,容易被云厂商或开源方案复制。缺独有的决策数据和交易网络,独立平台很容易退化成一条可替换的数据管道。

应用公司最有戏。Cursor 是典型:从"写代码"这个完整任务切入,拿到前两类玩家都拿不到的东西——完整任务上下文、用户主动切换模型的行为、生成内容是否被接受、结果是否进入生产系统。它甚至提出"keep rate"指标,衡量 AI 生成的代码一段时间后还有多少留在代码库。

应用层还在积累另一种资产:用户记忆。跨模型、跨会话的记忆一旦沉淀在某一层,就变成实质性的切换成本。Atallah 的判断是,没有一层能独占所有有价值的记忆,但应用层积累的上下文是模型厂商根本拿不到的。

只有能持续观察任务结果、把结果反馈到模型选择和评测里的平台,才能建立与业务价值挂钩的编排能力。

编排不会自动赚钱

理想状态下,应用公司能跑出数据飞轮:更多任务带来更多反馈,反馈沉淀成更细的任务分类和模型能力地图,路由越来越准,成本越来越低,吸引更多用户。

但飞轮不会自动转。条件很苛刻。

反馈必须接近真实结果。点赞、停留、重新生成,噪声都大。代码被接受可能只是因为改起来太贵。真正有价值的反馈在业务终点:代码通过测试、合同被采纳、工单被关闭。

模型之间必须有足够明显的能力差异。趋同了,路由的价值就下降。任务还要有重复性,极低频任务攒不出稳定的路由策略。企业数据隔离会切断跨客户学习,一个 Router 在银行里学到的策略,未必能合法迁移到另一家客户。

更要命的是隐形成本。2024 年前后一批"语义路由"公司,现在不少已经转型或收缩。单条 Prompt 的信号太少、噪声太高,判断错了也没反馈,路由器自己的延迟和推理成本却是真实的,还看不到任务最终是否完成。

Sakana 的 Fugu 是个更好的反例。编排器本身被训练成模型,7B 参数调度 1 到 3 个 agent。SWE-Bench Pro 上 73.7%,超过单模型。但独立审计显示,约 60% 的计费 token 消耗在用户看不见的内部协调。一个简单问题,单模型 2 秒,Fugu 用了 108 秒。38 个知识任务,成本是直接调 Opus 的 5 倍,结果 36 平、Opus 赢 2、Fugu 零胜。

编排本身会产生额外开销,这些开销很可能抵消编排带来的收益,而且两者往往来自同一套机制。

多模型编排的价值,最终体现在完成一次真实任务的总成本更低,而不是单纯省模型调用费。否则,它只是把用户看得见的模型费用,转移到了看不见的协调层。

两门生意:To C 省选择,To B 卖控制

同样一层技术,消费端和企业端长成两门生意。

To C 的目标是让模型选择退出用户注意力。用户不关心哪个模型代码强、哪个便宜,只想说清任务拿结果。最自然的产品形态是 Auto,产品自己选模型、重试、切换、降级。

但 Auto 最大的挑战是信任。用户一旦怀疑产品为了省钱偷换便宜模型,或者不理解为什么同一个任务今天昨天表现不同,路由器就从体验优化器变成黑箱。

To B 恰好相反。企业要结果,还要知道为什么选了这个模型、数据流向哪、一次任务多少钱、出错谁负责、能否回放审计、能否给部门设预算。企业级编排最终长成云成本管理、API Gateway、权限和可观测性平台的结合体。

企业付费买的不是最佳路由,是可控性、可验证性和治理能力。能省 40% 但说不清缘由的系统,过不了采购和合规。省得少一点、但每次决策可审计可回放可归因的系统,反而容易签下来。

Atallah 有个反直觉观察:企业客户对前沿闭源模型的紧张,高于对中国开源模型。原因不是安全威胁,是数据政策不透明——prompt 存在哪、谁在看、能不能在自己的基础设施上跑。这种焦虑给独立编排层开了个意外入口:OpenRouter 提供 PII 脱敏、prompt 注入检测,企业打开开关,就能在所有模型上统一执行数据治理策略。直接对接任何一家模型厂商做不到这件事。

做 To B 编排,产品能力一半以上可能不在路由算法上。

机会还在,但不在"模型聚合”

模型编排的牌桌已经挤满了人,机会没消失,只是不能再停留在聚合层。

四个方向值得看。垂直行业 Router:法律、金融、科研、医疗各有自己的任务分类、评测基准、合规要求,通用 Router 读不懂行业的任务标准,行业 Router 的竞争力来自任务知识和结果数据。企业 AI Gateway:统一模型入口,管理多模型、权限、预算、日志、数据策略,需求明确但要直面云厂商和开源项目。Router 评测与可观测性:企业很难知道 Router 是否真有效,独立评测平台能回答"省了多少钱、质量有没有降、哪类任务最容易被错误路由",编排普及后这会成为整个体系的监控层。Agent 任务调度系统:长任务里模型选择只是一步,分工、工具权限、状态、重试、人工接管、预算上限需要系统化管理,形态接近 Agent Runtime。

还有一个趋势:应用公司开始从编排向模型开发延伸。Cognition 有了自己的模型,Cursor 也有。做 Agent 的公司有明确动机训自己的模型。如果应用公司掌握了结果数据,又用这些数据训练专属模型,编排层和模型层的边界会越来越模糊。

判断一个编排方向值不值得做,问几个问题就够了:有没有真实任务数据?能不能观察最终任务结果?收益能不能用成功率、成本和稳定性量化?策略能不能跟上模型迭代?有没有嵌入客户核心工作流?数据飞轮在合规边界内转不转得起来?

接入更多模型,最多做出一个初始产品。真正的壁垒,是进入高价值任务场景,看见任务如何完成,再通过持续实验长出一套别人难以复制的模型选择与调度系统。

模型多了,选择值钱。但值钱的是选择背后的结果数据,不是选择本身。

注:文中交易报价、估值、token 份额与评测数据均来自 Founder Park 报道转述(来源含华尔街日报与 OpenRouter 官方访谈),未逐一独立核验;交易仍处谈判阶段,可能告吹。

最后更新于