
Matan Grinberg
前沿洞察
大模型格局走向多强均势,八至九成前沿任务正加速外溢至开源生态,盲目堆砌Token的企业正迎来ROI“宿醉”清算。竞争壁垒已彻底从裸模型能力,转向智能体基础设施、企业上下文检索与执行力。开发范式正经历从“IDE辅助”到“云端自主委派”的质变,但商业化落地仍受困于计量计费、模型行为漂移与语义评测瓶颈。
观点集合
OpenAI vs Anthropic vs 开源模型|Token 最大化、AI“宿醉”与即将到来的 ROI 清算
- 🗓️ 日期:
2026-06-13| 🎙️ 节目:20VC
模型市场可能容纳至少4家能力大致相当的前沿实验室,而当前前沿任务中80%至90%可迁移到开源模型,剩余决策 Token 的支出反而上升。企业 Token 最大化已进入 ROI 宿醉期,竞争优势正从单纯能力转向资源配置、智能体基础设施、核心能力和销售执行。
查看访谈对话精读提要
模型大战可能不会有唯一赢家。 Matan 过去12个月最大的认知转变是:他曾认为会有1、2家实验室甩开其他竞争者、统治前沿模型,如今则认为“可能至少会有4家,能力大致相当,而这本身就是胜利……对人类而言,最糟糕的情况是只有一家特别特别强”。Factory 自己的悲观情景则是反过来:只有当一家实验室明显领先时,公司才会死掉——“但那就意味着整个经济都要担心一家垄断者”。如果被迫在 IPO 当天选一家,他会纯粹因为波动性选择 Anthropic:“OpenAI 的随机、混乱、动荡事件更多。”
企业 AI 已经进入“宿醉”阶段。 路径是:董事会向 CEO 施压 → 把 Token 最大化写进绩效考核 → “你回头看账单,会发现,天啊,我们花了这么多钱,却完全不知道 ROI 是什么”。他认识的一位 CIO 发现,公司每月有数十万美元花在员工向 Opus 4.8 问“最近怎么样”和天气上。Factory 多家客户私下已经出现类似 Uber 的$1,500/人上限,他预计前沿模型使用量会出现短期收缩,并认为这是健康的。
如今在前沿模型上运行的任务中,有80%-90%其实可以交给开源模型。 通常只有“规划”需要前沿模型。Harry 反问,这难道不是对 Claude Code 和 Codex“有史以来最大的悲观情景”吗?Matan 的回答是,剩下的10%-20%属于“决策 Token”——类似管理层工时,数量少却最有价值——而且即使前沿模型的使用占比下降,单 Token 的前沿模型支出仍在上升。他还说:“美国没有前沿开源模型,实在挺丢人的。”
Token 支出很可能会接近薪资支出。 针对 Harry 的基准——可能是 Marc Benioff 花在 Anthropic 上的3亿美元,相当于开发人员薪资的3.8%——Matan 认为,3年内的中位数将达到“一个数量级……与薪资相当”。但个体差异会从0%一直拉大到“数万个百分点”,因此给每名工程师设统一预算是在“用过于宽泛的刷子作画”。
价值归属是一个随时间变化的现象——模型、应用和基础设施都在“试图把不是自己的那一层商品化”,因此他强烈反对未来12个月属于 AI 基础设施的判断。 Kirkland 投入5亿美元自建 AI 的案例说明了另一点:“构建 AI 技术不是这家公司的核心能力”,而这“其实对 Harvey 有利”。更深层的变化是:“未来将不会再有任何东西是没人能造出来的”——护城河会从能力转向资源配置。
劳动力替代叙事是融资策略,不是预测。 Dario 说“我们会拿走你的工作”,让他“非常恼火……这是出于自私的原因”:当你要筹集数千亿美元时,“说整个资本主义都完了”是最能说服投资人的方式;等到 IPO 时,同一批人又会变成买家。Harry 补充说,可能 Zuck 和 Demis 从未这样说过,因为他们从来不缺钱。短期替代令他担忧,长期则不担忧。基础设施泡沫?“长期绝对不是,完全不是一回事。”
人才与市场进入正在被同时重估:奥赛漏斗式履历如今“有点像反向信号”,“博学多才者的时代回来了”;把销售和市场视为脏活,则是一颗定时炸弹——那些靠淘金热混日子的 AI 公司是“漂在太空中、没有重力的宇航员。 你的肌肉会萎缩,重力终将回来”。
🔗 原始收听与视频来源: OpenAI vs Anthropic vs 开源模型|Token 最大化、AI“宿醉”与即将到来的 ROI 清算
AI 编码工厂
- 🗓️ 日期:
2025-05-29| 🎙️ 节目:Latent Space
Factory押注企业开发将从IDE协作转向云端委派,尤其服务遗留代码库和并行任务。专业化droids、企业上下文与选择性检索据报将一次迁移从4个月压缩至约3.5天且零停机。按使用量计费、模型行为冲击和语义评测仍限制采用,尽管Fortune 500部署加速。
查看访谈对话精读提要
Factory 的核心押注是:企业软件开发将从 IDE 内协作,转向覆盖完整 SDLC 的云端委派。 目标用户是维护 30 多年历史代码库的数十万名开发者,真正的价值不在于让人“快 15% 或 20%”,而在于把完整任务交给并行运行的云端 agents。随着人类亲自编写的代码减少,规划和协调仍将由人主导,而代码与文档执行可能“很快”完全委派出去;测试和验证预计反而需要更多人工投入。
产品的差异化不在单一编码模型,而在编排能力:专业化的“droids”、企业级上下文、选择性检索和异步执行。 知识、代码和可靠性 droids 可连接 Linear、Jira、Slack、GitHub、Sentry 和 PagerDuty 等系统;agent 会主动提出澄清问题,而不是要求用户掌握 prompt engineering。演示中,它修改或新建了约 12 个文件,仅消耗 43% 的上下文,随后还可以被指示创建 pull request,同时向用户展示一幅“通往其大脑的 X 光片”。
Legacy modernization 是本期提出的最清晰的企业 ROI 切入口。 创始人称,一家大型上市公司的迁移项目据报从 4 个月压缩至约 3.5 天,且全程零停机。其代表性流程把代码库分析、文档编写、依赖关系梳理、Jira 工单和并行实施转化为 agent sessions,压缩了一个长期受“官僚流程、技术复杂度和理解成本”拖累的瓶颈。
按使用量计费使检索效率成为商业要求,而不只是技术偏好。 客户支付少量固定接入费和按用户计费的费用,但大部分支出来自“standard tokens”;因此 Factory 只检索相关代码和组织上下文,而不是把整个 monorepo 倾倒进不断扩大的上下文窗口。企业级质量的一项指标是代码 churn:成熟代码库可能处于 3%-4%,维护糟糕或变化迅速的代码库则可能达到 10%-20%。
创始人认为,在 frontier models 持续变化的背景下,更高杠杆的层是 harness 和评测栈。 他们把基于任务的代码评测与针对提问、规划和工具调用的行为规范结合起来;主持人提到,一次 SWE-bench 运行的成本估计可达 8000-15000美元,Matan 则指出,基准图表可以充当“粗柱对细柱”的营销。Factory 最可能提出的模型需求,是让模型基于持续 1-3 小时的目标导向轨迹进行 post-training,同时摆脱供应商特有的 CLI 习惯——目前这些习惯会让模型偏好 Grep 或 Glob,而不是更好的工具。
按创始人的说法,商业化目前更多受采用率和 top-of-funnel 限制,而不是受早期产品拉力限制。 在略超过 2 年的时间里,他们用了约前 1.5 年打磨企业交互模式;过去 90 天,Fortune 500 的部署据称明显加速,主要靠口碑传播。一名 1 月份的用户据称表示,即使公司里只有他一个人使用 Factory,他仍会要求公司允许他继续使用,而不是“为我自己雇 3 名工程师”;Factory 目前正在大量招聘技术能力很强、面向客户的运营人员,内部称其为“初级 Eno”。
🔗 原始收听与视频来源: AI 编码工厂