先锋 趋势 方法 投研 作者
OpenAI企业业务内部:前沿部署工程、GPT-5及更多 | BG2嘉宾访谈
返回节目精读

OpenAI企业业务内部:前沿部署工程、GPT-5及更多 | BG2嘉宾访谈

摘要

  • OpenAI的企业业务早于ChatGPT——“OpenAI最初真正的产品并不是ChatGPT,而是B2B产品,也就是API”——如今公司还在运行一种Palantir式的前沿部署工程师模式,将工程师嵌入T-Mobile(由OpenAI模型实时处理语音客服)、Amgen(GPT-5在药物开发文书领域的头部客户)和Los Alamos(将o3物理部署到与Lawrence Livermore、Sandia共享的气隙Venado超级计算机上)等客户。
  • 面对MIT“95%的AI部署都无法奏效”的标题,Olivier从约200次企业部署中总结出的规律是:自上而下的支持加上自下而上的“虎队”,并且先做评测;“客户拿不出好的评测时,目标就一直在移动。” 企业知识大多存在于“人的脑子里”,而不是SOP中,从46%爬升到99%是“艺术,有时甚至更像艺术而非科学”。
  • 本期最锋利的判断是:尽管安全门槛更高,2025年的“物理自主性领先于数字自主性”。 因为自动驾驶有10-15年时间,以及道路、红绿灯等脚手架;而“AI agent就像被直接丢在荒郊野外”。Agent只诞生于o1-preview的推理范式,而“我认为这条斜率陡得惊人”;按收入计算,它们可能已经越过Waymo。
  • GPT-5的差异化在于“工艺——模型的风格、语气和行为”,而不是已经饱和的基准测试。 一位主持人称,某项评测显示幻觉“基本降到了零”;尚未解决的核心取舍是推理token与延迟——GPT-5 Pro能“一次解决”过去无法解决的问题,但需要等待10分钟。反直觉的教训是:指令遵循变得过于字面,旧式“请保持简洁”的提示词反而让输出失灵。
  • 强化微调(RFT)——Olivier说这是OpenAI创造的术语——比SFT“强一个数量级”,也把推介重点从定制模型转向利用专有数据打造“世界上最好的模型”(金融服务领域的Rogo、在TaxBench上达到SOTA的Accordance)。 Olivier的判断是:在前沿能力上,“RFT基本会成为行业常态”。
  • 多空交易上,Sherwin做空“围绕AI产品的整个工具链”——评测产品、框架、向量数据库,以及如今的RL环境创业公司——因为技术栈迭代太快,抽象层很难跨越一代模型存活。 Olivier做空以记忆为核心的教育(“知识token”),做多医疗——“可能是最受益于AI的行业”。
  • 值得记录的软信号包括:即便工程师人数的含义仍不明确,未来仍将需要多得多的软件工程;“世界上存在巨大的软件短缺”(OpenAI的产品经理如今直接交付写好的原型,而不是PRD);Codex CLI与GPT-5的使用正在加速;而“那次插曲”(董事会政变)让OpenAI变得反脆弱——“更抗打,也能更快恢复”。

精读

1. API先于一切——企业业务是OpenAI“分发AGI”的方式

  • Sherwin提醒说,他3年前加入时,API“实际上是我们唯一的产品”——ChatGPT后来才出现。如今ChatGPT大约是“全球第5大网站”,但平台——API、政府/公共部门产品,以及正在成形的直销企业业务——才被视为使命更完整的表达:它能触达企业内部的应用场景和终端用户,而消费级应用做不到这一点。
  • Olivier的说法是,B2B之所以是核心,是因为“有一大类应用场景只能通过B2B实现”:每年多生产10倍的药物、更好的教育和公共服务——“真正推动现实世界运转的,就是这些企业”。他明确将其称为Palantir命题。

2. T-Mobile:用OpenAI模型处理语音客服,加上Palantir式FDE

  • 在嵌入客户约1年后,T-Mobile应用内的客服通话“实际上由后台的OpenAI模型处理”——包括文字和语音;在实时API支持下,效果听起来“超自然,无论延迟还是质量都像真人”。Olivier说,实时API大约在前一周正式GA。
  • 模型之上的部分才是真正的工作:前沿部署工程师(“我们借用了Palantir的说法”)负责把模型与CRM及企业工具编排起来,而这些工具“甚至没有API”——先搭建网关,再定义黄金评测集。音频评测“尤其难打分”:一次5分钟的转接电话, “你到底怎么知道正确的事情发生了?”
  • Sherwin指出了飞轮效应:T-Mobile的经验直接反馈进新的实时GA模型快照——深度嵌入企业客户,同时也是模型研发。

3. Amgen与Los Alamos:药物文书和气隙环境中的o3

  • Amgen是“GPT-5的头部客户”,将医疗需求分为两类:基于海量数据的纯研发,以及常被低估的行政和文档撰写工作。一旦研发“基本锁定了药物配方”,监管申报与审查就会变成“大量工作”。Apoorv补充说,如果药物能更快上市,影响范围可能达到数亿人的生命。
  • Los Alamos获得了o3在气隙Venado超级计算机上的定制化本地部署——“我们确实得把模型权重物理带进他们的超级计算机”,而该设施禁止携带手机。OpenAI能看到的信息有限,但反馈显示,o3正在加速实验、处理数据笔记本;推理模型还带来了一项新能力:充当实验设计上的“思想伙伴”,这是老模型“很难真正做到的”。该系统与Lawrence Livermore、Sandia共享。

4. 为什么95%会失败:先组虎队,再做评测,然后爬坡

  • 针对那份“震动市场几天”的MIT报告,Olivier根据“几百次”部署总结出的模式是:自上而下的支持,加上自下而上的虎队;团队同时具备技术能力和机构知识,因为即便在客服领域,“绝大多数知识都存在于人的脑子里”,而不是写进SOP。
  • 第二步是先做评测——“客户拿不出好的评测时,目标就一直在移动”。Olivier进一步强调,评测必须从实际操作者自下而上地产生;自上而下下达评测要求并不起作用。
  • 第三步是爬坡:“你已经有了评测,目标是达到99%。起点可能只有46%。”而抵达目标是“艺术,有时甚至更像艺术而非科学”;当模型遇到明确局限时,偶尔还需要OpenAI亲自对模型做微调。

5. 自主性的悖论:Waymo能跑,你的订票Agent却不行

  • Apoorv提出的问题是:物理安全的标准高于人类能力,毕竟牵涉生命,但“2025年的物理自主性领先于数字自主性”。听起来更容易的问题,为什么反而更难?
  • Sherwin给出两部分答案。第一是时间线:自动驾驶经历了10-15年发展,其中包括一段幻灭低谷;而Agent真正起源于不到1年前的o1-preview推理范式,“但我认为这条斜率陡得惊人”。第二是脚手架:汽车拥有道路、红绿灯和交通法规,而“AI agent就像被直接丢在荒郊野外”。
  • 可交易的推论是:失败的企业部署“很可能没有脚手架”。大量FDE工作其实是在搭建连接器、整理数据,让模型拥有可以标准化交互的对象。而交叉点可能已经出现:“如果现在AI agent产品的收入超过Waymo,我不会感到意外。”

6. GPT-5:工艺胜过基准测试,以及思考时间的取舍

  • Olivier的框架是:类似“SWE-bench”的基准测试分数很高,但“同样重要、同样有影响力的是模型的工艺——风格、语气和行为”。这是首个经过数月客户反馈闭环打造的大型版本;客户很多时候要的不是更高的智力,而是“在不知道答案时更可能说不知道的模型”。
  • Sherwin说,仍在持续迭代的最难取舍是推理token与延迟。GPT-5 Pro能“一次解决”其他模型无法处理的问题(Sam转发的Andrej推文),但“代价是你要等10分钟”;对商业用户而言,“完全不用等待但答案稍差”可能更能接受。思考过程应当变得更动态,下一个快照还会针对代码质量和惯用写法。
  • 在稳健性方面,一位主持人称某项评测显示幻觉“基本降到了零”——“并不完美,仍有大量工作要做”,但推理能力让模型更可能拒答,而不是编造。

7. 指令遵循的猴爪效应

  • 开发者要求更好的指令遵循,得到的是一个几乎“逐字照办”的模型。测试中“太简洁”的抱怨,后来被追溯到旧提示词:其中连续10行要求“保持简洁”,几乎是在乞求模型这么做。GPT-5严格执行后,只返回一句极短的回答。删掉这些历史包袱后,模型行为就恢复正常。“提示词工程仍然非常、非常重要。”
  • Apoorv还提到一个对投资人有意义的旁证:被投网络安全公司Expo在GPT-5上的表现提升如此明显,以至于“他们很快就需要一套新的评测”,而回应是:“一切都在于评测。”

8. 语音到语音胜过拼接,但逻辑层尚未统一

  • 实时API之所以优于“拼接模式”(语音转文字→思考→文字转语音),是因为额外环节会增加延迟,而且会“丢掉情绪”——电话中的停顿和语气都很重要。Apoorv反驳说,函数调用逻辑是用文字编写的,因此语音意味着“略有不同的架构”;跨模态统一编排仍在推进,许多客户仍采用拼接方案。
  • 语音模型擅长“轻松的日常对话——和教练、治疗师聊天”,但必须被教会具有经济价值的行为:知道什么是SSN;如果某一位数字听不清,“就必须重新确认,而不是猜一个答案”。
  • Sherwin感叹道:“你实际上是在拿一个人说话时的音频比特……然后生成另一段音频比特。在我看来,这项技术居然能工作本身就很疯狂”,更不用说还要处理口音、语气和实时客服通话。

9. RFT:在自己的数据上启动RL

  • 强化微调是Olivier所说由OpenAI创造的术语(“在我们宣布它之前,它根本不是一个真实存在的东西”),于去年年底推出,可能是在“圣诞节12天”活动期间,随后正式GA。它把RL引入微调:“复杂得多,也更难调,但比SFT强一个数量级”。它需要可评分的任务和客观评分器,而不是提示词—补全配对。
  • 这里的重新定义是:不是定制模型,而是利用专有数据,“为你关心的业务场景打造一个世界上最好的模型”。案例包括金融服务公司Rogo(团队来自DeepMind)处理金融文件任务;以及Accordance,Olivier称其在面向CPA工作的TaxBench上取得了他认为属于SOTA的结果。
  • Apoorv的判断是,基础模型已经足够好,没必要再通过微调来引导行为;但如果目标是推动前沿能力,“我的直觉是,RFT基本会成为行业常态”,并配合定制环境。所需数据必须来自底层:由领域专家提供复杂的任务知识。

10. 多空、编程未来,以及那次插曲

  • Sherwin看多电竞:亚洲已经具备体育场级别的规模,年轻人的注意力正在迁移过去,而经历COVID行情后,它仍“被低估”。他给出的“辛辣”做空是“围绕AI产品的整个工具链”——2年前是评测产品、框架和向量数据库,如今则是RL环境创业公司——因为“今天炙手可热的框架,下一代模型可能根本不会用”。Olivier的组合是:做空任何强调记忆的教育(LLM已经拥有的“知识token”),做多医疗——“可能是最受AI影响、受益最大的行业”,因为这里同时具备结构化数据、行政工作密集的文化,以及适合研发的企业。
  • 对于10年后软件工程师是否会从4000万-5000万人增长这个问题,两人的答案都是:软件工程一定会更多,只是岗位名称未必清晰。一个Reddit故事讲的是,一名男子用ChatGPT为无法用语言表达的兄弟打造定制工具,让他能够浏览互联网。Apoorv说,“世界上存在巨大的软件短缺”;Olivier说,OpenAI的产品经理如今几小时内就能交付写好的原型,而不是PRD。个人工具选择上,两人都投了Granola;至于Codex CLI与GPT-5,Sherwin说:“我感觉自己已经和模型心意相通。”
  • 荆棘与玫瑰: “那次插曲”(董事会政变)当天极其惨烈,却让OpenAI变得反脆弱——“更抗打,也能更快恢复”。此外,前一年11月或12月曾发生过一次总计3-4小时的中断,证明API“几乎已经像公用事业”。玫瑰则包括:以大规模token吞吐量发布GPT-5且没有中断,以及2023年11月的开发者日——现场演示成功后,Sherwin搭乘Waymo回家。
  • 两人都说自己已经被AGI彻底感染(“我觉得自己已经AGI-pilled了。”——“你绝对已经AGI-pilled了。”)。Olivier的关键时刻包括:2023年意识到自己“以后再也不需要手动写代码了”,以及模型能听懂他的法国口音;Sherwin则是在2022年9月、ChatGPT发布前于内部见到GPT-4,以及体验深度研究:“我会把某件事丢给模型,心想这东西不可能做得到。结果它却直接把球打出了公园。”