先锋 趋势 方法 投研 作者
OpenAI vs. Grok:构建“Everything App”的竞赛|Emad Mostaque、Dave Blundin & AWG|第199期
返回节目精读

OpenAI vs. Grok:构建“Everything App”的竞赛|Emad Mostaque、Dave Blundin & AWG|第199期

摘要

  • OpenAI 的触达范围正变成一个双向控制点:一端是每周8亿 ChatGPT 用户,另一端是巨量算力需求。 开发者数量从2023年的200万翻倍至400万,API吞吐量则从每分钟3亿 token跃升至60亿。Alexander Wissner-Gross据此年化推算出3千万亿 token,并预计明年达到30千万亿,逼近人类每年约50千万亿的口语规模;与此同时,GPU以及能源仍分别构成硬约束。

  • Everything App之争本质上是对有限注意力的争夺,而应用商店阶段可能只是过渡期。 OpenAI 的 Apps SDK把 Booking.com、Figma、Coursera 和 Zillow 放进 ChatGPT,Meta、Google 和 X也在争夺同一块面向智能体的对话入口。Mostaque给出的演进路径已成为可投资的简写:消费变便宜,创作正在变便宜,“真正有价值的是策展和注意力”。

  • 智能体软件开发正从代码辅助跨入递归式生产。 OpenAI表示,Agent Builder在不到6周内完成,Codex编写了80%的拉取请求;Mostaque指出,Codex CLI每周更新2次,并将Dario Amodei关于90%的代码将由AI编写的判断理解为:代码已经可以由AI来写。可视化工作流节点被视为过渡形态,因为“代码只是人类的翻译层”;终局是一个能用语音和图像交互、并解释自身持续变化的Jarvis。

  • Sora 2把生成式视频变成产品设计API,其定价已经显露出劳动力替代曲线。 Mattel的演示将草图转成具有真实物理效果的照片级玩具视频,Alexander Wissner-Gross称之为“机械设计正在被解决”。按每生成1秒$0.10、每小时$360计算,若成本每年下降10x,基于API的设计将大幅低于人工成本——前提是算力供给能跟上需求。

  • OpenAI 的$20订阅在用户基数扩大的同时仍面临价格压缩。 Mostaque表示,DeepSeek、Grok 4等突破已将 token成本削减20–30x,使基础聊天体验的年成本从约$200降至“一年几美元”。这迫使OpenAI在全球抢占用户的同时,转向广告、商业交易、基于肖像的媒体和具备经济价值的智能体工作流。

  • AI资本开支交易正从GPU扩散到完整的工业链条。 OpenAI与AMD达成6 GW协议,此前已与Nvidia合作10 GW;按Mostaque估算的每GW $50B计算,对应约$800B建设规模。BlackRock据报寻求以$40B收购总计5 GW的78座数据中心,加上Corning光学、液冷、阀门、电力和晶圆厂投入,显示出产业链的广度;但Blundin认为,可计算的上限仍是TSMC、Intel和Samsung的制造产能。

  • 数字计算机使用与具身自主正汇聚成一个统一的劳动力平台。 Anthropic预计将在数月内达到超越人类的OSWorld表现;FSD 14.1增加10x AI参数并引入神经网络路由,Gemini Robotics-ER 1.5与Optimus则指向共同的视觉—语言—动作技术栈。Mostaque将拐点放在“未来大约6个月内”,Wissner-Gross则给出了递归式终局:机器人制造机器人,再制造数据中心;数据中心产出的数字超级智能将持续提升整个系统的材料与能源效率。

精读

1. Token生产正逼近人类规模的临界点

  • Sam Altman在Dev Day上的对比给出了规模变化:2023年每周200万开发者、每周1亿 ChatGPT 用户、每分钟3亿 API token,如今已变成400万开发者、超过8亿用户,以及每分钟超过60亿 token。他的判断是:“从想法到产品,从未如此之快。”

  • Dave Blundin称从3亿到60亿的增长是最值得关注的数字,并认为随着单个开发者在编码时消耗1万+ token,需求还会加速。他对这些发布的评价刻意拉到极致:“人类历史上一些最惊天动地的事情昨天被宣布了,但它们仍然被低估了。”

  • Alexander Wissner-Gross将每分钟60亿 token换算为每年约3千万亿,参照的是全人类说出的约50千万亿 token。他预计OpenAI明年将达到30千万亿,并可能在后年超过人类一年的语音产出:“进入这个世界的AI token数量即将超过人类。”

  • Wissner-Gross称当前OpenAI生成的 token约占总量的6%,并指出仍有约40亿智能手机用户无法接入这种“超级智能”。5x–7x的扩张可能支撑“行星尺度的变革性经济变化”;Mostaque则直指眼下的 token瓶颈:AI可以在没有人类上限的情况下生产具有经济价值的 token,唯一的限制是GPU。

2. 对话式注意力正在成为新的操作系统

  • ChatGPT的Apps SDK允许用户在一次对话中调用Booking.com、Figma、Coursera和Zillow等服务。Diamandis将其描述为终极界面:用户只需提出旅行、图表、课程或房产搜索需求,无需进入底层应用。

  • Mostaque的框架是:“它们需要的只有注意力。”OpenAI、通过WhatsApp和Instagram布局的Meta、Google,以及最终可能通过X加入的Musk,都希望掌握这段对话,由MCP驱动的智能体在其中执行任务。“每个人都在努力成为Everything App。”

  • 经济演进顺序很关键:消费曾经昂贵,后来变便宜;创作曾经昂贵,如今也正在变便宜。因此Mostaque认为,策展和注意力——用户看到的像素与听到的声音——是平台剩下的稀缺资产,也是它们实现变现的渠道。

  • Wissner-Gross接受应用商店类比是市场自然演进的结果,但认为当前阶段只是过渡,因为“每一个像素最终都会被生成”。他把今天可组合的ChatGPT画布比作Apple在1987年提出的Knowledge Navigator概念:“大约40年后,我们追上了未来。”

3. 廉价创作指向自主公司

  • OpenAI的分阶段演示从遛狗的想法开始:先生成图像和名称,再让Canva将其制作成融资演示文稿。Wissner-Gross把这条工作流推向终点:“数万亿美元级的终局”是一家自主公司。

  • 他自己的案例并不戏剧化:在剑桥一个红绿灯前停下时,他用AI创建了一份商业计划,并开始为团队招募Princeton成员。Diamandis将更大的路径概括为“从思想到实体化”——说出意图,让软件搭建业务,最终再为其导入收入。

  • Diamandis引用一条推文,称平台发布已经消灭了“100万个不同的初创公司”。Blundin直接否定了这种说法,并以Replit创始人Amjad Masad愿意丢弃早期基础模型、但保留团队为例:“你不会不断重造自己的业务,否则一开始就已经死了。”

4. 可视化智能体构建器是通向语音原生软件的桥梁

  • OpenAI演示了Agent Builder:给演示者8分钟,通过可视化连接的工作流节点完成智能体的构建和上线。Wissner-Gross认为它能充当企业安全网,但把这种形式比作早期被拍摄下来的杂耍剧场:新媒介暂时沿用了旧媒介的表现方式。

  • Mostaque说得更直接:“我们要去的地方,不需要节点和意大利面。”他预计1到2年内,用户将与类似Jarvis的智能体对话,由它即时生成当下有用的看板、甘特图、工作流或应用。Claude最近的一次发布已经展现出即时编程应用的迹象。

  • Blundin提出的反驳值得保留:告诉Claude或Cursor升级账户,不应该得到如何进入设置页面的操作说明;既然智能体拥有MCP访问权限,它就应该直接执行。“AI的整个界面将是语音”,再辅以图像,而不是用线连接的方框。

  • 一名OpenAI员工表示,Agent Builder本身在不到6周内完成,Codex编写了80%的拉取请求。Mostaque补充称,Codex CLI每周更新2次;Wissner-Gross则将递归式改进再推进一步,称其会达到“负速度,即软件会被预先写好”。

5. Codex开始把语言连接到物理环境

  • 在演示中,Codex推断出Xbox手柄的摇杆映射,通过摄像头观察观众,并根据语音移动舞台灯光。Diamandis看到了一个明确的产品机会:用对话方式连接屏幕、通话、灯光、幻灯片和实时互联网素材,让视听系统变得不会出错。

  • Blundin认为这类产品并非假设:一个团队“可能6个月甚至更短时间内”就能发布,而且每场舞台演示都会成为产品自身的演示。语音与手势识别可以取代后台信号,同时让互动过程对观众可见。

  • Codex不断扩展的名称也暴露出品牌问题。Wissner-Gross称其已成为一个涵盖编程模型、基于网页的软件智能体和命令行工具的总称;Diamandis则认为,呈指数扩张的AI能力正把产品推向主题化的“杂烩式”品牌。

  • Diamandis想要的终点,是一个默认一切皆可实现、并隐藏所有后端调用的AI。Mostaque的判断十分明确:实体版Iron Man可能还要1到3年,但“在虚拟世界里,这就是今天”——组件都已经存在,只是还没有人把整个系统产品化。

6. Sora 2让产品设计变成通缩式API调用

  • OpenAI通过Mattel工作流预览了API中的Sora 2:手绘草图变成一个Hot Wheels或Matchbox风格玩具沿坡道下行的照片级视频。Diamandis最初没有意识到重点,因为合成物体及其物理效果看起来过于真实:“那个玩具甚至不存在。”

  • Mostaque表示,类似分镜的输入可以逐场景指定变化,但模型并不会显式拆解任务,而是“真的把概念插值成视频”。加上匹配音频、3D延展和改编,这些系统“确实是世界模型”,但他强调用户目前还只是触及表面。

  • Diamandis把界面从草图扩展到口头规格说明:描述一个用于盛放热液体、带把手的容器,调整其尺寸,比较成本和保温性,然后要求完成制造并在线分销。他给出的最佳消费场景是:孩子和家长描述一个独特玩具,再由一家N-of-1制造商为其打印出来。

  • Wissner-Gross的经济判断是绝对的:“机械设计正在被解决。”Sora 2的基础定价为每秒$0.10,即每生成1小时$360;假设成本同比下降10x,他预计外包设计将比人力更便宜。如今5或6分钟的生成等待时间,仍然暴露出算力瓶颈。

7. 基础聊天商品化后,OpenAI必须将工作流变现

  • Mostaque认为,DeepSeek、Grok 4等突破已将每百万 token成本削减20–30x,使“基础聊天体验”本身不再足够。他估算,略高于1年前还要每年约$200的体验,如今只需一年几美元;而有价值的工作流则从2000 token扩展到2万、20万,并继续走向200万。

  • 因此,OpenAI需要广告、商业交易、Sora肖像,以及能够支撑更高 token消耗的智能体垂直场景。Google和Meta已经拥有广告现金流;竞争对手也越来越能免费提供年初还属于OpenAI、售价为每月$20的旗舰产品。

  • Diamandis称,OpenAI进军印度、英国、希腊等市场,是在中国开源模型并行推进下进行的一场全球用户抢占。Mostaque的战略解读是,Sam Altman正在锁定两个“基础控制点”:用户安装基数和庞大算力,并相信两者之间的一切会自行补齐。

8. 竞争模型同时攻击电脑控制与注意力

  • Anthropic的进展通过OSWorld呈现出来:这是一个源自Salesforce的基准,覆盖Ubuntu、Windows和macOS上的数百项日常任务,操作方式包括截图、键盘和鼠标。Wissner-Gross预计,按当前直线进展,其表现可能在年末或未来数月内超过人类。

  • 当Diamandis说Perplexity Comet给了他一个含糊且“一派垃圾”的解释时,Wissner-Gross明确了该基准的含义:它测量的是跨应用的实际电脑控制能力。Mostaque称其约360项任务表明,通用模型在更丰富的环境中得到强化后,已经能够完成大多数标准人类数字工作:“这就是起飞点。”

  • Diamandis用“这可能出什么问题”回应起飞,Wissner-Gross则刻意将框架反转为“这可能带来什么好处”。Blundin补充称,同样的数字控制能力已经被用于科学工厂,持续运行数百甚至数千台实验设备。

  • Grok Imagine从0.1版升级到0.9版,重点放在15秒片段、“速度和乐趣”以及游戏上。Wissner-Gross提出,视频可以成为一等推理模态,让模型在思维链中想象片段;Mostaque则将OpenAI上半年43亿美元收入与游戏行业去年的2000亿美元收入进行对比。游戏是否会好玩,仍然明确不确定。

9. 算力需求正在重编工业基础

  • OpenAI与AMD达成部署6 GW GPU的协议后,据Blundin称,AMD股价上涨约30%;达到里程碑后,OpenAI将以“几乎零价格”获得AMD 10%的股权。他认为,AMD能够获得TSMC制造产能才是更深层的战略筹码。

  • Mostaque将这6 GW与OpenAI正在和Nvidia合作的10 GW合并计算,并按每GW $50B的建设成本估算,总规模约为$800B。为了消化这部分产能,他预计OpenAI及其同行将销售价格从$10,000到$100,000不等的完全自主劳动力,实质上是在争夺整个软件化劳动力市场。

  • 据报道,BlackRock考虑以$40B收购最多78座、总计5 GW的数据中心,其中包括俄亥俄州一座前燃煤电厂等棕地项目。讨论中的下游受益者包括Corning光学、硅、玻璃、光子学、液冷、阀门和其他基础设施。Alex Wissner-Gross称,一家运营商已经买入100万个阀门,用于隔离高价值1U设备周围的泄漏。

  • Blundin的限制模型是:芯片晶圆厂的产能对“无限需求”形成约束,而TSMC、Intel和Samsung的产能可提前4年看到。Wissner-Gross的条件不同:只要AI将服务成本推向零并持续产出有价值的发现,资本开支就可以延续。他认为,与天然气、SMR及未来聚变电厂共址可能是一条离网路径;Diamandis另行提出了由太阳能供电、位于太空中的GW级数据中心。

10. 具身AI打通劳动力与算力的闭环

  • Tesla的FSD 14.1增加了10x AI参数,引入神经网络导航与路径规划、具备障碍感知的绕行和可选择的到达行为;Musk的说法是:“V14感觉活了。”Wissner-Gross预计它会与自动驾驶出租车技术栈融合,并在2到3年内与Optimus共享端到端视觉—语言—动作模型。

  • Gemini Robotics-ER 1.5被描述为在具身推理和指向精度上优于GPT-5。Mostaque强调效率曲线:几年前需要高性能、约1000瓦芯片才能完成的任务,可能转移到边缘算力上,从而催生能够学习广泛物理任务的专用模型和硬件。

  • DeepMind的ASIMOV安全基准让Wissner-Gross十分兴奋,因为它将Isaac Asimov的机器人三定律与具身模型的替代规则体系进行比较;按照他的解读,结果显示替代方案更好。对话中给出的具体落地案例是一家名为Andy Systems的回收公司,它利用视觉识别回收贵金属,为下一代芯片提供材料。

  • Diamandis称Musk表示,演示中的Optimus功夫环节是自主完成的,而非远程操控;讨论中没有提供相反证据。Mostaque预计,功夫这类学习技能可能只占几MB;Wissner-Gross则表示,服务业劳动中约2/3与实体工作有关,并称这一产业“已经近得令人痛苦”。

  • 终局将劳动力重新连接到基础设施:要在2030年代初达到250 GW,可能需要机器人来建设数据中心。Wissner-Gross所说的“最内层循环”是递归式自我改进——机器人先制造机器人,再由这些机器人建设数据中心,最终产生的数字超级智能提升机器人和数据中心的材料与能源效率;Mostaque则将广泛拐点放在“未来大约6个月内”。