AI 圈内人拆解 GPT-5 更新及其对 AI 竞赛的意义:与 Emad、AWG、Dave 和 Salim 对谈
摘要
GPT-5 的发布失去了舞台效果,却赢在分发、价格和编程能力追平。 Dave Blundin 称其期待度“跻身史上最重要的3大产品发布之列”,但亲民化的呈现方式和熟悉的编程演示,帮助市场将 Polymarket 对 OpenAI 保住最强模型的约80%概率,反转为押注 Google。抛开失望情绪,圆桌给出的简洁结论影响重大:OpenAI 将 AI 成本至少砍半,在编程上追平 Anthropic,并把7亿周活用户推向前沿智能。
OpenAI 似乎正在抬高消费级智能的底线,同时把最强智能留在实验室内部。 Emad Mostaque 将 GPT-5 描述为一个在 Thinking、Mini 和 Nano 之间做选择的路由器;此前市场预期它会在 Mini 到 Pro 的多个模型之间路由,而不是对外提供一个昂贵的“超级 AI”。他的判断是,OpenAI 内部已经有更强模型,未来可能越来越多地向所有人提供“够用的模型”,同时把最强系统留在内部,以赢过所有竞争者。
真正持久的经济故事是智能超级通缩,而不是拿下某一个基准测试冠军。 API 价格从 GPT-4.5 宣布的每百万 tokens 输入75美元、输出150美元,降至 GPT-5 的输入1.25美元、输出10美元;GPT-5 Mini 和 Nano 则在 ARC 类测试中建立了新的成本—性能前沿。Alex Wissner-Gross 认为,决定性对比是买不起的超级智能,还是“便宜到无需计量”的智能;更便宜的推理还允许针对数学和科学答案进行10倍更多的搜索。
模型正在从令人惊艳的演示跨入可靠的经济工作,由此迫使企业作出 AI 原生运营决策。 Emad 强调,模型在法律、物流和销售等领域可以更长时间无人监督地运行,幻觉也在减少;结果可能是“生产力繁荣,也可能反过来”,包括裁员。Salim Ismail 的建议毫不含糊:“直接全押,开始把你的企业变成 AI 原生企业。” Dave 则警告,越来越不透明的基准测试,可能恰恰在最需要试验的时候让高管陷入瘫痪。
GPT-5 在前沿领域最具实质性的成果,可能是数学正在被缓慢自动化。 Alex 从 Frontier Math Tier 4 做线性外推,认为到2025年底 AI 可能解决15–20%的困难问题,到2026年底达到35–40%,到2027年底达到70%——他称之为“数学的慢动作解法”。Emad 补充说,延长强化学习已经产出了 IMO 金牌级系统,并预测真正的突破会来自同时“运行100万种不同尝试”后找到的优雅理论,而不只是暴力计算。
编程已经成为眼下的商业主战场,价格和分发能力正在威胁 Anthropic 最强的业务阵地。 发布会演示本身看起来落后于用户已经用 Claude 做到的事情数月,但 Dave 从投资者角度判断,GPT-5 仍然已经在“Anthropic 的主场”追平了对手。Emad 称 OpenAI 和 Anthropic 的 API 收入各约30亿美元,其中 Anthropic 约14亿美元来自 Cursor 和 Microsoft Copilot;GPT-5 的价格则比 Sonnet 低约40%。如果 Cursor 与 OpenAI 进一步靠拢,应用软件栈可能被重新划分。
医疗领域的约束,正从模型智能转向患者纵向数据。 Sam Altman 表示,GPT-5 在由250名医生共同构建的 HealthBench 上得分高于此前模型;Emad 称医生在测试中的得分约为20%,而新模型达到60–70%。Peter Diamandis 的反驳是,即便是“最好的 AI”,有多大用处仍取决于输入的扫描结果、生物标志物、可穿戴设备数据和病史。Dave 认为救命案例会为持续加速提供监管保护,Salim 则认为发布会医疗环节在模型深度融入日常护理前,仍更像渐进式公关。
低成本开放权重模型和主权算力扩大了机会,也加剧了基础设施与估值风险。 Emad 估算 OpenAI 新开放权重模型的训练成本约400万美元,称一个可在笔记本电脑上运行的版本只使用50亿活跃参数,并预测2年内训练出 GPT-5 级别模型的成本将低于100万美元;Alex 提醒,合成数据可能掩盖更大教师模型的固定成本。与此同时,OpenAI 正冲击约5000亿美元估值,并计划在挪威建设配备10万颗 GB300 芯片的数据中心,功率从230兆瓦扩展至520兆瓦;Google、Grok、各国政府和受限的电力供应,正在把这场竞赛变成一场真正的圈地运动。
精读
1. GPT-5 的预期同时超过了产品和发布呈现
Peter Diamandis 开场引用 Sam Altman 对 GPT-5 的谨慎表述,称其是“通往 AGI 路上的一个重大进步”,明确意味着它还不是 AGI。此前的 Death Star 帖子,以及 OpenAI 员工发布的不祥预告,共同塑造了市场对一次质变式突破的期待,但发布会最终没有兑现。
Emad 的初步评价刻意保持温和:“基本符合我的预期。”原因在于,要服务约7亿人,就必须在经济型模型之间进行路由,而不是部署一个性能拉满的单一系统。问题在于预期管理:所有人都默认 GPT-5 会赢,真正的问题是赢多少,而他的答案基本就是“还行”。
Dave 认为,OpenAI 选择“亲民化”“高中课堂式”的审美,而不是 Steve Jobs 级别的舞台表现,浪费了历史上最大规模的产品发布机会之一。他的不满具有战略层面:他希望看到足以让企业相信变革迫在眉睫、必须立刻行动的内容,但 OpenAI 却让“人类历史上最大的转折点之一”显得乏味。
Polymarket 给出了更严厉的实时评判。Dave 称,OpenAI 进入发布会时保住最强模型的概率接近80%;第一段编程演示后概率下滑,第二段之后进一步暴跌。尽管 GPT-5 的真实能力和价格并不差,市场仍转而押注 Google 将在8月底和年底成为领先者。
2. OpenAI 可能正在把大众智能与真正的前沿能力分开
Emad 认为,GPT-5 本质上是一个 o4 级系统,外面套着一层路由层;发布后,系统会将请求分发给 Thinking、Mini 或 Nano,而他原本预期的范围是 Mini 到 Pro。这种统一接口对消费者很重要,但也意味着 GPT-5 应被视为抬高智能底线的分发系统,而不是一套为最大化每项基准成绩而设计、没有约束的单一模型。
他提到通过 LM Arena 测试的2个秘密系统 Horizon 和 Zenith,称发布系统是其中较弱的一个,且 OpenAI 员工承认内部还有更强模型。他的逻辑是:GPT-4.5 已经证明昂贵的前沿模型对普通任务并不实用;而一家接近 AGI 的实验室,更有动力把最强智能留在内部,而不是交给竞争对手。
据称,路由器在发布后的约24小时内出现故障,Emad 认为这很不寻常,但也可能有助于收集反馈、改进路由。由此,圆桌形成了一个推测性理论:演示低调、上线不均,可能是有意为之——“别吓到世界”(Don’t scare the world);面向消费者的产品越来越实用,而最大的突破继续留在幕后。
3. 基准测试领先不如新的成本前沿重要
Alex 解释说,LM Arena 是一个众包比较平台,用户与隐藏身份的竞争模型交互。GPT-5 在文本对话中首次登顶,在网页开发上的 ELO 优势更大;在他看来,即使观众现在每3个月就要求一次“本体论级震撼”的能力,模型每3个月跨越一次竞争对手仍然“非同寻常”。
当被问及如何解释这一成绩与 Polymarket 押注 Google 之间的矛盾时,Alex 认为市场变化隐含了一个预测:Google 会在8月底前发布另一款前沿模型。Salim 则欢迎竞争接近本身:没有一骑绝尘的赢家,意味着竞争持续、价格下降,用户可以不断获得渐进式改善。
ARC-AGI 呈现出更复杂的图景。Emad 称,Grok 在一些困难推理分数上仍然领先,o3 则以高得多的成本取得强劲成绩;GPT-5 的高、中、低版本聚集在前沿附近,却没有压倒对手。他将其解读为更多实验室可能在超级天才级能力上“有所保留”的证据。
Alex 认为真正被埋没的标题位于散点图左下角:GPT-5 Mini 和 Nano 定义了新的“每美元智能”帕累托前沿。他的思想实验很直接——如果超级智能贵到文明用不起,世界几乎不会改变;如果智能“便宜到无需计量”,一切都会改变。
4. 可靠性正把 Agent 变成劳动力与管理基础设施
Emad 表示,模型正在法律、物流和销售等领域实现更长时间的无人监督运行,幻觉率也在下降。他说,不久前 ChatGPT Agent 还不够可靠,但预计很快会跨过这条门槛;一旦跨过,结果将是“生产力繁荣,也可能反过来”,而失业和裁员是哪一条分支,仍未确定。
Salim 认为,更低的成本和更“坚如磐石”的基础,比顶层分数有多惊艳更重要,因为稳定的 Agent 才能支撑真正的行业应用。他给运营者的建议没有任何保留:“直接全押,开始把你的企业变成 AI 原生企业。”
Dave 担心的是如何把进展转化为决策。过去,预训练规模能够让进步变得清晰可见;但现在后训练和思维链推理让基准测试更难转化为是否创办 AI 律所、是否开展材料发现、是否重做工作流等具体选择。他担心复杂性会让人们“在本该受到激励时陷入瘫痪”。
日历和 Gmail 助手的演示说明了发布呈现与真实能力之间的差距。Dave 称,找出一封未回复的邮件或安排一次跑步“还算酷”,但他的公司已经在用模型理解业绩、规划整个业务单元;更大的突破,是消除“白领苦差事”,同时帮助高管看清员工在做什么以及为什么做。
5. 前沿数学可能变成一座供文明调用的已解题库
Frontier Math Tier 4 是 Alex 认为 GPT-5 最令人兴奋的成果。题目都有已知答案,但可能需要专业数学家在数论、分析和代数几何等领域耗费数周;GPT-5 High 已经开始在短时间内解决这些题目,而不再像一项研究项目。
他的外推明确是一条“直线法则”,并非确定性预测:到2025年底解决15–20%的困难数学问题,到2026年底解决35–40%,到2027年底解决70%。终点是“数学的慢动作解法”(slow motion solution to math),指的是解决2025年夏天人类所理解的数学,而不是所有可能出现的未来领域。
Emad 称,GPT-5 High 在他看来似乎是目前最好的数学模型,并指出 OpenAI 通过加入验证器、延长 GPT-5 的强化学习,已经拿到 IMO 金牌。更深层的可能性不只是计算量更大:“数学解法不会很复杂,而会非常优雅。”这些理论可能来自同时探索100万个方向,再被人类、工程师和编程系统复用。
6. 编程追平让 GPT-5 直接进攻 Anthropic
OpenAI 的法语学习网页应用演示引发了最尖锐的批评,因为 Claude 用户数月前就已经生成过类似的闪卡、测验和游戏。Dave 的评价非常直接:观众要么不在乎,要么早就做到了;这个精心制作的演示没有展示真正的新能力,“完全没有击中要害”。
Emad 提出一个实际问题:生成的前端并不是可以直接上线的语言学习业务。生产环境仍需要后端系统、Stripe、数据和各种集成,因此 GPT-5 除了原型开发之外究竟减少了多少工作,并不清楚。Dave 补充说,相比 Replit、Lovable 和 Bolt,ChatGPT 的编程表现还没有完全达到要求,不过这类工具很快就会垂直化。
对投资者而言,意义与演示质量不同。Dave 称,重度编程者历来更偏爱 Anthropic,因此在保留 ChatGPT 广度的同时追平其编程能力,是“一件非常、非常重大的事”。Emad 补充说,GPT-5 价格约比 Sonnet 低40%,并将 OpenAI 的行动描述为进攻 Anthropic 约30亿美元 API 业务的尝试。
Cursor 联合创始人获得大量舞台时间,暗示了新的平台结盟。Dave 称,Microsoft 因知识产权问题击沉了 OpenAI 收购 Windsurf 的尝试,随后 OpenAI 转向 Cursor;他预计编程工具和模型提供商会进行垂直整合,但原生平台会暗中限制外部应用的说法,目前仍只是未经证实的推测。
7. 更强的医疗推理能力让患者数据成为稀缺资产
OpenAI 将医疗列为 ChatGPT 的主要使用场景之一,Sam 表示,GPT-5 在 HealthBench 上的得分高于此前模型;该评测由250名医生围绕真实任务共同建立。Peter 认为,癌症幸存者自主诊断的故事既有情绪感染力,也有助于防止监管机构要求放慢进度;Dave 则表示,能够挽救生命的案例使持续加速变得重要。
Salim 反驳称,这一环节“感觉更像公关”,因为多款模型此前已经能够提供类似帮助。GPT-5 可能只是有所改进,但他认为,真正的价值要等到助手持续融入个人医疗体系,而不是只在一次危机中短暂出现。
Peter 自己的案例具体说明了这种区别:他上传的数据包括全身 MRI、生物标志物和可穿戴设备信息,总量约200GB。他称自己将非钙化斑块减少了20%,把肝脏脂肪从6%降至1%,随后询问哪些补充剂与深度睡眠的跃升相关;他的原则是,模型“能发挥多大作用,只取决于你喂给它的数据”。
Emad 称,医生在一项健康基准测试中的得分约为20%,而新模型达到60–70%;他还表示,开源 AI-Medical 模型据称只落后于 GPT-5 和 o3,并可在 Raspberry Pi 上运行。Peter 称,模型已经能够提前5年检测乳腺癌以及其他疾病。Emad 希望系统持续监测数据、主动发现疾病,因为“你活得越久,活得越好”。
8. 智能价格下跌的速度,快于头部模型质量所显示的程度
在消费者侧,GPT-5 的高级能力免费提供,而 Gemini 的高级套餐价格据称为每月249美元,Grok Heavy 为300美元。ChatGPT 已拥有约7亿周活用户,Peter 估计6个月内可能达到10亿;在这种情况下,价格既是利润率决策,也是分发武器。
API 价格更清楚地体现了断层式变化:圆桌引用 GPT-4.5 的价格为每百万 tokens 输入75美元、输出150美元,而 GPT-5 为输入1.25美元、输出10美元。Peter 认为降幅至少达到一半,Dave 认为 GPT-5 的成本约为前一周的一半,Alex 则看到接近一个数量级的成本前沿变化,足以释放此前不经济的应用。
Alex 的科学案例解释了其中机制:当 tokens 价格降至十分之一,系统就能搜索10倍数量的句子或定理候选,把数量级上的节省转化为质量上的发现。他将降价归因于更快的 Blackwell 硬件、底层推理优化、蒸馏,以及算法和架构收益的叠加,最终推动成本以“每年一个数量级”的速度下降。
估值争论仍未有结论。圆桌讨论的数字是:OpenAI 估值约5000亿美元,年收入约100亿美元;Microsoft 的收入约3000亿美元。Sam 提到的目标是2年内达到1000亿–1500亿美元。Dave 认为结果只有两种极端可能:OpenAI 按这一路径发展,或者 Google “摧毁他们,让他们从地球上消失”。
9. 开放权重模型把数年的前沿进展压缩成笔记本电脑经济学
Emad 估算,OpenAI 新发布的开放权重模型训练成本约400万美元,计算依据是200万 H100 小时、每小时约2美元;他称,200亿参数版本的成本约低至原来的十分之一。该模型的能力超过一年前可获得的水平,而可在笔记本电脑上运行的版本据称只使用50亿活跃参数,在 MacBook 上的生成速度快过人类阅读速度。
Dave 追问,这个模型是否真的从头训练,还是从更大的模型蒸馏而来。Emad 回答称使用了80万亿 tokens,但 Alex 保留了会计口径上的疑问:如果这些 tokens 是由昂贵教师模型合成的,那么披露的训练费用只反映后续预训练的边际成本,而不是创造这套智能所需的全部固定成本。
蒸馏本身被视为放大器。Dave 称,合成数据可以让后续迭代成本下降90–99%;Alex 将这一过程比作教育:多年积累的研究被压缩成一堂经济高效的课程。他还强调,针对金融、医疗、政府和暴露于供应链风险的关键离线系统,美国训练的开放权重模型具有重要价值。
Emad 的预测非常激进:2年内,端到端训练 GPT-5 级别性能的成本可能低于100万美元,若拥有“1万亿个优质 tokens”,时间还可能更短。Peter 将其解读为把智能嵌入设备、机器人和车辆;圆桌的创业结论是,拥有一个可复用的开放模型后,创造力越来越只受“人的想象力”限制。
10. Grok 和 Google 确保 GPT-5 无法独占前沿
在 Humanity’s Last Exam 上,Alex 认为关键并不是某一个基础模型击败另一个,而是系统获得了工具和并行能力。GPT-5 借助搜索和外部工具,Grok 则使用多个协作 Agent;紧凑型基础模型、Agent 团队和环境工具的组合,可能带来下一次大幅基准跃升。
Emad 提到,OpenAI 的开放模型得分分别为19%和17%,其中17%的成绩来自一个可以在笔记本电脑上运行的200亿参数模型。Elon Musk 则以 Grok 4 的 ARC-AGI 成绩回应 GPT-5,并承诺月底前推出 Grok 4.2、年底前推出 Grok 5,称后者会“好到碾压一切”。
Alex 警告说,“谁定义基准测试,谁就赢。”研究领域仍然缺少有说服力的评测,因此各家实验室都会围绕测量它们的社群进行优化;他呼吁建立更多面向丰裕未来的测试,不要让每家公司都只展示自己已经领先的狭窄榜单。
Google 的速度最受尊重。圆桌列举了其近期成果:Gemini 3、Gemini 2.5 Pro Deep Think、IMO 金牌、Genie 3、AlphaEarth Foundations、Storybook,以及 Gemma 的2亿次下载。Dave 对比称,Google 约有6000名 AI 研发人员,OpenAI 则不到2000人;竞争压力终于释放了多年来并行推进的工作。
11. Google 的世界模型既威胁现有软件,也在训练机器
Genie 3 可以根据文本实时生成交互式环境,而不是回放预先构建的模拟场景。它的世界记忆会在用户移开视线后保留地点和动作;用户还可以通过提示词加入人物、交通工具或意外变化。Google 将同一能力定位于游戏、娱乐、物理探索、灾害演练和具身 Agent 训练。
Peter 说,他把演示展示给一位花了多年搭建元宇宙的朋友,对方的反应是:“我从没见过他的心智这样被击穿。”Emad 称其为掩码扩散 Transformer,并预测:“几年后,每一个像素都会由模型生成。”这延续了实时视频生成正在发生的崩塌式变化。
Alex 看到的既是破坏,也是文明级建设模块。如果环境只需一个提示词就能生成,已经投入数十亿美元的元宇宙和游戏软件可能变得毫无意义——“电子游戏行业上千种声音同时发出痛苦哀鸣”——但这些世界也可能成为“Star Trek 全息甲板”或 Matrix,通过模拟解锁通用机器人和自动驾驶汽车。
AlphaEarth 将地球表示成10×10米的网格向量,从2017年索引到2024年的地表状况,使原本需要数月的测绘工作可以在几分钟内完成。Alex 推测的下一步是一个解码模型,用于预测医院、停车场或其他干预发生后土地如何变化,把城市规划转化为树搜索。
12. 人才争夺战正在制造百万富翁和未来竞争者
Meta 推出的目标是“人人拥有个人超级智能”,与主要用于自动化高价值工作的系统有所不同。Peter 引述报道称,在 OpenAI 接触的约100名员工中,超过90%拒绝了 Meta 的报价,因为他们相信 OpenAI 更接近 AGI;Emad 认为,Zuckerberg 对超级智能的产品化定义,与 Altman 的定义存在根本差异。
Peter 还转述了 OpenAI 的方案:每名员工在2年内可获得150万美元奖金;他将其与“78%的 NVIDIA 员工都是百万富翁”的说法对比。Emad 预计,这些财富重新流入创业公司后会带来一轮“种子资金大爆发”;Dave 则强调,真正前所未有的是,价值创造在极其年轻的团队内部以异常快的速度发生。
Emad 预测,合法化的加密货币、由 AI 杠杆驱动的小团队和即时可得的资本,可能制造“史上最大的泡沫”,成为当前金融或社会体系的“最后狂欢”。Alex 给出了更阴暗的类比:各家实验室争夺稀缺科学家,就像一场私营部门的 Manhattan Project,“一场民用版本”的竞赛,企业争夺能够控制未来的技术。
13. 主权算力已经演变成芯片、电力与产业控制权之争
Stargate Norway 体现了这场实体竞赛:一座据称投资20亿美元的数据中心,配备10万颗 NVIDIA GB300 芯片,初始功率230兆瓦,可扩展至520兆瓦,并使用可再生能源。Emad 称,当大量劳动转为数字化后,一个国家的优势取决于“你有多少芯片,以及你拥有多少智能”。
Alex 把圈地运动变成了字面意义上的现实。挪威的水电资源天然稀缺,无法在需求出现的任何地方凭空制造,因此将其预留给 AI 工厂,就是在有限的欧洲资源上插旗。OpenAI 向每一名美国联邦雇员提供 ChatGPT、按每个机构每年1美元收费,则是在软件分发层面采取同样的策略。
Apple 宣布在美国投资1000亿美元,使其公布的美国投资总额达到6000亿美元;圆桌将其视为政府与产业协同进一步收紧。Alex 描述了最内层的技术闭环:半导体工厂、电力、无人机和稀土的交汇。围绕这一闭环集中人才与基础设施,可能引发经济爆炸。
暴露出的瓶颈是芯片制造。圆桌引用 TSMC 约66%的市场份额,并认为让 Intel 把晶圆厂卖给 TSMC 会造成危险的集中,即使这能让剩下的 Intel 立刻实现盈利。AI 数据中心资本开支目前约占美国 GDP 的1.2–2%,而铁路建设在历史高峰期占到6%;他们的结论是,建设周期仍处早期,但 Intel 必须改善 18A(1.8纳米)的良率,并获得扩大产能所需的支持。