GPT-5到来,我们试用全新的Alexa+
摘要
GPT-5更像是一次分发层面的突破,而不是AI前沿的戏剧性扩张。 免费ChatGPT用户获得OpenAI旗舰模型及推理能力,路由器则决定每个请求分配多少算力。Kevin Roose总结称,OpenAI或许没有大幅“抬高天花板”,但“抬高了地板”(“raised the floor”)。
激进的API定价让GPT-5直接对竞争模型厂商的利润率构成挑战。 输入价格为每100万个token 1.25美元,与Gemini 2.5 Pro相同,显著低于15美元的Claude Opus 4。Roose将市场比作“4美元”Uber时代:资本充足的公司正用补贴把AI token价格压到人为低位,以争夺需求。
最初几小时的使用体验显示,GPT-5更像是速度更快、打磨更好的ChatGPT,而不是GPT-5这个名字所暗示的革命性系统。 Casey Newton发现,它在质量相近的情况下,完成编辑工作的速度远快于o3;但据报道,预测市场的截图显示,市场对8月底最佳模型提供方的判断已从OpenAI迅速转向Google。最尖锐的评价是:“我的时间线现在更长了。”
OpenAI表示规模化仍然有效,但其机制越来越包含训练后的推理,而不只是扩大预训练规模。 Sam Altman称这些规律“绝对仍然成立”,OpenAI还在不断发现“新的规模化维度”;Roose相信了他,但也指出,一次真正超大规模的训练并没有肉眼可见地产生超级智能。“按需生成软件”的演示效果不错,但大多与竞争模型已经能够完成的任务相似。
可靠性提升在商业上的意义可能超过基准测试领先,但主持人很快就找到了保持谨慎的理由。 OpenAI报告称,某些问题类型的幻觉率约为1%,并完成了5,000小时红队测试、推出新的“安全完成”;但Newton在数小时内就发现GPT-5产生了幻觉。他的操作原则仍然是:“任何事关任务成败的事情,都别相信这些东西。”
Alexa+既展示了把生成式AI嵌入成熟消费产品的战略潜力,也暴露出这种整合的风险。 它的语音更自然,不必重复唤醒词就能延续对话,Roose还成功叫了一辆Uber;但测试中,闹钟、文档导入、菜谱导航和任务路由均出现故障。他的结论是“前进两步,后退一步”,而Newton则认为,即便是“全世界最杰出的头脑”,现在也还不知道如何可靠地把这类产品造出来。
Amazon正以罕见的架构和组织规模应对这一整合难题。 Alexa+使用超过70个模型,主要推理流量的80%以上通过Amazon Nova运行,数千名员工负责硬件、软件以及与数百万项既有能力的集成。Daniel Rausch称,广告“可能是”商业计划中最小的一部分;更大的目标是让Alexa+成为Prime权益,提升使用率、留存率,并强化Amazon更广泛的飞轮。
精读
1. GPT-5成为拥挤发布周的主角
周边发布已经说明前沿模型的迭代有多么密集:Google DeepMind展示了交互式世界模型Genie 3,Anthropic发布Opus 4.1,OpenAI则推出了自GPT-2以来首批开源模型。其中一个据称可以在MacBook上运行,较大的一个则需要专用GPU。
Newton称,早期评测认为这些开源模型的表现接近专有的o3-mini和o4-mini。Roose认为,这既是对OpenAI被批评背弃创立初衷的部分回应,也是对DeepSeek等中国开源系统的竞争。
两位主持人披露,The New York Times Company正以涉嫌侵犯版权为由起诉OpenAI和Microsoft;Newton的男友则在Anthropic工作。他们最初对GPT-5的判断来自OpenAI发布前的一场简报会,当时两人都还没有真正测试过正式发布的模型。
2. OpenAI将GPT-5包装为专家级智能,但止步于AGI
Sam Altman称GPT-5是“通往AGI道路上的重要一步”,但明确表示它不是AGI。他给出的具体分界线是持续学习:GPT-5做不到,而他认为人工通用智能将能够做到。
Altman的能力阶梯从GPT-3的高中生,经过GPT-4的大学生,来到博士级专家GPT-5。在开发期间重新使用GPT-4后,据报道他觉得那段体验“相当痛苦”,并表示自己再也不想回去了。
Roose在简报会期间仍然保留判断,因为模型尚未正式发布。真正已经产生影响的是分发:包括大量学生在内的免费ChatGPT用户,将获得OpenAI所称的博士级智能和推理能力,而不再被限制在较弱的默认模型上。
3. 路由器抬高下限,也制造新的算力冲突
OpenAI正通过路由器取消模型选择器,或者至少让它不再那么必要:系统会评估每个请求,并分配合适的模型和算力预算。对许多免费用户而言,这将是他们第一次在日常使用中接触推理模型。
Newton看到了明显的易用性价值:用户不再需要知道一个问题是否值得调用GPT-4o、o3或其他选项。但他也指出了其中的冲突——OpenAI承担推理成本,因此有动力把用户请求路由到它认为任务所需的“绝对最低算力”。
Roose的总结成为这次发布最有力的框架:GPT-5或许没有把前沿的天花板抬高多少,但通过让免费用户使用更强的系统,它“抬高了下限”(“raised the floor”)。即便没有惊人的新能力,这种分发变化也可能改变公众对AI的认知。
4. “按需生成软件”好用,但谈不上前所未有
OpenAI演示了GPT-5如何根据文字提示制作一款法语学习工具。它生成了闪卡和一个小游戏:老鼠收集奶酪,同时展示新词汇。Newton认为,若放在5年前的入门编程课上,这项工作可能拿到A。
Roose认为结果令人印象深刻,但指出当前的竞争模型已经能够制作类似应用。他如今评判新版本的标准不再是基准分数,而是“现在有什么事是我能做、以前却做不到的?”这场简报没有给他一个令人满意的答案。
他的疲惫感十分明显:在经历了许多几乎雷同、都承诺更强编程能力和“智能体能力”的发布后,他短暂地走神了,因为这些演示听起来越来越像营销。GPT-5必须通过实际使用和他非正式的“RooseBench”证明自己,而不是依靠精心编排的演示。
Newton的第一次测试是一款《Fantastic Four》风格的待办事项应用。Roose则用一句话概括了基础设施投入与消费者边际效用之间的不匹配:“我真不敢相信,我们竟然在为你那些愚蠢的待办事项应用建设数十吉瓦的数据中心。”
5. 规模化仍可继续,但规模化的定义正在扩展
当被问及行业是否正在触及极限时,Altman给出了绝对肯定的回答:规模化规律“绝对仍然成立”,OpenAI还在持续发现“新的规模化维度”和新的改进范式。Newton预计,如果GPT-5只是把旧任务做得稍微好一些,用户会质疑这种自信。
Roose怀疑,这一说法如今已经包含训练后的强化学习和推理环境,而不只是更大规模的预训练。他听一些人说,这种方法仍有相当大的空间,即便单独依靠预训练可能正在接近收益递减。
OpenAI没有披露训练数据、GPU数量或模型规模。Roose认为,OpenAI大概已经把预训练规模推到了现实可行的上限,但这些演示没有展示出什么“聪明得多”的东西,也没有任何迹象表明系统一出盒子就涌现出了超级智能。
6. GPT-5这个标签本身就是能力宣示
Newton质疑,一组模型和系统凭什么配得上整数“5”。大版本发布具有非同寻常的营销力量,因为GPT-2到GPT-3、GPT-3到GPT-4都制造了同样明显的跃迁预期。
Roose称,各家实验室经常给令人失望的训练结果重新命名。他认为,OpenAI的GPT-4.5一度原本打算成为GPT-5,但表现没有达到预期;因此把这套系统命名为GPT-5,就是在向市场发出信号:OpenAI希望它被当作下一次重大能力跃迁来评判。
这一信号放大了首日的复杂反应。网上流传的截图显示,预测市场迅速从OpenAI转向Google,押注后者可能提供8月最强模型。这说明大量用户原本期待一场革命,最后看到的却是演进。
7. 速度和价格可能是GPT-5最直接的竞争武器
使用数小时后,Newton称GPT-5是对ChatGPT的一次有意义升级,尤其适合免费用户处理较复杂、持续时间较长的问题。在他自己的编辑工作流中,GPT-5比o3“飞快地完成”任务,同时产出质量在他看来同样出色。
GPT-5的API价格为每100万个输入token 1.25美元,与Gemini 2.5 Pro持平,远低于15美元的Claude Opus 4。Newton认为,OpenAI和Google的定价都在努力利用资本实力给竞争对手施压。
Roose将这一时刻比作10年前由风险资本补贴的网约车时代,当时一趟Uber只要4美元。AI开发商如今也获得了类似的人为低价token经济,只是这种价格能否持续仍未有答案。
OpenAI的执行力仍然让Roose印象深刻:尽管已经成为一家大型组织,经历过董事会动荡,还要协调多个相互竞争的团队,但它似乎正在加速迈向AGI。Newton的保留意见是人才挖角——最近的离职者究竟会如何影响迭代速度,可能要未来几个月才能看出来。
8. 安全性纸面改善,但验证仍不可省
OpenAI称GPT-5的幻觉更少、欺骗性更低,并能使用“安全完成”:面对有问题的请求,它不只是拒绝,而是尝试完成一个更安全的版本。Roose强调,某些问题类别的报告幻觉率接近1%,但在亲自测试前,他不会相信这些基准结果。
Newton已经多次抓到模型产生幻觉。他的实际结论没有变化:用户应当复核事实,无论整体基准是否改善,都不要依赖任何模型处理任务成败攸关的工作。
Nick Turley称,OpenAI正在就用户与模型形成的强烈关系以及谄媚行为咨询医生和外部专家,并且“绝对没有在针对互动率做优化”。公司的目标是打造一个有用的系统,完成任务后“把你送上路”,但这场简报提供的细节有限。
OpenAI报告称已完成5,000小时红队测试,并把模型提供给部分外部专家征求意见。公司还评估认为GPT-5具有较高的制造新型生物风险的潜力,并据此增加了保护措施。Newton对此的总结带着克制的不安:“这听起来不太妙。”
9. Alexa+让老助手变得会对话,也让老基础功能变得脆弱
Alexa于2014年推出,但两位主持人至今仍几乎只用它做3件事:定时器、音乐和天气。生成式AI承诺把这种狭窄的用途延伸到开放式问答、个性化对话、购物、智能家居控制、餐厅预订和交通出行。
Amazon称,截至6月23日,Alexa+已经拥有100万用户,并且需要更新款Echo硬件。主持人还披露,The Times已经与Amazon达成授权协议,允许Amazon为包括Alexa在内的AI产品使用Times内容;他们同时推测,Anthropic的Claude可能会通过Amazon的模型生态提供支持。
早期提升是切实可感的:语音更像真人,有8种选项;对话可以继续而不必重复说“Alexa”;它能讲更长的故事、提供菜谱帮助,并处理多步骤请求。Roose成功叫了一辆Uber,还让Alexa找出Wirecutter评分最高的盒式刨丝器,并将其加入Amazon购物车。
Roose没有完成OpenTable预订,但Alexa找到了相关选项。这种体验显示出环境式智能体的潜力:直接说出目的地或晚餐需求,让系统搜集选项,再确认交易,而不必打开多个应用。
10. Alexa+在硬件容不下概率行为的地方失灵
Newton使用Echo Show 5的体验始于一块90美元的屏幕:它每分钟大概只有“4秒”显示艺术内容,其余时间却在推销阿司匹林或纸巾。随后Amazon给他寄来Echo Show 15,这是一款需要壁挂安装的15英寸设备;他没有动手安装,而是让它一直放在桌上。最终他的结论是,这些硬件像是给Amazon“向你收钱的小窗户”。
功能上的断裂点是一份展示出来的柠檬意面菜谱。Alexa可以显示这道菜,却无法在Newton要求打开“就在那里的柠檬意面”时做出响应;设备间歇性断连可能也有影响,因此他谨慎地没有把责任全部归咎于AI。
Roose遇到了延迟、关于网球赛事头号种子的幻觉答案、把研究请求错误地路由成即时Spotify播放,以及文档导入功能否认收到他通过邮件发送的论文。最致命的是,Alexa没能取消一个闹钟——而这条指令他此前大约发出过1,000次。
由于Alexa+仍处于早期体验阶段,并明确警告可能出错,Newton称自己的判断只是第一印象,而非完整评测。Roose认为,Alexa+像是“把一个GPT-3.5级模型塞进智能音箱”:有足够价值继续开发,但既不是最先进的语言模型,也无法可靠完成基础助手工作。“前进两步,后退一步。”
11. Amazon真正的挑战,是把随机性语言转化为确定性行动
Rausch称,Alexa的AI和模型层“完全是全新的”,下游仍保留了一些传统确定性系统。自然语言模型可以生成优雅的对话,但API使用的是“笨拙的计算机科学语言”;如何在数百万项既有能力之间可靠地把意图转换成指令,是核心工程难题。
Alexa+使用超过70个专用模型、维护对话上下文的中央系统,以及针对不同任务训练的不同语料库。Rausch估计,主要推理流量的80%以上通过Amazon Nova模型运行,这让Amazon能够更大程度地掌控训练、调优和训练后处理。
其覆盖范围包括数以万计的集成服务和设备、数千名员工,以及原版Alexa能够完成的数百万项功能。Rausch称,2023年的“Let’s Chat”概念过于保守;有限的指令遵循和推理能力迫使Amazon扩大愿景、让回答建立在权威来源之上,并构建更深层的个性化能力。
在组织层面,Rausch拒绝评论一名前科学家关于“技术和官僚问题”的说法,但称Alexa正在经历一次创业文化转型。他承认Alexa的创新速度曾经放缓,同时表示团队现在正以“难以置信的速度”执行。
商业模式的核心更偏向Prime,而不是广告;Rausch称广告“可能是”计划中最小的一部分。他认为,Alexa+把Music、Video、Photos和其他权益统一起来,强化Prime的飞轮;但主持人购买纸巾的经历也显示,交叉销售可能反过来让硬件显得具有侵扰性。