GPT 4.1:OpenAI 的新主力模型
摘要
GPT-4.1 是一套面向开发者的3模型阵容——GPT-4.1、GPT-4.1 Mini,以及延迟更低、价格更便宜的 GPT-4.1 Nano,核心能力覆盖编程、指令遵循和100万 token 上下文窗口。 它比 GPT-4.5 更小、更便宜,因此并非每项智能评测都胜过4.5,但 Michelle Pokrass 预计开发者会用它替代大量 GPT-4.5 用量。「Mini 严格优于 GPT-4o Mini」。
模型训练的重点正在从不断堆高预训练规模,转向在训练完成后进一步释放能力。 Josh McGrath 表示,过去的叙事聚焦于越来越大的预训练模型,而团队如今发现,「相当一部分提升其实来自新的后训练技术」。Nano 有一次新的预训练,Mini 也有一次新的预训练,更大的模型则进行了新的中期训练。
100万 token 的价值不只是能装下更多内容,更在于检验模型对高密度、有序、多跳关系的推理能力。 基础的“大海捞针”检索很快就触及天花板;真正困难的是穿越上下文中被打乱的关系,这一点通过图遍历评测体现出来,也可以类比为加载整部税法,只为确定报税表上的一个栏位。对于较小规模的任务,这可能降低对检索基础设施的依赖,或让 RAG 系统直接塞入更多文本块。
更好的智能体行为来自对开发者真实失败案例的量化,而不只是训练模型遵守合成约束。 开源评测常要求模型正好输出4个词或3个段落,因为这些要求容易自动评分;经过用户授权的 API 数据则暴露出更多样、更复杂的否定指令和有序指令。在“额外修改”评测中,GPT-4o 有9%的概率修改无关代码,GPT-4.1 只有2%——这实质性缓解了智能体「跑出去做得有点过头」的问题。
GPT-4.1 的编程优势在于探索并修改代码仓库的任务,而推理模型在更长链路的规划上仍有优势。 相关 SWE-bench 结果为 GPT-4.1 的55分对比 o1 的41分,但团队拒绝将其解读为全面的编程优势:如果只给模型一个文件、要求它推理修改方案,推理模型可能表现更好。实际使用原则是:「完成任务所需的最快模型」。
这一模型家族建立了更清晰的延迟—成本梯度,但没有消除产品之间的能力缺口。 Mini 可以用于自动补全或即时 text-to-SQL,Nano 面向极低延迟场景;GPT-4.1 处理更复杂的执行任务,规划环节则可以再接入推理模型。GPT-4.1 目前聚焦 API,暂无 Realtime API 版本或图像生成端点的计划;ChatGPT 的增强记忆也与 API 模型分开。
经济性改善更多来自缓存和定制化,而不是全面降价。 prompt caching 折扣从50%提升至75%。发布讨论提到,GPT-4.1 和 GPT-4.1 Mini 上线即支持微调,Nano 未来也可能支持。Michelle 认为开发者「低估了 preference fine-tuning」,因为它可以调整风格;reinforcement fine-tuning 仅适用于推理模型,而 preference fine-tuning 提供成对样本。
精读
1. GPT-4.1 是开发者范式重置,不是 GPT-4.5 之上的更高一档
Michelle 将这次发布概括为3项刻意面向实用的能力:更强的指令遵循、更好的编程,以及 OpenAI 首批支持100万 token 上下文的模型。对于延迟和价格优先的应用,Nano 与完整版和 Mini 一同加入阵容;通过 OpenRouter 进行测试,也获得了有价值的真实开发者反馈。
主持人质疑命名:既然有 GPT-4.5,为什么反而回到 GPT-4.1?答案包含一个重要限定。GPT-4.1 相比 GPT-4o 系列有大幅提升,但体量和价格都远低于 GPT-4.5,也没有在包括 AIME 在内的所有智能基准和其他评测中超过4.5。因此继续递增到4.6之类的命名,反而会传递错误的层级关系。
在底层训练上,Nano 是一次新的预训练,Mini 也有一次新的预训练,完整的 GPT-4.1 则进行了新的中期训练。但团队强调,大部分提升发生在此后:他们将 GPT-4.5 所体现的指令遵循优势迁移到 GPT-4.1,并发现后训练阶段「还能挤出很多能力」。
这一家族并不是完整的 omni 模型替代方案。目前没有将 GPT-4.1 接入 Realtime API 的计划,也没有 GPT-4.1 图像生成端点;ChatGPT 的增强记忆与 API 模型相互独立。Michelle 对 GPT-4.1 的更窄表述是,重点就在3项核心开发者能力上。
2. 只有当每个 token 都参与进来,长上下文才真正变难
Josh McGrath 表示,普通的“大海捞针”检索出乎意料地容易:大多数模型「开箱即用」就能表现良好,团队很快就让单针测试触及饱和。真正困难的部分,是答案需要跨越多个上下文元素进行推理,而不是定位一个稀疏事实。
他提出了一个更有用的二维框架:密度和有序性。摘要可能需要处理整个上下文,检索却只触及其中稀疏的一部分;有些推断是从前往后进行,另一些则要求模型在上下文中反复移动,逐步采样答案。
团队的图遍历评测将边列表编码后,要求模型执行广度优先或深度优先遍历等操作。早期模型有时会陷入循环,对着一个本科生几分钟就能写脚本完成的任务说:「糟了,我找不到我认为应该存在的这条边。」这项合成测试被有意设计为自然多跳推理的「下限」。
Michelle 将这一抽象对应到数百份关系隐含的文件,或上传一整部税法:要填完一个栏位,必须沿着引用关系穿过许多其他条款。她表示,对于规模较小的任务,开发者可能不需要完整的向量数据库,可以直接把更多文本块放进上下文;增强记忆仍是 ChatGPT 的独立功能。
3. 真实提示暴露了整洁公共评测遗漏的失败
Michelle 对公共指令遵循测试的批评,针对的是方法论:要求「正好4个词」或「3个段落」之所以常见,是因为代码容易验证,而不是因为它们代表开发者最棘手的需求。经过用户授权的 API 数据提供了更多样的案例,尤其是否定指令和有序指令;在识别信息被清除、模型对匿名化提示进行分类后,团队得以使用这些数据。
对于提示词圈的经验之谈,她以「真相总是混乱的」回应,保留了两面性。GPT-4.1 通常能够遵循「只说一次且表达清晰」的指令,因此不需要全大写、承诺小费或行贿;这些做法也不应造成伤害,而且运行生产任务的开发者可能会发现模型团队尚未发现的特定任务技巧。
她建议用 XML 组织模型输入,但并不意味着要用 XML 全面替代 JSON。如果输出必须直接接入应用,JSON 仍可能更合适。同样,「response rules」或「instructions」这样的标题只是示例,并非具有特殊效果的魔法 token。
测试发现,在长上下文的开头和结尾同时重复用户查询或指令,效果优于只放在任一端。主持人指出,重复内容可能与 prompt caching 的设计冲突;Michelle 回应称,只要取决于哪些大数据块会随用户变化,把指令放在开头仍可能保留缓存效果。她承认:「等我们弄清楚了,就会这么做。」
4. 好用的编程智能体需要持续推进,也不能误伤无关文件
推荐给 GPT-4.1 的持久性提示,是让它持续执行直到任务完成,而不是反复询问是否应该继续。Michelle 纠正了主持人的理解:这句话本身并没有带来约20%的 SWE-bench 提升,真正的原因是表现最好的 harness 与模型后训练改进共同作用。
持续推进也会带来新的失败模式:智能体可能改写请求范围之外的文件。因此 OpenAI 构建了“额外修改”评测:GPT-4o 有9%的概率进行无关修改,GPT-4.1 为2%。这一提升来自团队反复执行的闭环:听到具体抱怨,建立评测,再在训练过程中持续跟踪。
编程表现被拆解为更好的 diff、正确探索代码仓库、编译代码和创建测试。GPT-4.1 在 SWE-bench 上约为55分,o1 为41分,但团队拒绝把所有编程能力压缩成一个排行榜:GPT-4.1 特别针对代码仓库导航进行了训练,而推理模型在自包含的单文件修改上可能胜过它。一则内部轶事是,一名研究员称 GPT-4.1 在一个大型 pull request 中完成了50次提交中的49次。
Michelle 的部署梯度是先用 GPT-4.1;如果 Mini 或 Nano 能在更低延迟下保持质量,就下调模型;如果缺乏更长链路的一致性,再上调到推理模型。用推理模型做规划、用针对性模型执行很有前景,但「我们其实都还在摸索这些模型协同使用的最佳方式」。
5. 视觉能力提升揭示了新预训练的价值与风险
Michelle 强调了 GPT-4.1 Mini 的多模态提升,以及它不同的预训练基础。与编程、上下文和指令遵循能力主要归功于后训练不同,她表示,观察到的多模态提升几乎全部来自预训练。她还称 GPT-4.1 在面向屏幕的任务和具身图像任务上都有改善,但开发者应如何在两者之间选择,仍应由预训练团队说明。
更强的感知能力甚至使一些内部评测失效:Mini 和 Nano 能读出图像背景中的标牌,而此前的模型读不到,从而改变了预期答案。本期一个有用的警示是,更强的模型可能通过利用评测设计者原以为不可访问的信息,制造「不同的评测问题」。
主持人提到 GPT-4.1 和 Mini 上线即支持微调,并追问 Nano 是否也会如此。Michelle 区分了常规的监督微调和 preference fine-tuning,后者可以调整风格,但她认为开发者对其使用不足;reinforcement fine-tuning 仅适用于推理模型,而 preference fine-tuning 提供成对样本。主持人表示,他原以为 reinforcement fine-tuning 仍处于 alpha 阶段;Michelle 称这段交流澄清了双方的混淆。创意写作能力的改进将并入未来的通用模型,而不会单独发布。
6. 缓存、弃用和共享评测构成经济飞轮
这套模型并非全线统一降价:Michelle 纠正主持人称,GPT-4.1 Mini 并不比 GPT-4o 便宜,但比完整版 GPT-4.1 便宜。更大的杠杆来自 prompt caching:这些模型的缓存折扣从50%提升至75%。
「Blended pricing」的目标是让比较更容易,例如将 GPT-4.1 表述为大约比 GPT-4 便宜25%,而不是规定一个普遍适用的缓存与非缓存比例。团队没有可提供的缓存率中位数,开发者仍需根据自己的工作负载测算组合。
弃用 GPT-4.5 最终可以释放算力,但过渡期间 OpenAI 会让模型并行运行,因为 API 移除需要「充分提前通知」。Michelle 希望建立的反馈闭环非常具体:选择共享 API 数据,或上传一项评测;如果 OpenAI 能复用该评测,就会承担其推理成本。主持人称,数据共享方案截至4月30日,评测项目则没有公布结束日期。