Artificial Analysis
观点集合
Artificial Analysis:独立 LLM 分析机构——与 George Cameron 和 Micah Hill-Smith 对谈
- 🗓️ 日期:
2026-01-08| 🎙️ 节目:Latent Space
Artificial Analysis通过企业报告、私有评测和公开数据,将独立基准测试商业化;可靠性依赖重复运行、端点控制与持续演进的测试。智能体框架、拒答指标和token效率把评测扩展 beyond答对率,而更便宜的智能也同时推动更高推理消费与基础设施支出。
查看访谈对话精读提要
Artificial Analysis 已将独立性本身做成了产品:没有人为公开排名付费,企业购买决策报告,AI 开发者购买私有基准测试。 公司目前有20多人,服务两类客户,将免费公开数据与订阅及定制项目结合起来。swyx 将其概括为“AI 领域新的默认 Gartner”,但商业隔离墙才是核心命题:“如果不是独立的 AI 基准测试,我们做这些就没有意义。”
可靠的评测成本远高于跑一组问题,因为提示词、输出解析、答案顺序、采样方差、端点操纵和重复运行都可能改变排名。 Artificial Analysis 的目标是让其 Intelligence Index 在95%置信度下控制在约±1分,因此真实成本高于公开展示的单次重复成本。私有实验室端点通过“神秘顾客政策”进行核验,使用无法识别身份的账户,因为实际提供的模型可能不同于送测端点所标示的模型。
Intelligence Index 必须持续变化,因为昨天的前沿测试如今已接近饱和,而成功的基准测试会迅速变成优化目标。 V1 的 HumanEval 式 Python 函数题对许多当前模型来说已接近常识;V3 则融合10个数据集,覆盖问答、智能体、长上下文推理和实际用例。核心警告是:“被测量的东西会变成被针对的东西”,因此竞赛数学分数上升不一定代表更广义的智能提升。
前沿格局已从 OpenAI 看似无法撼动的领先,转向 Micah-Hill Smith 所说的“每个季度都严格变得更具竞争性”的市场。 录制时,Gemini 3 Pro High 位居第一,其后是 Claude Opus 4.5、GPT-5.1 High 和 Kimi K2 Thinking。DeepSeek 的决定性信号来自前一年节礼日发布的开放权重 DeepSeek V3——一个被描述为61.1B MoE 的模型;之后 R1 才让更广泛的世界开始关注。
Artificial Analysis 正通过明确惩罚幻觉、奖励模型回答“我不知道”,将“智能”从答对率扩展出去。 其 Omniscience 指标范围为-100至+100,事实性错误答案每次扣1分;Claude 模型的幻觉率最低,而通用智能与模型是否知道何时应拒答几乎没有相关性。取舍取决于场景:在 Critical Point 的研究级物理题中,最高分只有9%,研究人员会刻意提高温度,因为探索性幻觉可能有用。
智能体表现很大程度上取决于执行框架,而不仅是底层模型,由此在模型 API 之上形成了新的竞争层。 GDPval-AA 将44项涉及电子表格、PDF、演示文稿、音频和视频的白领任务转化为与模型无关的基准测试;每个受测模型在 Artificial Analysis 的框架中都优于其对应的消费级聊天机器人。这个极简框架包含网页工具、文件系统、代码执行、上下文管理和图像查看,后来以 Stirrup 名义发布,并给出建议:“让模型想工作多久就工作多久。”
基础设施的悖论是,GPT-4 级别的智能至少便宜了100×,但推理总支出仍可能增长几个数量级。 更大的稀疏前沿模型、推理 token、超长智能体工作流和反复交互,会压过单位成本下降的影响;据称有一家初创公司仅在 coding agents 上就为每位员工花费5000美元。George Cameron 预计两种趋势都会延续:可比智能的成本再下降一个数量级,可行消费量再扩大一个数量级。
下一场效率竞争不在于“推理模型还是非推理模型”,而在于模型是否针对每个问题花费了恰当的 token 和交互轮次。 年初,推理模型每次 Intelligence Index 查询平均使用的 token 数是非推理模型的10×;如今,不同模型之间的 token 效率本身就相差超过一个数量级。在 τ²-bench Telecom 中,GPT-5 的 token 单价更高,却可能比更小的开放模型整体更便宜,因为它用更少的轮次解决了客户问题。
🔗 原始收听与视频来源: Artificial Analysis:独立 LLM 分析机构——与 George Cameron 和 Micah Hill-Smith 对谈