趋势 方法 投研 作者
返回方法

AI 产品经理最值钱的活,是给模型出考卷

2025/08/25

深度思想,谈 AI 与向往 —— 字节深思圈

2023 年,Anthropic 收到的用户抱怨里,有一条出现频率很高:Claude 不太遵循指令。

这句话没法直接干活。拿给研究员,对方不知道从哪儿改;拿给工程师,也定位不了问题。Anthropic 负责这块产品的人把这条模糊的抱怨拆开:用户具体问了什么,Claude 具体回了什么,一段一段读原始对话。读到最后一数,大约八成的“不遵循指令”,其实指向同一件事:模型没法稳定输出格式正确的 JSON。

接下来的动作才是关键。团队找了几十个 Claude 输出错误的真实例子,整理成一组输入和标准答案的对照,每次新版本发布前都跑一遍,跑到接近全对为止。一个说不清的抱怨,就这样变成了一套可以反复重跑的考卷。

这套东西叫 eval,评测集。Anthropic 内部流传一句说法,evals are the new PRDs,评测集是新时代的需求文档。我的判断更直接一点:做 AI 产品的人,最值钱的活正在从写文档变成出考卷。

模糊的反馈,等于没有反馈

传统产品经理证明自己有产品策略,靠写一份漂亮的需求文档,或者一个原型加上用户访谈。这套打法的前提是产品行为可预期:功能写清楚了,做出来就是那个样子。

架在模型上的产品没有这个前提。你改了一版提示词,感觉好像好了些;换了一版模型,感觉又差了回去。感觉在噪声里失效。同一个用户抱怨,今天复现不出来,明天又冒出来。这时候光靠判断力强的老手拍脑袋,团队会陷入一种很典型的循环:每个人都说感觉最近变好了,没有人拿得出证据。

出考卷解决的就是这个问题。它把“变好了”从形容词变成通过率。改进还是原地打转,跑一遍就知道。

但把模糊反馈变成考卷,中间还有一道脏活:读原始对话。这件事没有捷径,Anthropic 那边有个说法,抠 token 要跟抠像素一样用心。一次失败,可能是模型调错了工具,可能是检索环节找错了知识,也可能是对齐出了问题。这三种失败对应三种修法,要路由给三个不同的团队。归类归错了,修复的力气就全花在错的地方,通过率涨了,用户照样在骂。

考卷有效,但会过期

把反馈变成 eval,本质上就是软件行业玩了几十年的测试驱动开发:先写测试,再谈实现。这个类比成立,但别把它推到底。

考卷有一个天然弱点:会泄题。一旦团队开始围着考卷优化,通过率的上涨和产品的变好就会慢慢脱钩。模型可以在那几十道题上表现近乎完美,考卷之外照样翻车。所以成熟的评测集要定期换题、加题,把真实世界里新冒出来的失败补进去。考卷是活的资产,写完就放在那里,价值衰减得比想象中快。

还有一条边界要认。eval 只对可枚举的失败有效。格式错了、工具调错了、答案错了,这些能对出标准答案。但产品动不动人、交互顺不顺、审美对不对味,这类问题出不了题。硬要出题,团队就会把没法量化的东西从优先级里挤出去,最后做出一个每道题都对、但没人喜欢的产品。出题的手艺之一,是知道哪里不该出题。

考卷和文档,分工不是替代

有意思的是,Anthropic 并没有把需求文档扔掉。每一代模型,团队照样写,只是读者变了:主要写给不断扩张的产品和工程团队,还有法务、安全这些相关方看,用来让一大群背景不同的人对齐同一套目标。另有一种场景文档反而更值钱:方向还很模糊、手上没有明确用户痛点的时候。比如让模型操作电脑屏幕这个能力上线前,团队并不知道具体谁会为什么付钱,这时候愿景部分的推演能帮团队先框定一个小范围,跑出站得住的价值。

什么时候用哪个,看问题处在哪个阶段:

场景该用的工具原因
问题清楚,要反复测量改进eval可重跑,改进和打转一眼分清
方向模糊,还没有明确痛点愿景文档先框小范围,验证价值
几十个背景不同的人要对齐需求文档文档的强项是统一事实基础

选工具看习惯,是多数团队掉坑的方式。选工具看问题阶段,才是这套分工的本意。

从零起步,三步出第一套题

门槛比想象中低,不需要基础设施,不需要训练背景。

第一步,把最近的用户差评捞出来,逐条读原始对话,给失败原因归类:工具调用、检索、格式、理解、对齐,各占多少。第二步,挑占比最高的那一类,收集二三十个真实案例,写成输入加期望输出的对照,这就是第一版考卷。第三步,定一个重跑节奏,每次换模型、改提示词、调工作流之后都跑一遍,记录通过率的变化曲线。

这套能力还改变了人的成长路径。以前资历越深越远离执行,越往上越只负责拍板。在模型一年翻几代的节奏里,这样做会出事:你脑子里那套关于好坏的直觉,会停在上一代模型的水平。所以那边的做法是,哪怕是带团队多年的人,入职培养计划也和应届生一样,从读真实用户反馈开始,管理者自己认领工作线,自己动手交付。

只要你的产品是模型加上工程壳加上具体场景拼出来的,出题这件事迟早绕不开。原因很朴素:你没法改进一件你没法衡量的事。感觉会骗人,考卷不会,但考卷自己也会过期。出题的手,不能停。

要点:模糊的用户反馈必须拆到原始对话才能定位真因;eval 是可重跑的考卷,把“变好了”变成通过率;考卷会泄题,要定期换题,且只覆盖可枚举的失败;eval 管迭代测量,文档管模糊方向和跨团队对齐;起步三步是归类失败、做二三十题的对照、定重跑节奏。

最后更新于