No Priors 第97期|与 Decagon CEO 兼联合创始人 Jesse Zhang 对谈
摘要
客户支持是 Decagon 的 AI 智能体“黄金用例”,因为自动化程度和客户结果都能直接衡量。 Jesse Zhang 表示,买方会追踪智能体处理的对话占比、CSAT 或 NPS,以及——尤其在受监管行业——准确率。最终,企业可能获得一个支持任何语言、全天候在线的“私人礼宾”,在节省人力的同时提升留存和转化。
Bilt Rewards 采用 Decagon 后约1个月内就停止扩张支持团队,此后已记录节省约65名员工的编制。 随着用户基数快速扩大,其支持量也持续增长;自动化让 Bilt 得以重构运营,同时加快响应速度。Zhang 称,这个案例的 ROI “非常容易看清”。
真正的差异化在基础模型之上,而不在于独家获取基础模型。 Decagon 通过评测驱动的编排组合多个模型,围绕每个客户的业务逻辑进行塑形,并展示回答背后的数据、步骤和知识缺口。“你真的不希望它给人的感觉像一个黑箱。”
对客服智能体而言,指令遵循比模型讨论中占主导的编程和数学能力提升更重要。 Zhang 欢迎 o1 和 Sonnet 带来的进步,但表示决定性能力在于,模型能否拿到一份客服 SOP 或工作流并“严格照做”。即使核心模型继续进化,应用层仍有大量工作要完成。
近期的智能体赢家必须支持渐进式部署,并在达到完美之前就能带来容易量化的回报。 客户支持和编程满足这一标准;安全领域可能不满足,因为漏掉一个细微事件就可能不可接受,而 text-to-SQL 往往仍是需要人工监督的副驾驶,定价能力也不清晰。因此,Zhang 表示自己“对很多 AI 智能体近期用例更加悲观”。
语音、屏幕上下文和智能体监督,是 Decagon 未来的关键方向。 语音到语音模型可以降低延迟,但生产工作流仍可能需要检索数据并进行多次调用;Zhang 认为 computer use 可能还没准备好投入生产。更长期看,他预计会有更多人监督和编辑可无限扩展的智能体,使可观测性和控制成为产品重点。
精读
1. 客户需求将客服支持选为 Decagon 的智能体切入口
Decagon 成立于2023年8月。Zhang 的第一家公司被 Niantic 收购;他和联合创始人 Ashwin 创办 Decagon 时,最大的心得是创始人“不能把事情想得太复杂”。他们最初对智能体有广泛兴趣,随后与客户交流,最终由这些对话筛选出客户服务这一最强的初始用例。
这一匹配建立在一个事实上:该用例非常适合发挥 LLM 的长处。如今,Decagon 面向拥有大规模支持业务的公司,客户覆盖高速增长的初创企业和大型企业。
透明度成为最核心的要求。客户需要查看哪些数据生成了答案、智能体采取了哪些步骤,以及自己能否提供反馈:“对他们来说,AI 智能体不是黑箱非常重要。”
2. 客服自动化带来异常清晰的经济回报
Elad Gil 提到的基准案例是 Klarna:4周内处理230万次聊天,满意度与人工持平,重复咨询减少25%,解决问题平均用时2分钟,而人工需要11分钟。AI 还让 Klarna 能够在23个市场、35种语言中提供全天候服务,同时将700名全职员工转去从事其他工作。
Zhang 的评估表有两个核心指标:智能体完成全部对话的比例,以及客户是否通过 CSAT 或 NPS 变得更加满意。受监管行业的买方还会增加准确率约束,但更广泛的收益包括降低成本、加快服务、提升留存和增加转化。
Bilt Rewards 提供了 Decagon 最清晰的案例。由于咨询量随着用户基数快速增长,Bilt 起初担心支持团队会不堪重负;但在约1个月内,它就停止扩张支持团队。近1年后,公开案例显示其节省的编制约为65名员工,同时客户体验也变得更加“利落”。
3. 应用层差异化来自编排、评测和运营控制
GPT-4o、GPT-4 和 Claude Sonnet 等模型人人都能使用,因此 Zhang 将 Decagon 描述为一家把模型当作工具的软件公司。他认为,真正的特殊之处在于编排以及模型周边的软件,而不是模型本身的获取权限。
编排层可以通过 evals 衡量模型在特定任务上的表现,将多个模型组合起来,并围绕每个客户的业务逻辑塑造最终系统。这种编排会因品类而异:客服智能体和编程智能体需要不同的结构,即使底层使用的是同一批模型。
周边软件还必须能够在规模化运营中理解业务。如果客户有100万次对话,不可能由人全部读完;系统应该识别主要类别、趋势、缺失知识和其他缺口,同时解释单项决策背后的数据和步骤。
买方可以先让智能体处理1%的业务量,将结果与人工表现及其他方案进行比较,再逐步扩大部署。Zhang 表示,Decagon 在这些基准测试中的优势来自“可观测性、可解释性、控制力”,但也承认距离成熟“还有很长的路要走”。
4. 指令遵循与延迟定义技术前沿
Zhang 将定量推理与指令遵循区分开来。近期模型在编程和数学方面进步显著,但客服更依赖忠实执行详细 SOP——“严格照做”。相比抽象推理能力,他更希望顶尖实验室推进的是这种能力。
语音是同一个底层客户问题的另一个渠道,与聊天、邮件和 SMS 并列。Decagon 起步时选择文本,因为客户更容易评估;但见过文本智能体效果的客户,如今已经开始测试由 ElevenLabs、OpenAI 和 Cartesia 等公司构建的语音智能体。
架构上的权衡是延迟与计算量。语音到语音模型响应迅速,但生产场景可能需要检索数据并进行多次模型调用;语音转文字、文本处理和重新生成语音都会增加延迟。一种实用的过渡方式是用对话填充时间——“稍等一下,我正在查你的数据”——同时让后台继续工作。
除了语音,Zhang 还希望智能体能够利用用户完整的屏幕内容和交互历史,然后直接帮助用户操作软件。Anthropic 的 computer-use 演示展示了这一方向,但他判断目前可能还没准备好投入生产。
5. 可行的智能体需要渐进式上线和可量化 ROI
Zhang 回顾时采用两个标准:智能体必须在接近完美之前就能创造价值,买方还必须能够量化这种价值。他认为,在当前模型条件下,“现在绝大多数用例”仍未达到商业化准备状态。
安全领域体现了完美主义问题。尽管大规模日志流看起来非常适合 AI,但这项工作可能要求捕捉每一个细微事件;模型的非确定性让企业买方不愿信任智能体方案。该领域的采用可能会“非常、非常慢”——远慢于那些令人印象深刻的演示所暗示的速度。
text-to-SQL 体现了衡量价值的问题。买方可能喜欢生成结果,却仍要求有人监督和编辑,最终系统变成副驾驶。如果所谓的 AI 智能体数据科学家大概率无法替代真正的数据科学家——而企业本来就只雇佣很少的数据科学家——供应商就很难证明一份大额合同的合理性。
编程是相反的正面案例:团队可以划出部分任务,让智能体尝试完成,并在不交出全部控制权的情况下获得有用结果。更好的模型将解锁更多品类,但 Zhang 对近期前景的结论仍然刻意保持谨慎。
6. 智能体监督成为一种新型工作
随着智能体不断增加,Zhang 预计人们会把更多时间用于监督和编辑智能体。不同于人类员工,智能体“可以无限扩展”,而且部分行为可以硬编码,从而为实时反馈、监控和控制创造新的可能。
Decagon 自身的产品方向也顺应这一变化:人工客服和管理团队都应该能够检查表现、介入处理并作出修改。Zhang 将这层控制能力视为公司当前的差异化所在,也是下一步创新的方向。
Zhang 还将数学和编程竞赛社区描述为一个非正式的创始人网络。成员之间会相互进行天使投资、交换运营建议并一起社交,包括通过中文版本的桥牌进行社交;这一背景是有用的招聘信号,但他强调,Decagon 的招聘流程总体上没有区别,人才来源也远不止竞赛参与者。