Karina Nguyen
观点集合
Agent 推理界面:Claude、ChatGPT Canvas、Tasks、Operator——与 OpenAI 的 Karina Nguyen 对谈
- 🗓️ 日期:
2025-02-01| 🎙️ 节目:Latent Space
Canvas由5至6名工程师约4个月交付,Tasks不足2个月,显示训练与反馈一体化的迭代速度。仅靠提示词无法稳定选择定向编辑、全文重写或工具,后训练因此成为产品壁垒。计算机操作仍慢、贵且不精确,协作建立的信任仍是智能体普及门槛。
查看访谈对话精读提要
Karina Nguyen 认为,AI 界面应贯穿整个技术栈,与模型行为一同开发、交付,而不是事后再补上的 UX。 她在 OpenAI 的团队“从训练模型一路做到部署”,将 Canvas 和 Tasks 视为重塑 ChatGPT 的更大系统中的相互连接部分。对投资者而言,这意味着一体化的研究、产品和实时反馈闭环,重要性可能不亚于基准测试领先。
Canvas 奠定了这套作战模板:一支由5至6名工程师组成的团队在7月4日前后成立,约4个月内完成交付,并单独发布 GPT-4o Canvas 模型,让它先从用户反馈中学习,再将改进整合进核心模型。 仅靠提示词无法解决定向编辑还是全文重写、Canvas 还是 Advanced Data Analysis 等决策,有些场景需要后训练,另一些则由应用侧处理。Nguyen 的总结是:“产品研究、模型训练和产品开发彼此紧密相连。”
Tasks 将这套打法压缩到不足2个月,并把日程安排变成分发 ChatGPT 更广泛能力的方式。 搜索、Canvas、故事和 Python 谜题都可以变成周期性输出;最终,Nguyen 希望模型能够推断用户的重复需求,“在后台想着你”。但她也提醒,目前模型还不擅长处理一条请求中的多个任务。
Agent 走向普及的核心瓶颈是通过实际表现赢得信任,而不是第一天就实现最大自治。 Nguyen 的阶梯路径是从一次性操作,到协作,再到长周期委托,因为密码、信用卡和隐含偏好的访问权限,都要求模型持续稳定地工作。“协作其实是用户愿意委托重要工作的主要障碍或里程碑之一。”
Computer use 仍是这条投资逻辑中潜在回报最高、但尚未解决的一环:Nguyen 将其称为 Agent 的核心能力,而 Alessio 仍然看空,因为现有系统“慢”“贵”且“不精确”。 Coding sandbox 和报销单比通用的机票预订更容易落地;swyx 追问 o3-mini 或 o1-mini 级别的模型能否解决延迟问题。Nguyen 的方向性判断是,随着互联网访问转向“通过模型的视角”,网站点击会减少。
原始基准测试的差距掩盖了把模型变成可靠产品的难度。 Claude 3 的开发产生了约70个候选模型,每个都有不同的“脑损伤”;GPQA 的波动性大到需要运行5次取平均,而模型卡之间也很少真正可比。行为设计还引入了诚实、无害和有用之间的目标冲突,至今仍然“更像艺术,而不是科学”。
最终形态可能是一套面向任务、生成式的操作系统,围绕用户意图渲染出正确的产物——文档、代码环境、图表或应用。 ChatGPT Search 生成苹果股票图表,是这一方向的早期样本,指向“从个人电脑走向个人模型”。Nguyen 认为瓶颈在于人的创造力,同时指出 OpenAI 更愿意押注产品,而 Anthropic 的定位更聚焦、更偏企业市场。
🔗 原始收听与视频来源: Agent 推理界面:Claude、ChatGPT Canvas、Tasks、Operator——与 OpenAI 的 Karina Nguyen 对谈