先锋 趋势 方法 投研 作者
为什么每个 Agent 都需要一个 Box——Aaron Levie,Box
返回节目精读

为什么每个 Agent 都需要一个 Box——Aaron Levie,Box

摘要

  • Box 的核心判断是,企业里的 Agent 数量将达到人的“10倍或100倍”,让沉睡的企业文件变成持续产生价值的基础设施。 合同、研究、路线图和客户材料将不再只是人偶尔重新打开的文档,而会成为入职、销售和自主工作的输入。这个说法几乎不需要再包装:“Every agent needs a Box.”

  • 决定自主 Agent 能否安全进入受监管企业的,可能是 Agent 的身份与授权,而不是模型的原始智能。 如今的“简单模式”是让 Agent 与人类操作者使用同一身份;独立 Agent 则会带来隐私、责任、监督和多方访问等更棘手的问题。Levie 预计,除非权限和治理体系原生面向 Agent 设计,否则企业将遭遇“极其疯狂的安全事件”。

  • AI 编程的快速普及并不能代表其他知识工作的进展,因为软件开发拥有异常有利的条件。 代码基本是文本输入、文本输出,工程师通常可以访问大范围代码仓库,模型接受了大量代码训练,而实验室自己的开发者又在持续提供反馈。银行家、律师和其他从业者面对的则是碎片化权限、未记录的上下文、混合媒体,以及困在对话里的信息。

  • 企业必须围绕 Agent 重构工作,而不是等 Agent 自己融入现有流程。 swyx 质疑了“Agent 会适应我们的工作方式”这一咨询顾问式前提:“Agent 并没有真正适应我们的工作方式。基本上是我们适应了 Agent 的工作方式。”他还以 OpenAI 招聘 FDEs、Anthropic 入驻 Goldman Sachs 为例,说明不存在毫不费力的“原样接入”路径。Levie 认同,要把数据环境整理好会很难,但另一种极端——让 Agent 从完全混乱的环境中自行推断一切——在技术上不可能。

  • 上下文工程本质上是检索问题:可能需要把5000万页可访问信息压缩成约6万个可靠 tokens。 更大的上下文窗口并不能消除搜索、排序、访问控制,以及判断何时停止查找的需要。更好的模型可以识别相互矛盾或已经过时的文档,但“如果数据环境完全是一片荒地,仍然没用”。

  • 知识工作要达到可靠性,必须依赖私有 evals,因为看似合理的垃圾输出可能带来普通软件输出中看不见的职业和法律风险。 据称,Box 的留出行业基准在一次模型版本对比中出现了约15个百分点的提升,而内部测试可以同时捕捉模型和 Agent harness 的回归。Levie 预计,最终每家企业都会为 RFP 制作、销售材料和发票处理等工作流维护自己的 evals。

  • Box 正将其受治理的文件系统定位为 Agent 数据层和沙盒工作区,同时围绕一场攸关生死的 Agent 转型重组一家约3000人的公司。 一个由几十人组成的核心团队获得搜索、元数据、基础设施、安全和合规团队的支持。在 Box 之外,swyx 和 Alessio 认为软件产出可能提高10倍至100倍,这会让技术人员、部署和 DevRel 变得更加重要,而不是相反。

精读

1. 沉睡的企业文件变成活跃的 Agent 资本

  • Levie 的出发点是,企业文件里已经有合同、研究、营销材料、备忘录和路线图,但人类通常只会在某项工作正在推进时使用它们。Agent 会把这座档案库变成“持续回答新问题的信息源”,也是新生成工作的原材料。

  • 具体应用覆盖企业各个环节:新员工可以重建一个项目,销售人员可以判断该向客户提供什么,产品团队可以找回下一个功能背后的信息。由于 Agent 能持续检索并改造这些数据,数据的价值随之上升。

  • 一些 Agent 会直接代表人类行动,继承相同的访问权限;另一些则更像拥有自己机器、工具和沙盒环境的自主同事——更接近主持人讨论的 OpenClaw 模式。Levie 的简化表述是:“Every agent needs a Box.”

2. Agent 数量超过员工,催生新的基础设施市场

  • 无论倍数是“10倍还是100倍”,Levie 都认为 Agent 数量超过人的一个数量级不可避免。这将催生对治理、权限、访问控制、工作流协同,以及跨多个企业系统检索能力的需求。

  • 风险场景非常具体:一个被 prompt injection 的 Agent 可能在 CRM 中一路操作,提取出用户本不应看到的信息。Levie 预计会出现“极其疯狂的安全事件”,因为自主软件把广泛访问权限和实际行动能力结合在了一起。

  • 监管仍未定型。在金融服务行业,Levie 提问:Agent 是继承与人类员工相同的要求,还是责任完全由创建或指挥它的人承担?无论答案是什么,都仍然需要数据治理层。

  • 当 swyx 将 Box 在《财富》500强客户中的渗透率四舍五入为70%-80%时,Levie 回答“67%”,并表示公司给出的预测是到年底的水平。这些客户关系让 Box 直接面对权限与合规约束,而这些约束决定了 Agent 能否从试点走向正式部署。

3. Agent 不能简单当作另一个员工账户

  • Levie 把当前模式称为“简单模式”:在 Claude Code、Cursor 或 Codex 中,“Agent 就是你”。它通过用户身份认证,通常可以执行用户能执行的一切,从而绕开独立身份和责任模型的需要。

  • 自主 Agent 则不同。它们的创建者大概率仍要承担责任并负责监督,而 Agent 本身既没有人类意义上的隐私诉求,也不承担法律责任。创建普通用户账户,只会复刻为人类设计的控制机制,同时掩盖究竟谁必须检查并为工作结果负责。

  • 协作会让边界更加复杂。如果一个人创建的 Agent 后来与另一名员工私下协作,创建者需要监督 Agent,却不应自动看到协作者的机密材料。人类熟悉的私有工作与共享工作的维恩图,已经无法顺畅对应这种关系。

  • swyx 认为,在这种粒度下,传统 RBAC 可能已经“死了”;Levie 的回答更为克制:Box 的瀑布式权限会制造新的问题。Agent 需要被选择性地提供数据、拥有自己的工作区、获得部分访问权限,并接受可追责的监督——这些“对98%的人来说很无聊的问题”,决定了自主性是否会演变成数据泄露。

4. AI 编程是例外,不是企业基线

  • 编程具备一组异常有利的条件:可以访问大范围代码仓库,媒介是文本输入、文本输出,模型训练数据充足,技术用户愿意安装新工具,而且社区高度联网并共享实践。AI 实验室还每天使用编程 Agent,形成异常紧密的产品反馈闭环。

  • Levie 将其与银行家对比:银行家只能看到必要信息的一部分,必须找到掌控 deal-room 文件夹的人,还可能需要另一家组织提供上下文。需求也经常来自 Zoom 和线下对话,而这些内容从未被记录成权威文本。

  • 软件行业也并非拥有完美的文档和规格说明,但“企业里大约80%的工作根本不存在这些东西”。因此,其他知识领域要面对编程所没有的六七重阻力:数据碎片化、格式混杂、访问控制、隐性知识、工具更弱,以及需要培训的用户。

  • 结果将是一次“多年长跑”,而不是编程 Agent 的即时复制。编程之所以达到逃逸速度,是因为其环境本来就异常容易被模型理解;经济的其他领域首先必须让自己的工作流和上下文同样可操作。

5. 企业将围绕 Agent 调整工作流

  • Levie 称,在两年时间里,编程已经成为“也许是有史以来变化最大的工作流”:开发者越来越多地向 Agent 描述任务,而不是亲自写每一行代码,甚至不再逐行审查全部输出。决定性变化发生在组织层面——“基本上是我们适应了 Agent 的工作方式”。

  • 他预计,经济的其他领域也会通过围绕 Agent 的执行重设计流程、提示词、访问权限、文档和审核机制。那个可以直接“插入”并自动化既有工作方式的理想 Agent 尚未出现;但先行团队会获得复利式优势,而竞争对手可能要花数年时间重构。

  • swyx 反驳称,这听起来像是咨询顾问的梦想,也给了竞争者留下机会,让他们承诺:“原样接入,我们会在你现有的工作方式上与你汇合。”随后他以 OpenAI 招聘 FDEs、Anthropic 入驻 Goldman Sachs 为例,说明即便是这些实验室也需要亲自改造工作流。Levie 认同,要抵达那座“美丽花园”会很难。

  • Levie 不认为企业能拥有一座修剪得完美无瑕的数据花园,但他说,另一端的极端状态在技术上不可能成立。如果上下文混乱到无法恢复,任何模型都无法推断缺失事实;当错误检索和生产率损失的代价过高时,竞争压力会迫使企业改善文档。

6. 更好的模型能改善判断,但救不了数据荒地

  • 9个月前,Box 的内部 Agent 还会生成虚假答案,有时只是返回5份“闻起来像正确答案”的文档。Levie 说,系统被“放在时钟上”,即便不确定也必须作答;Alessio 将结果概括为:“没用。”

  • 他认可 Opus 4.6、Gemini 3.1 Pro,以及最新版本 GPT-5.3 可能带来的进展。6个月前,模型基本是在掷飞镖;而更新的 Opus 4.5 和 4.6 版本已经能够发现相互矛盾的信号,重新审视候选文档并重新排序。

  • Box 的 Agent 会同时发起多路搜索,收集候选文件并排序,然后再作答。但模型智能存在上限:如果“一个非常、非常聪明的人也无法在5分钟或10分钟内完成”某项检索任务,Levie 就不认为 Agent 能够克服源材料缺失或语义不一致的问题。

7. 上下文工程将数百万页压缩成极小的工作集

  • Levie 承认,到2035年前后,无限上下文或许会变得经济可行,但这不是当前的架构。即便模型宣称拥有200,000 tokens,他估计在明显退化前,真正可靠的可能只有约60,000 tokens——对于企业语料库远远不够。

  • 他的规模对比是关键:假设有1000万份文件、每份5页,就是5000万页;而模型可靠读取的范围只有几百页对应的 tokens。搜索系统、数据库、权限和排序机制必须填补这道鸿沟。

  • Box 测试了一个场景:要求系统找出10个办公室的地址,但没有任何一份权威文件包含全部10个地址。低阶模型往往找到6个,报告有4个缺失,然后停止;穷举式搜索成本很高,而用户要求的某个办公室也可能根本不存在。

  • 真正需要的是判断力:尝试不同查询,核验证据,最终判断继续搜索也无法解决问题。“什么时候该放弃?”是知识工作中的核心问题,因为答案可能根本不存在,而不是仍在某个仓库里等待被找到。

8. Agent 需要选择性遗忘,也需要更严格的错误标准

  • Alessio 观察到,人类会自然删掉失败路径,而 Agent 可能仅仅因为某个错误仍然突出,就不断重复它——即使 trace 已经明确记录了失败。一个可行模式是移除会分散注意力的尝试,同时保留一条简短警告,提醒系统不要重蹈覆辙;swyx 将其概括为删掉错误,但保留教训。

  • 软件垃圾可能隐藏在一个能够正常运行的界面之后。知识工作中的垃圾则会直接暴露出来:如果一份合同生成20次,每个版本之间都有3%的差异,这些变化带来的是组织风险,而不是无害的实现瑕疵。

  • 核心差异在于职业责任:软件工程师可能造成一次宕机,回滚代码,再参加复盘;但律师可能被吊销执照,医疗错误则会伤害患者。因此,知识工作 Agent 需要更窄的约束、明确的审核责任,以及编程 Agent 起步时尚未面对的管理标准。

  • 主持人将2025年定义为编程 Agent 崛起之年,将2026年定义为知识工作转向之年。Levie 认同这套可迁移模板——给 Agent 资源,分配任务,然后审核——但强调,每个领域都会额外引入敌对数据、访问权限和责任风险。

9. 私有 evals 将成为每家企业的运营基础设施

  • Box 通过开放律师、投资银行家及其他职业所使用的代表性数据工作区材料,支持了 APEX eval。Box 自有基准覆盖约10个行业的文档,包括公共部门、法律、医疗和金融服务场景,例如 data room 和投资募股说明书。

  • 这套基准已经从一次性模型测试演变为同时评估模型和 Box harness 的 Agentic evaluation。评分标准会核对必要事实,而数据对 Anthropic 留出且不公开,避免模型提供商针对该基准进行定向训练。

  • Levie 形容同一模型家族内部出现了“惊人的跃升”,称一次对比中整体得分提升约15个百分点,并特别比较了 Sonnet 4.6 与 Sonnet 4.5。私有设置有助于区分真实能力提升和针对排行榜的优化。

  • 模型选择只是目的的一半;Box 每天都在修改自己的 Agent,因此必须捕捉回归。Levie 预计,每家企业最终都会评估 RFP 生成、销售材料制作、发票处理等流程,使 Agent 可观测性以及 Braintrust、LangSmith 等 eval 平台成为一个“巨大的市场”。

10. Agent 将成为 Box 整套技术栈的第三类客户

  • Box 历来为两类客户设计文件系统:人类用户和应用程序。Agent 是一种新的用户类型,有不同的工作区和检索需求,包括 Box 可能使用基于 embedding 的搜索,而不是典型的语义搜索。

  • 支持 Agent 会触及每一层:数据存储、文件系统语义、元数据、搜索、权限、治理、合规和基础设施。Levie 描述了持续进行的实验——“测试东西,再把它们扔掉”——而 Agent 团队不断为周边组织提出新的要求。

  • Agent 核心团队由几十人组成,置于一家约3000人的公司内部,外围则是同心圆式的支持团队。Levie 不愿把它称作“创新中心”,因为创新必须属于全公司;这个团队之所以独立,是因为能否抓住 Agent 浪潮关乎“生死”。

  • eval 工作由 Ditya 和 Siddharth 牵头,CTO Ben、AI 负责人 Yash 及其他人也参与其中。现有的安全和合规功能,是 Box 具备企业 Agent 平台资格的原因,但还不足以赢得竞争;Agent 路线图关乎公司的生死存亡。

11. Box 看到的是读写工作区,而不只是企业搜索

  • 目前读取比写入更难,因为检索面临“1000万比1的比例问题”。写作可以由模型直接生成并保存,尽管生成的 PowerPoint 文件仍会在字体、形状和幻灯片一致更新等可见细节上出错。

  • Box 计划推出由领先模型驱动的原生 Agent,但 Levie 认为,更大的机会在于让任何外部 Agent 都能把 Box 当作文件系统。Agent 可以在其中存储记忆、规格说明、Markdown、PDF、中间产物或生成的交付成果,而不受 Box 对文件类型的限制。

  • 这个工作区将是沙盒化的,同时支持协作:人类可以检查内容、参与其中,或向其他人分享选定材料。私有工作区、受治理的企业输入、持久化输出和受控协作的结合,就是“每个 Agent 都需要一个 Box”在产品层面的体现。

12. 文档会获得溢价,但企业不能被固化成 skills 文件

  • Levie 反对用 Markdown skills 代表整家公司,并不是因为文档没有价值,而是现实会在一周后发生变化。市场、客户和内部决策会持续使既有指令失效,而大量上下文仍然存在于从未数字化的对话中。

  • 主持人更尖锐的描述是,“大多数公司实际上都是学徒制”:新员工需要花1到3个月获得隐性知识。Agent 暴露出企业有多少运营上下文从未被写下来,或从未被持续维护成权威信息。

  • swyx 认为,更好的信息捕捉可以把3个月的磨合期缩短到约2周,减少返工,并让普通员工更接近90分位员工的表现,因为顶尖员工的知识可以被分发出去。这为面向 Agent 的文档建设提供了直接的生产率理由。

  • swyx 还指出了规模问题:在一家1万人的公司,捕捉一切不等于分享一切;信息必须映射到真实的组织访问边界上。没有权限设计的数字化,只会创造一个更容易搜索的泄露渠道。

13. 文件系统和轻量级 wiki 可能胜过知识图谱至上主义

  • Levie 认为,“把公司看成一个文件系统”是一个有用的隐喻,因为企业本来就在通过受权限控制的工作区协作。他不太相信正式知识图谱会自动解决人的混乱问题,也记得过去曾有一轮预期,认为企业最终会完全建立在 wiki 之上。

  • 他的立场刻意保持开放:Box 可以向别人的图谱供给数据,也可以消费某个图谱,或者让 Agent 查询多个系统。持久的要求是对不断变化的信息实施受治理的访问,而不是在图谱结构与 Markdown 简洁性之间赢得一场争论。

  • Alessio 认为,有用的图谱可能会像人类一样动态地“在 Agent 的脑中”形成。swyx 偏好持久化 Agent wiki——把相互链接的 Markdown 作为一种弱化、可适应的知识图谱;Alessio 则以 DeepWiki 为例,说明对人类有用的文档,对 Agent 可能更有用。

14. 创始人的注意力追随生死风险,分发则日益技术化

  • Levie 说,Box 约90%的工作都已委派出去;在公司可能70%-80%的范围内,他只需要通过季度复盘等高杠杆决策和流程,检查约5%的活动。与主持人最初的判断相比,他认为自己与 Brian Chesky 的 founder mode 并没有那么远。

  • AI 的情况不同,因为“2个、3个、4个、5个错误决策”——无论发生在架构、功能、API 还是平台战略上——都可能让 Box 在一年内出局。这让 Levie 深夜投入产品工作,包括录制结束后预计在晚上11点参加一场 Zoom;但他仍然需要能够协作的领导者,而不是只会听令执行的人。

  • 他个人的生产函数把内部问题、公开写作和外部反馈连接起来。20分钟通勤,以及晚上7:30到9:00浏览 AI 新闻,成为提炼经验的时间;公开回应随后又反馈给 Box。这个习惯早在公司成立前就已存在——他曾因提出要写博客记录一次实习经历而被撤回实习 offer。

  • Alessio 认为,每家公司可能都需要以媒体公司的方式运营,而 DevRel 会变得越来越重要,因为服务和 API 必须吸引 Agent。swyx 补充说,软件每美元的功能产出可能大幅提高,但公司仍会花费相近的精力,通过技术部署和教育把这些功能交付给客户。

  • 主持人对劳动力市场的判断是,软件产出可能提高“10倍至100倍”,让技术能力变得更加重要,而不是更不重要。无论企业是自建系统还是购买打包软件,工程师都将负责部署 Agent、维护集成、翻译业务问题,并支持一个软件进入每个领域的世界。