Devin 的 80% 时刻:后台代理、7 倍 PR 与手把手写代码时代终结——Walden Yan & Cole Murray
摘要
后台编码代理在 2025 年 12 月前后出现了商业性质的变化:Opus 4.5 和 GPT-5.2 已能从一份足够好的规格说明直接推进到完成的 pull request,过程“几乎没有摩擦”。 Cognition 的内部证据异常具体:Devin 在 Cognition 各代码仓库中的提交占比从 1 月的 16% 升至 3 月的 80%;合并 PR 的使用量在 2-3 个月内增长约 7 倍,而工程团队规模仅增长约 10%。Cole 表示,Sonnet 3.7 已经足够强,Cognition 得以删掉一部分原本由代理机制承担、但更强模型已不再需要的组件。
如果供应商不掌握基础设施、分发渠道或企业落地过程,独立的代理编排层在经济上显得单薄。 Cole 将 OpenInspect 开源,是因为后台代理将成为企业关键基础设施;但他不愿去争夺“每席位 20 美元”的市场,因为模型和沙箱供应商拿走了大部分价值:“你到底在卖什么?”Cognition 的答案是,将代理、算力栈、集成能力和工程团队打包,帮助企业围绕 AI 重组工作流程。
尽管会增加状态管理的复杂度,安全性和可移植性仍支持 Cognition “将大脑与机器分离”的架构。 将 harness 放在沙箱内部更简单,但密钥和不可预测的代理行为会共处于同一个沙箱;将大脑置于沙箱之外,则可把敏感控制逻辑隔离开来,每台机器只获得定义该用户权限范围的凭证。这套架构还支持现有开发机、完整 VM、针对不同操作系统的环境,以及处于 beta 阶段的 Android 开发。
真正可守的工程能力越来越位于聊天循环之下:代码仓库配置、快速可恢复的机器、凭证,以及贴近真实环境的本地应用。 团队仍依赖“去找 Bob 拿密钥”;而最初的裸 EC2 机器曾让 Devin “像死机一样趴着 10 分钟”。Cognition 构建了按文件系统 diff 恢复工作的存储系统,而不是恢复整块 TB 级磁盘;他们还发现,网络挂载文件系统会让每次 grep 都变成一次网络操作,并掌握了足够多的基础设施,继续推进 VPC、本地部署和 GovCloud 部署。
应用测试本质上是推理与编排问题,而不只是计算机操作问题。 点击只是“发出正确坐标”;测试一次前端和后端的改动,还需要启动兼容版本、满足管理员权限或 feature flag 条件、协调多个会话,并找出触发特定行为的准确操作。讨论指出,有些场景需要编排多个 frontier model,因为没有单个模型能完成整条链路;带标签的视频和截图则压缩了人工验证环节。
企业价值取决于双向工作流集成,而通用 MCP 连接往往止步于此。 一个有用的 Slack 同事必须接收 webhook、自然回应、保留共享会话,并避免刷屏;一个有用的 GitHub 代理则必须解决评论和冲突,同时不能围绕自己的 reviewer 无限循环。讨论认为,需要一种“比 MCP 更具表达力”的双向机制;Swyx 则指出,当几乎每个代理会话都会经过某个关键集成时,掌握它本身可能就有意义。
记忆和多代理系统仍然前景可期,但在运营层面尚未成熟。 Cognition 的记忆系统必须从一次性请求中推断出可长期保留的偏好,而不能把偶发要求普遍化;还要在数千条记忆中完成检索而不淹没上下文,并适应模型变化。团队正在探索一种类似文件系统、由代理自行导航的记忆机制。多代理工作同样最可靠地表现为一个管理者拆分彼此隔离的任务,子代理像压缩上下文的工具调用,而不是自由协作的蜂群;不过,代理如今开始能够拒绝错误指令,也让真正的协作更有可能。
近期回报主要集中在自动分诊、安全审查、支持调查,以及让非工程师发起边界明确的代码改动,但治理仍不可或缺。 Walden 警告,如果未经审查的 AI 生成模式成为未来训练上下文,“你的代码库会退化成最差工程师的水平”;Cognition 的无审查实验持续约 2 周后,重复实现让简单改动都变得痛苦。Swyx 提到每位工程师约 $1,000-$5,000 的支出,现场也承认这一数字可能高得多;frontier model 与 subfrontier model 的混合路由预计会成为重要的成本杠杆。
精读
上游暂未提供,后续同步将继续补齐。