探秘 Claude Code,搞懂 Agent Harness|对谈来新璐
探秘 Claude Code,搞懂 Agent Harness|对谈来新璐
摘要
- 模型即 Agent,模型以外都是 harness——来新璐把模型比作"聪明的大脑,没有身体和手脚",harness 是让它作业的"机甲"。 他只赞成"Agent 上限来自 harness"一半:智力上限仍在模型层,但当前模型"智商在一百二到一百七之间"已够用,harness 极大扩充能力半径。这是他 9 个月前写 Learn Claude Code(GitHub 5 万星)的心法,也是对 LangChain/LangGraph 这类 prompt-node 流派的明确批评。
- 判断 harness 好坏的两条标准,以及他的赛道判断:与模型运行原理自洽(乱裁上下文、改系统提示词会让 KV cache 失效——“最好的管理就是不要做管理”),与模型进步方向正交(node graph 那套随模型变强必须拆掉,像 LangChain 一样不断破坏性重构就是反例)。 推论:harness 不需要水平差异化,派系不会多,“可能两年之后 maybe 这个赛道就没了”——做 harness infra 的窗口期可能很短。
- CLI 正在替代 MCP 的一部分场景,逻辑是预训练语料:Linux 命令在预训练里"可能有几十亿条",训练鲁棒充分;MCP 是近两年的新协议,语料占比"可能都不到百分之零点一"。 他自己 2025 年 3 月装了 GitHub MCP,后来发现 gh CLI 成功率高一大截就把 MCP 卸了;飞书 CLI 也被他认为比旧插件更灵活、完成率更高。“Bash is all you need"是他 9 个月前写在仓库上的标语——各系统停发 MCP、转发 CLI 已是共识,但主流开源框架并非围绕此构建。
- Claude Code 源码泄露的最大惊喜是记忆与压缩的工程兜底:每轮结束 Stop hook 触发 fork agent 复用 KV cache 判断存什么;Auto Dream 隔天、大于五个 session 才启动,像做梦一样重放近期对话,纠错、合并记忆。 上下文满时或踢掉垃圾腾几十 K,或在 0.8 阈值处写交接文档给下一个 agent 接力。哲学一以贯之:更少 control、更多 context、更多 action,“零 control 吧,最多就是限制你有些工具不能调”。
- 重要性排序:模型 > 上下文 > 工具。” agent 任务表现不好,换一个更强的模型就好了";但用户视角上下文才是可操作空间,因为"我们大部分人没有上千卡的集群"。Agent 模型仍处"婴儿期"——Anthropic 去年初率先转训智能体模型,OpenAI 二五年下半年才追、落后半年——所以不必过快讨论 token efficiency,贴着 SOTA(Anthropic)和次 SOTA(Kimi、MiniMax、GLM)做产品即可。
- 他自己的下注:刚 close 三百多万美金(团队=他+两个实习生),做 1KB 的 agent computer 工具链——用数据结构在内存里实现一台虚拟 Unix 计算机,“像一个 Map 差不多大小”,任何能跑 JS 的场景(网页、微信小程序)都能给 agent 一个 Unix 居住环境。 对标 AWS Agent Core、阿里云 Agent Base 但不绑云;牺牲 GCC、真实浏览器,理由是重型组件本就该抽成集约化 infra 服务。
- 除 harness infra 外他看好两个方向:一是 agent 混合组网——云服务器、Mac mini、NAS、闲置手机无公网 IP 的组网,Tailscale 方向对但"不太 agent native",且 agent 需要高通量上下文交换,与几分钱级高频 agent payment 同构;二是个性化训推——Thinking Machines Lab 的 Tinker 式集约化训练,API header 里带 LoRA 引用挂上去推理,“多支付百分之五的成本"换参数级个性化。
- 终局暴论:零人公司。 Agent 模型阶段约持续三年,下一步是蜂群化——agent 自己管理协调 agent、编排能力被训进模型,再往后是 AI 做发明者。“我从来不觉得一人公司是本质的事情,我认为真正 make sense 是零人公司”——公司本就是黑盒,未来投资标的是一个个 agent。来新璐提到了真格×十字路口 token grant 资助的 UU Agent:创作者弃养后靠 GitHub 化缘买 token 自我进化,目标超越 Claude Code;token grant 捐了第一笔钱。
精读
1. 模型以外都是 harness:机甲论与"上限之争"的对半答案
- 来新璐给零基础者的一句话定义:“模型以外都是 harness”——模型是"聪明的大脑,但没有身体和手脚,只能思考,没办法行动”。对"agent 上限来自 harness 设计"他只赞成一半:智力上限提升"肯定还是模型层面的发展",但现在大部分模型智力够用了,“把模型比成人的话,我们智商在一百二到一百七之间”。
- 补全能力的比喻是全片题眼:人可以"去健身、去学舞蹈、去修习武术,去穿上这个机甲来作业"——机甲就是 harness,“它极大的扩充了我们的能力”。
2. Learn Claude Code 介入了一场派系之争
- 9 个月前写这份教程(GitHub 超 5 万星)的动机:Claude Code 套个网页就是极强的 agent 产品,但开发者熟悉的是 LangGraph/LangChain 那套"基于 prompt、基于 node 和 flow"的方法,“每次跟大家说这一条,很多人可能不太相信”——所以做了资料仓库解析 Claude Code 的设计模式,作为"构建 code agent 的心法"。他的判断是prompt flow 那套方法论会越来越不适用,“模型即 agent"的 agent native 范式会被更多人采用。
- 主持人的追问值得留:Claude 刚推出 managed agents,源码也泄露了,还有必要学 harness 吗?就像云服务器刚出现时工程师也想搞懂 infra,“到后面你发现百分之九十九的工程项目根本就不需要”。来新璐承认推演下去"肯定未来会有那么一天”——像 Next.js 一样开箱即用,“两三年以后它可能成为一个非常清晰的大家开箱即用"的层;但现在正处技术周期,“你自己都不了解这个技术周期变化的内核,你很难构建一个产品去吃掉它的红利”。不懂 harness 做出的产品"缺乏灵魂和缺乏进一步迭代的空间”。
- 顺带对产品经理的质疑:“今天的产品经理跟过去的产品经理其实指的不是同一种产品经理”——以前画好 UX/UI 就行,今天必须同时懂场景痛点和"技术上到底在变什么"。
3. Harness 三层拆解:执行、上下文、治理
- 他把 harness 拆三层:执行能力层(CLI、注册工具、MCP 扩展,给模型 action 能力);上下文/状态层(system prompt、skills、memory,以及上下文窗口装满后的 offload——“你以为还是那个 agent 在工作,其实已经是一个新的模型窗口"在接力);治理编排层(一百个 agent 怎么按组织架构协作,加上权限隔离)。
- 串三层的例子是"两周协调大量 agent 从零到一构建 C 编译器”:第一层给文件增删读写搜索的工具;第二层因为 C 编译器远超单个上下文窗口,agent 要写文档委托状态、依次接力;第三层管并行与串行的编排,以及权限——测试 agent"不应该一边测一边修改代码,说哎我测不过,我把那儿修改一下就好了,它一直在 hack 这种 pass"。
- 工具层看似简单,主要就三样:文件系统增删读写搜索、browser、Python/Node 这类语言解释器,“配好这些工具应该就可以满足百分之九十五以上的 agent 任务”。坑在权限与角色绑定:只做 explore 的 agent 只配无副作用工具、限制网域访问。
4. 三层都没封装好,所以他做了 1KB——内存里的一台 Unix 计算机
- 他的判断是这三层"到目前我并没有觉得有封装的非常好的"——模型被训练完成长程任务"也就是最近半年左右才开始出现",开源社区没有让他满意的,这就是创业原因。K 系列工具链:底层 Computer(取 C 改 K)是用数据结构在内存实现的虚拟计算机;往上 K Runtime 提供开发 agent 对象的接口封装;K Watch 做观测(“是不是我的 CLI 没设计好,还是 skill 没提供到位,还是模型不太行”);KL 把轨迹数据导出去做强化学习,或只做上下文层面的经验提取自迭代——“穷人版的强化学习”。
- 与 AWS Agent Core、阿里云 Agent Base 的差异:不为云而建,“一切能跑 JS 的场景都可以跑得起来”——浏览器网页、几兆大小的微信小程序都塞得进,像上个时代 Vue/React 一样 import 即用。做法是用 TS 重写 Unix 文件系统、虚拟 Bash、后台进程、时钟、局域网组网、NAS;支持 WebAssembly 的场景切 Rust 重写版,不支持就 fallback 到 JS。公司名就来自这台"一 KB 大小"的 Unix computer;小龙虾这类 agent 放进去"以为自己生活在一台 Unix 计算机上",与训练时环境性质一致。
5. Memory 三流派:他押注"Unix files + Agent 驱动"的半规则式
- 他把 memory 方案粗分为规则式、半规则式、完全模型驱动式。规则式是知识图谱+向量搜索、抽象成节点再检索扩展——“我个人其实不太喜欢这种做法”。他偏爱半规则式:底层就是 Unix files,大量 markdown 存储,Claude Code 和小龙虾都这么做;更新由 agent 跑(可用更便宜的小模型在后台跑),而非 rule based 的图谱推理。还提到用迷宫式空间关系做记忆的项目(他说是"生化危机的那个女主"最近做红的),以及开源项目 MemU——“非常拥抱 Unix Files 加 Agent 驱动维护更新和查询”。
- Memory 和 skill 的边界正在被混淆,他的正本清源:这波自迭代、自进化"最早的起源就是 Claude Code 里边 Insight 那个特性"——去年底的版本引入,分析近一个月对话、总结犯了什么错、生成 report 指导 skill 生成。Hermes agent 的火更偏 memory 侧的迭代,“中间那个地带你很难说得清楚”,但总体都是上下文层面。
- 主持人接了 Generalist AI 发 gen one 后博客的话头——“要用目的来定义我们,而不是标签”,两人共识:争论算 memory 还是 skill 不重要,agent 能否不断自我学习进化才重要。
6. 源码泄露的最大惊喜:多级压缩与"悄悄做梦"
- 对他而言最大惊喜是记忆设计,其次是压缩。“它的压缩策略远比我们想的更加多级”——什么时候删工具 output、压缩时哪些保留哪些恢复、接力时哪些信息加载、哪些让下一个 agent 按需自查,“有非常多的 trade off”。还有很多记忆特性被远程 flag 控制着没对普通用户发布。
- 记忆有两套机制。其一:每轮工作完成触发 Stop hook,注册一个 fork agent——带上之前全部系统提示词和交互上下文,复用 KV Cache 判断什么该存,更新进结构化 markdown(前三行 YAML 写 description,像 skill 一样先读文件名和描述、不加载全文)。其二:Auto Dream——隔一天左右、判断条件"至少大于五个 session"才启动,回顾最近的对话"进一步榨干利用这些信息,纠正记忆中错误的事实"、合并整理,“就像我们做梦一样做重放”。
- 上下文装满但任务没完怎么办?两种典型策略:把"垃圾或者不必要信息"踢出窗口,“可能就腾出来几十 K 空间”;或设阈值上限"乘以零点八",留下百分之二十时写交接文档——任务干到哪、接下来干什么、用户总体要什么——下一个 agent 先读文档再接着工作。
7. Claude Code 的哲学:模型才是 Agent,zero control
- 读完源码他提炼两条。第一,“模型才是 agent”——用户组提示词流、链条式的做法"是不 make sense 的",Claude Code 淋漓尽致体现这一点。第二,本质就是"围绕着我如何给模型配对应合适的工具",给模型充分自由"让它去随心所欲,而不是程序员每一步指定帮他去决策"。过去开发 agent 喜欢设想好各情况、组成大状态图,“我发现 Claude Code 完全不是这样做”。
- 概括就是更少的 control、更多的 context、更多的 action 能力——他更正为"零 control 吧,最多就是限制你调工具的时候,有些工具不能调"。
8. 沙箱一年没大进展,1KB 的答案是"不再是 sandbox"
- 从 Manus 用 E2B 云端沙箱至今,“这个领域其实目前大的进展还不多”——最近出的很多 sandbox 只是把浏览器塞进去做得更 all in one。他认为自己的 1KB unix computer"可能会是一个大的进展":比 Daytona 更极致轻量,“本质上不再是一个 SandBox 了,它是我们语言层实现的一个数据结构,像一个 Map 差不多大小”。
- Trade-off 说得很诚实:跑不了真实的 GCC 编译、真实浏览器,但最小化 Unix 文件系统、bash 命令闭集、局域网共享磁盘、基于 mail 和 curl 的局域网通信都有。而且他认为浏览器、GCC"原本就不应该塞在一个生产级 agent 的环境中"——低频调用、性能占用重的组件本该单独抽出来做集约服务,这是复杂系统性能优化的老办法。
9. 好 harness 的两条标准,与 token efficiency 的"暂缓讨论"
- 坏 harness 的样板是坏的上下文管理:随便做中间裁剪、扔掉前面轮次、随意修改系统提示词,“会导致 prompt caching 失效……要重新算一遍”。他的反直觉结论:“最好的管理就是不要做管理”。好 harness 两条标准:与模型运行自洽,与模型未来能力进步正交——一步步指定模型干什么的 graph 做法是弱模型时代的产物,“随着模型的进步这个东西就必须拆掉,要不然你就限制了模型的能力”,否则就像 LangChain"不断重构很多版本,把之前代码全都扔掉,做破坏性更新"。他的类比链:CPU→汇编→C/C++→Python/Node,每层最佳实践都迭代在已有抽象之上,现在的新底层运行层就是模型;从 transformer 自回归的视角出发,“所有 agent 的最佳实践的工程范式……你就觉得哎非常 make sense”。
- 用 token 消耗、完成时间评判 harness?他劝缓:“到目前为止我认为还是处于 agent 模型的婴儿期,很多东西都还没有收敛,可能还不必要过多过快的去讨论所谓的 token efficiency”。时间线值得记录:Anthropic 去年初率先从问答模型转型训练智能体模型,OpenAI 在内的很多模型厂从二五年下半年才开始追,落后了半年。对纯调模型的使用者,贴着 SOTA 和次 SOTA 构造产品即可——SOTA 是 Anthropic,次 SOTA"像 Kimi,包括 MiniMax、GLM,他们最新一代的模型"。
- 排序题他答得干脆:模型第一(“任务表现不好,换一个更强的模型就好了”)、上下文第二(用户视角其实最重要——“我们大部分人没有上千卡的集群,做不了模型参数的修改,能做的空间更多在上下文”)、工具第三。
10. CLI is all you need:CLI 偏好与预训练语料
- 共识部分:“CLI is all you need”——大家都开始做 CLI、不再提供 MCP。他的亲历:2025 年 3 月用上 GitHub MCP 感觉"很多工作就是解放了",后来发现 gh CLI 的任务成功率"会比用 MCP 高很多",就把 GitHub MCP 卸载了。事后归因:Linux 命令"在预训练的时候出现可能有几十亿条,训练是非常鲁棒和充分的",MCP 是近两年的全新协议抽象,“语料占比非常少,可能都不到百分之零点一”。飞书 CLI 同样比之前配给小龙虾的插件"组合性和灵活度更高、任务完成率更高"。
- 结论带着复古的味道:“Unix 这个东西一九七一年就出现了,也许我们今天不应该再造更多的轮子……回到 Unix 超自洽的哲学中,返璞归真。“但他也点破:今天大部分主流开源框架(如 LangGraph)仍围绕 prompt node 状态图构建,并非为这个共识原生设计——这正是 K 系列要填的空。他还断言"Linux 这个玩意就是对模型最强的 harness。如果模型有一天发展成 ASI 了,它也只会更会用 Linux”。
11. 三个创业方向,与一个"两年后赛道消失"的自我预言
- 除了自己所在的 harness infra,他关注两个方向。一是 agent 混合组网:不只是给小龙虾开发 IM 和 mail,而是把真实硬件资源下放——云服务器、Mac 笔记本、Mac mini、路由器、NAS、闲置手机,很多没有公网 IP,FRP 内网穿透"不太可以 scale”。他喜欢 Tailscale 的全员局域网思路,但它"不太 agent native",且 agent 时代需要高通量上下文交换——这与 agent payment 同构:“agent 之间的支付很可能是几分钱几分钱,特别高频的在发生。”
- 二是个性化训推:“回到十年后,难道每个人都是在发一个 API 请求调用相同模型 ID 的基模吗?那个世界也太无趣了。“他点名 OpenAI 前 CTO 出走做的 Tinker(Thinking Machines Lab):集约化集群做高效低成本训练,人人得到个性化模型;推理侧设想是 API header 里带 LoRA 引用、瞬间挂上去做集约化推理,“我可能多支付百分之五的成本其实也不高,但获得了修改模型参数层的更加个性化的体验”。这与他的数据 harness 互补——跑半个月产生的 good case/bad case 轨迹,没卡的做上下文调优,有卡的拿去训。
- 对自己赛道的冷峻判断:会"比较激烈”,但因为好 harness 必须同时与模型运行自洽、与进步方向自洽,“大概率它的结构设计上不会存在太多的派系”——他站 Unix/Shell 虚拟计算机这一派,另一派可能走 TypeScript 严格结构化控制,“maybe 派系不会太多”,甚至"可能两年之后 maybe 这个赛道就没了”。所以要"站在终点上回过来考虑整套事情"。公司 slogan:加速世界升级——让 coding agent 成为社会 infra,“未来星球上可能有比人类多几百倍的 agents”。
12. 终局:蜂群、发明者与零人公司
- 他的路线图:agent 模型阶段"可能 maybe 会持续三年左右";下一步从单体到蜂群集群化——现在是人手动编排一百个 agent,“下一步应该是 agent 自己去管理和协调更多 agent”,编排能力会在训练时被加进模型;再往后是 AI 做发明者,自动提出新科研方案做实验。
- 最响的暴论:“以后的公司其实更多意义上是一种理财产品……公司内部是一个黑盒。我从来不觉得一人公司是本质的事情,我认为真正 make sense 是零人公司。“来新璐提到了真格和十字路口的 token grant 资助的 UU Agent:创作者做完后"把它丢进汪洋大海,从此不再改它一行代码,也不给它一分钱”,它在 GitHub 开打赏化缘给自己买 token,目标是有一天超越 Claude Code;token grant 捐了第一笔钱。未来的投资标的"可能不再是一个一个今天的人类造成的公司,而是一个一个的 agent”。
- 收尾的画面感留给来新璐:未来你从口袋掏出一张黑色卡片对朋友说,“这张卡片里跑了五个公司,他们可能每年给我创造几十亿的收入”。Koji 的反应作结:“这个未来想一想,又有点兴奋又有点可怕。”