先锋 趋势 方法 投研 作者
Claude Code 迷狂症:SemiAnalysis 如何在 Token 消耗上碾压 Meta | 第008期
返回节目精读

Claude Code 迷狂症:SemiAnalysis 如何在 Token 消耗上碾压 Meta | 第008期

摘要

  • SemiAnalysis 正在把 Claude Code 变成一套智能体研究栈,其相较人工分析师工作的经济性颇具吸引力。 Dan 的 Wags 系统启动了 AOI 覆盖,约5分钟后返回一份部分乱码的合同相关结果;这次运行成本为3.52美元,若算上前期搭建可能达到10–15美元,相比“让分析师在这件事上耗上一天”仍然划算。目标是覆盖60–100家公司,让人类把时间放在“为什么发生、意味着什么”上。
  • 真正的约束在上下文架构和持久记忆,而不只是模型智能。 专门智能体分别处理文字稿、新闻、事件和财务模型;由于它们只能通过主智能体沟通,每个智能体只负责流程中的一个离散环节,再由一个“洁净”的公司智能体吸收其输出。子智能体关闭后,上下文随之消失,但记忆文件也不可能无限膨胀。最棘手的未解故障很直观:生成的资产负债表无法平衡,必须加入监督检查,并安排一名实习生负责“鞭策智能体”。
  • 低任务成本与使用量复利支撑强劲的 Token 和 GPU 需求,但企业采用仍是更大的不确定性。 SemiAnalysis 称其每位员工消耗的 Token 超过 Meta 的2倍;即使演示任务成本达到15–20美元,Dan 仍会选择运行它。IT 审批、激励不足以及与客户相隔甚远,都可能让50%的生产率提升变成提前50%收工,而不是多产出50%,因此 Token 支出未必能直接映射为企业盈利。
  • 模型质量已经从需要谨慎使用的专家工具,跨过了用户可以用“给实习生的同样指令”来驱动的门槛。 Sam 说,1年前的软件工作还要求测试驱动开发、分步搭脚手架和严格的上下文管理;现在他会把产品介绍给父母或祖父母,并预计最终“每个金融圈的人、每个律师”都会依赖它。反方观点是,尽管输出已经足够好,采用率仍然疲弱。
  • Mythos 可能代表网络安全能力的一次跃迁,但 Dan 并不相信原始能力本身就足以解释这一点。 他指出,编码和网络安全领域的进步远超其他方向,并质疑围绕零日漏洞的“巨型营销活动”。在他看来,持续性、后训练、harness 以及奖励信号可能才是决定性技术栈。Dan 还说,很多其他模型在漏洞被解释清楚后可能同样能够完成利用,但通过长期任务自行发现漏洞是另一回事。
  • 模型竞赛可能正在收敛,但真正的护城河正转向界面、工作流沉淀和用户惯性。 Meta 看起来仓促发布的 Avocado,被描述为大致与“Opus、5.4 和某个 Gemini”处在同一档,由此引出“四马竞逐”的问题。把 Claude Code 重新指向另一模型在技术上可能只需改一个 URL,但用户会积累知识文件、调整工作流、容忍可修复错误,并看重 Claude Code 控制电脑的能力,而不只是浏览器里的聊天功能。

精读

1. 如今是实习生指挥研究蜂群

  • Dan 介绍了 Terrence——一名在 NTU 主修 AI 与会计的学生,同时操作5个终端和3块屏幕。这个玩笑背后是组织方式的变化:“现在是实习生当老板了”,由他教智能体做财务建模,而不是亲自包办每一项任务。

  • Wags 是团队的“智能体研究总监”,负责监督处理财报电话会文字稿、新闻、事件、公司简报和财务模型的独立智能体。由于这些智能体只能经由主智能体通信,每个智能体只处理流程中的一个离散环节。这种分工让 SemiAnalysis 得以覆盖网络、TCO、数家交换机相关公司以及数十家光模块供应商,不必让单个上下文窗口吞下所有资料和操作指令。

  • 这套架构让公司智能体基本保持“洁净”。其他智能体负责搜集和总结材料,再保存一份涵盖模型、文字稿和公司简报的索引;公司智能体被唤醒后吸收这些输出,只保留关键内容,而不把“得出结论的过程”留在自己的上下文里。

  • 一次实时 AOI 查询返回了一份部分乱码的结果,提到“3.24亿”“1.2”,很可能涉及 Meta 和 Amazon,内容大多是前瞻性判断;Dan 说自己“得拿实际数据核对”。这次运行成本为3.52美元,若加上此前的启动工作可能达到10–15美元,却足以支撑他的经济性判断:即使成本达到15–20美元,他仍会选择它,而不是让分析师干上一天。

2. 离散技能正在复利成一套研究操作系统

  • 3个月前,Dan 还不是这么工作的。春节期间工作放缓,给了他学习工具的时间,这些工具原本是为了减轻团队工作量;“总结一场活动、搭建财务模型、监控新闻稿”等零散需求,逐渐变成覆盖财报、新闻、事件、建模和监控的可复用技能,最终成为 Wags 的组件。

  • 逻辑并不复杂:Dan 说,金融数据至今仍没有可靠的导入方式,而核验和修正导入数据,耗时可能超过直接手动录入。他的目标是在不制造过多包袱、让分析师失去行业视野的前提下,覆盖“60、80、100家公司”。人类应当少做数据录入和事件复述,多做“审核、编辑、思考、建立联系”。

  • 会议智能体 Claudia 处理的是没人有时间亲自消化的材料。SemiAnalysis 每年参加50–60场会议;仅 GTC 就有621场 session 和830场演示,但团队因为会面优先,GTC 一场 session 也没听。Claudia 会把演讲和 YouTube 链接转成文字稿,整理会议演讲者的可聊主题索引,还能找到关于 CPO 的演讲,尤其是使用 DWM 做 CPO 的内容。她也能为 Julian 整理一份 ScalaCross 简报,再由 Julian 向 Dan 汇报。

3. 信任提升速度快于可靠性和记忆能力

  • 主持人把态度转变定位在大约11月:SemiAnalysis 此前推动大家使用这些工具时,用户不信任任何输出;现在则倾向于默认相信,只有在风险足够高时才进行核验。他日益感到恼火的是:“现在我才是瓶颈”——模型想写代码、做分析、搭建系统,但真正限制它的是指令和任务设计。

  • Dan 给出的反例是一张生成后无法平衡的资产负债表。他不得不调查智能体是否把 FactSet MCP 数据与 SEC 文件混在了一起,团队也要求每次完成的模型迭代都经过监督检查。主持人的反驳很精准:这“不是分析师会犯的错”,因此如果把智能体完全当作初级人类员工对待,就会掩盖它们独有的失败模式。

  • 记忆是更棘手的结构性问题:“子智能体一旦关停,就结束了。”经验必须被写入记忆,但记忆文件不可能无限增长。Sam 在研究 neoclouds 时遇到的是反向问题:他的知识都留在 Claude 的对话里,于是他做了一个 skill,把这些经验搬进 flashcard app,以便刻意回忆和检索。

4. Token 需求可能先于企业生产率兑现到盈利

  • SemiAnalysis 称其每位员工消耗的 Token 超过 Meta 的2倍,团队把这种对比称为“token mogging”。Dan 将演示任务的经济性与 GPU 租赁价格拐点联系起来:即使总成本达到10–20美元,他仍会选择它,而不是让分析师工作一天。

  • 更广泛的采用仍处于早期。Dan 看到基金经理用模型做窄范围的摘要,但许多 Fortune 500 员工既没有 IT 审批,也没有能够随时间积累回报的工作流。如果 Meta、Amazon、Unilever、P&G 和 Boeing 都像 SemiAnalysis 一样深度使用 Claude,他认为,“唯一能缓解这一点的方式,说实话,就是大量芯片工厂。”

  • 在 SemiAnalysis 内部,效率提升让“积压的想法大坝”决堤。据称有一名员工连续运行 Claude Code 24小时;其他想法在1小时内就变成可分享的 Slack 链接,而智能体编码追踪基准测试以及 Accelerator 或 ClusterMAX 仪表盘,都在2–3小时内形成了可运行版本。

  • 主持人的保留意见值得记住:SemiAnalysis 能把更好的研究相对直接地转化为订阅收入,但一个距离 P&G 客户六层的人,可能会把50%的效率提升用来提前50%收工。Dylan 随后说,模型质量的提升反而让他对采用率感到悲观:“瓶颈其实不在输出质量”,而可能在于冷漠或激励错配。

5. 前沿能力取决于持续执行,工作流既有优势则成为护城河

  • Dan 发现 Mythos 的改进异常集中在编码和网络安全;其更广泛的能力提升“显著更少”,而系统卡据称表示这一结果并非有意设计。他质疑网络安全叙事是否部分只是营销:“如果我想让人们不要恶意使用某个模型”,就不会发起一场强调零日漏洞发现能力的宣传活动。一名 Stanford 网络安全研究人员曾警告他长期运行的智能体攻击,但这名研究人员及其朋友仍怀疑 Mythos 是否真正带来了模型质量的跨越式提升。

  • GPU kernel 编写和推理系统架构是另外两个平行前沿。AI 现在能产出大量领先的 kernel,这在6个月前还做不到;Dan 形容人类向 AI 的能力迁移总体上是一条“单行道”。不过,有经验的 kernel 作者即使使用 AI 仍然占据优势,单靠 Token 预算尚未让这项任务彻底商品化。

  • 长期任务中的持续性仍然不足:模型可能停止查阅文档和源代码,建议向维护者提交 PR,却无法解决已经记录的 bug。Dan 的结论是,两层能力都不可或缺:模型后训练必须奖励持续编码行为,而设计良好的 harness 则要提供维持这种持续性的工具和结构。

6. 模型竞赛可能正在收敛,但工作流会制造惯性

  • Meta 的 Avocado 发布看起来相当仓促,甚至出现了错误图表,但其水平已接近“Opus、5.4 和某个 Gemini”,意味着最难的追赶阶段可能已经结束。Dylan 认为它还不如最领先的两三个模型,但大致处在同一档;Dan 则说,Meta 看起来已经完成了最难的部分,剩下需要追赶的空间相对有限。

  • 切换 Claude Code 的配置在技术上可能非常简单——Dylan 形容只需改一个 URL——但积累的知识文件、预期行为以及对可修复错误的容忍,会共同形成用户惯性。Dan 的问题仍然没有答案:差异化是否会从原始能力迁移到“生态系统”“在位优势”和用户体验?

  • 硬件故事同时指向两个方向。Dan 说,在 Claude Code 热潮期间,Mac mini 在美国的交货周期约为3个月,在亚洲约为1个月。Dylan 则反驳说,Mac mini 并非必需,因为大多数模型算力都在云端运行,他甚至考虑改用 Chromebook。