语言、coding、多模态,到底谁坐AI的主桌?---狂喜98页PPT-solo
摘要
- 过去半年,AI 的主桌明确转向 coding,而决定胜负的已不只是模型能力,而是“基座模型 + harness = agent”。 模型像发动机,harness 则补上权限、skills、工具、记忆、反馈与任务编排,把“被询问的对象”变成“行动的主体”;当 coding agent 与通用 agent 的边界越来越模糊,coding 的可服务市场也从写代码扩展到几乎一切数字任务。
- Anthropic 已在最硬的收入指标上反超 OpenAI,AI 龙头竞争由 ChatGPT 的 C 端统治转入 Claude 的 B 端攻城。 现场口径为 Anthropic ARR 约 300 亿美元、OpenAI 约 250 亿美元,虽有云渠道费用等统计差异,趋势仍清晰;与此同时,ChatGPT 仍有约 9 亿周活、71% 月留存。Anthropic 的说法是:“收入代表一切。”
- 模型竞赛的计时单位已从半年缩短到两个月乃至按月,中国厂商的核心筹码则是开源与成本。 GPT 5.5、Claude 4.7、Grok 4.3、Kimi K2.6、千问 3.6、DeepSeek V4 等密集登场;DeepSeek 不再负责“把天花板捅漏”,而是在更低成本下做 Pareto 最优,公布价格后又直接打到“二点五折”。
- SaaS 的杀估值并非普通周期回撤,而是市场开始怀疑整个商业模式会被 Service as Software 反转。 软件板块一度以约 20% 跌幅垫底标普,部分公司跌去四分之三,Figma 接近跌九成;原来六个月、50 万美元的软件项目,低代码压到六周、5 万美元,Web coding 再压到六小时、50 美元,“AI 吞噬软件”因此进入现金流与估值模型。
- Mag 7 和信息科技的风险已经从收入增长转向 CapEx、自由现金流与回报周期。 三家头部云公司加 Meta 一年投入约 3000 亿美元,微软一季度跌约三分之一,英伟达 forward P/E 一度只有 17 倍;但标普又在 4 月 17 日创新高、英伟达重回 5 万亿美元,也呈现了“哪怕剧烈回调,也会非常短时间拉回来”的阶段性判断。
- 算力交易正在从纯 GPU 扩散到 CPU、存储和光,但物理世界会成为估值兑现的硬约束。 Agent 时代的服务器配比被概括为从训练期“1 个 CPU 配 7—8 个 GPU”、推理期 1:4,走到 Agent 期 1:1;英特尔、AMD、ARM 因此重估,但制造、封装、电力、审批和施工延误意味着“建设 1GW,不是那么容易的事情”。
- 一级市场比二级市场更狂热,也更集中:2026 年 Q1 投资约 3000 亿美元,前五大基金和前五大项目各拿走约四分之三。 OpenAI 估值约 8000 多亿美元,Coatue 一位投资人给 Anthropic 的 2030 年目标是 2 万亿美元,SpaceX 与 OpenAI 未上市已可进入全球最值钱公司前十五;庄明浩不判断泡沫顶点,只提醒若此刻类似 1999 年,“最疯狂增长期”也可能尚未结束。
- 技术狂喜正与就业、能源、社会情绪正面碰撞,焦点也转向经济增长与工资福利是否脱节。 AI 短剧单日投流逼近 1 亿元,美国多州讨论限制数据中心,“恩格斯暂停”可能重演;但庄明浩拒绝把人的 40 年压成“历史的一页”,最后的态度是:“正确而不会出错的事情交给它吧,我们去做那些能出一点错的事情。”
精读
1. AI 的叙事周期已从三个月压缩到三十天
庄明浩原本每三个月整理一次行业:2025 年 11 月讲完,2026 年 1 月又做年度总结,春节后 3 月 9 日再更一版,不到两个月便必须重做这份 PPT。“三十天河东,三十天河西,都不是三十年,是三十天。”
变化快到标题也会过期:4 月初还想写“你能养龙虾了吗”,制作过程中已改成“你的龙虾还活着吗”。OpenClaw 从新鲜事迅速变成“上个时代的事情”,正是这一轮加速的缩影。
他沿用“三张桌子”的框架:语言对应 ChatGPT,coding 对应“一年内 AI 可能写出所有代码”,多模态对应“世界模型是孕育 AGI、能无限拓展的学习子宫”。这次则改用技术、产业、资本三条线判断谁坐主桌。
2. Agent 已从年度主题变成整个行业的默认方向
从千问“From Question to Action”到腾讯“AI 从 chatbot 迈入 agent”,庄明浩认为 2026 年最大共识已无需论证:行业正在从语言回答进入任务执行,AI 的价值单位也由一次对话变成一个可完成的行动。
OpenAI 的分级提供了时间轴:L1 chatbot、L2 推理、L3 agent、L4 研究者、L5 组织者。GPT-3.5 来自预训练;o1 于 2024 年 9 月把后训练和强化学习推到中心;DeepSeek 在 2025 年 1 月底之后,让 L2 推理成为标配。
进入 L3 后,训练目标变成“agentic thinking”:模型要判断何时停止思考、何时行动,选择工具及调用顺序,从有噪声的环境获得观察,失败后修订计划,并在多轮、多工具调用中保持连贯。
庄明浩把林俊旸离职后的文章与硅谷共识接在一起:这些能力最终都指向模型自主学习。提示词工程、上下文工程和强化学习环境仍重要,但已成为更大执行系统的底层部件。
3. Harness 把强模型从发动机装进了一辆车
Ahead of AI 的比喻是全场最清楚的解释:L1 模型像能转的发动机,L2 是 F1 发动机,但 agent 要真正上路,还需要轮子、传动轴、方向盘、车壳和轮胎;模型之外这整套结构就是 harness。
庄明浩引用的公式是“基座模型 + harness = agent”。基础模型能推理、生成、理解,却“静态、被动且无方向”;harness 用结构、方向和约束,把无限可能收束为有限且有目的的活动,使 AI 从“被询问的对象”变成行动主体。
一辆可用的 agent 之车至少包含权限围栏、skills 封装、工具调用、记忆系统、评估反馈和任务编排。它不仅要记住用户是谁和任务标准,还要能持续循环、自我纠错。
这也重画了 infra 的边界:过去一级市场把服务 agent 的项目称为 AI infra,如今上下文管理、记忆、持续学习、护栏、编排乃至评估都被纳入 harness。“Harness 现在是新的 infra 了。”
4. Agent 生态正在吞并软件开发与通用应用的边界
世界模型是另一条升温支线:行业希望获得语言之外、能够 touch 到的视频流、3D 或虚拟世界。相关尝试可追溯至 2019 年,近年则扩展到 World Labs、腾讯混元、Seed 2.0 后续版本及阿里的相关模型。
OpenClaw 本身就是典型 harness:IM 软件接入网关,下接模型、多 agent、记忆和工具调用,再分成交互、网关、智能体与执行层。它不造模型,只造“壳子”与“车”。
Claude Code 代码被“意外”泄露后,外界拆出的多层架构同样表明,它的能力来自 Claude 模型与优秀 harness 的叠加。庄明浩转述业界玩笑:“Anthropic 变成了真的 OpenAI”,因为今天的 OpenAI 已不太 open。
2026 年 Q1,GitHub 热门项目的注意力几乎全部流向 agent:约 40% 的相关项目围绕 agent 模型生态;扩至最受关注的 1000 个项目,粗略标注约 81% 与 agent 有关,关键词反复是 agent、Claude、code、skill、OpenClaw。
5. Coding 已经成为收入最大、外延最宽的 AI 战场
Coding 从 GitHub Copilot 式代码补全,走向完整生成、评审、debug 和需求管理。收入维度更直接:coding 的 AI 收入比第二、第三和第四名加在一起还大;其余类别还包括法律、客服、医疗、搜索和写作,因而是“绝对的主桌”。
GitHub 上经 Claude Code 提交的代码量,从年初到 3 月底增长超过三倍;同期新网站、iOS App 和 GitHub 代码一同上升。已经沉寂多年的 App 供给重新爆发,因为开发能力被下放,“哪怕有人做过,我也想做个自己的”。
Codex 最新周活约 400 万;Claude 自 Claude 4、Claude 4.5 前后持续拉出“挡不住”的增长曲线。头部 agent 已能在无人辅助下连续执行十几个小时,软件生产单位开始从人天转向 agent 运行时长。
更大的变化是 coding agent 与通用 agent 合流:Claude Code、Codex、Trae 可以做 PPT 和信息整理,Manus、Genspark、扣子也能借代码完成任务。用户不在乎实现路径,“只要解决了就可以了”。
6. Anthropic 以 B 端收入反超,ChatGPT 仍牢牢占据 C 端
现场引用的最新 ARR 为 OpenAI 约 250 亿美元、Anthropic 约 300 亿美元。两者可能存在是否扣除云渠道费用等口径差异,但从 2025 年下半年起,Anthropic 的斜率已明显更陡,反超比市场预期提前到 2026 年 Q1。
ChatGPT 的古典互联网指标仍极强:约 9 亿周活,月留存约 71% 且继续上升,DAU/MAU 与总使用时长均领先。Gemini 的占比虽扩大,绝对规模仍未动摇 ChatGPT。
Anthropic 的回答是这些指标“不重要”:其 ARR 从 2025 年底到 2026 年初增长约 10 倍,若只看 3 月约增 16 倍。企业端覆盖迅速追近 OpenAI,默认首选模型更在 2026 年 1 月发生交叉,此后两者分道扬镳。
发布节奏也体现了巷战强度:Claude 在五十多个工作日发布七十多个功能和产品,平均每天约 1.5 个。“睡醒一睁开眼,Claude 又发新版本了”,今天的版本干掉昨天,明天再干掉今天。
7. 两大模型公司都选择 All in One
OpenAI 把 ChatGPT、Codex 与浏览器逐步合并:Codex App 打开就是自然语言对话框,最新版本又内嵌浏览器。原本内部并列的三项核心产品,正在收敛成一个任务入口。
Anthropic 的路径则是把第一方 harness 商品化:既提供最强模型,也提供基于 Claude 的外围“车”,并直接从这一层收费。第三方仍可造壳,但模型公司不可能把利润池完全让出去。
庄明浩由此看到同一终局的两种组织方式:OpenAI 从 C 端超级入口向 coding 与浏览器扩张,Anthropic 从模型和企业服务向执行系统外扩;共同目标都是占据从意图到完成任务的整条链。
8. 模型发布已由半年一代压缩到按月迭代
春节前一个月,中国头部厂商集中更新:1 月 22 日文心 5.0、1 月 27 日 Kimi 2.5、2 月 2 日阶跃 3.5、2 月 11 日智谱 GLM-5、2 月 13 日 MiniMax 2.5、2 月 14 日 Seed 2.0、2 月 16 日千问 3.5。此前大版本仍大致以半年计。
到 3 月中旬 MiniMax 已推 2.7,距 2.5 仅一个多月;4 月又密集出现千问 3.6 Plus、Claude 5.1;原文随后又说“千问 5.1”于 4 月 7 日发布,名称口径含混;还包括千问 3.6 的 35B 版本、Claude 4.7、Grok 4.3、千问 3.6 Max、Kimi K2.6、GPT 5.5 和 DeepSeek V4。“再往后就是按月。”
庄明浩提醒,发布版往往只是已经训练完成的上一代;厂商手里还有已训好待测和正在训练的两代。因此排行榜后段十多家厂商密密麻麻挤在一起,领先线也几乎每天上移。
GPT 5.5 的口碑出现逆转,DeepSeek V4 也终于兑现此前等待。他在 3 月版本里写过“V4 不等了”,这次的变化不是修辞,而是版本迭代窗口已经短到一次演讲准备期便能跨代。
9. DeepSeek 与中国开源模型主攻成本曲线和生态控制权
DeepSeek V4 的意义不是再次“把天花板捅漏”,而是在较低成本下取得极高分数,尤其小规模版本落在能力—价格的 Pareto 前沿。公布 token 价格后又迅速打到“二点五折”,把能力扩散继续当成角色核心。
对模型“太危险不能发布”的说法,庄明浩认为其中“肯定有一定的营销成分”;但他保留了反面可能:模型强到能发现 27 年来没有人发现的软件漏洞后,发布前做更多安全测试或许确实是必要的。
下载量、模型占比和能力排名都显示,中国厂商在开源板块非常强势,千问与 DeepSeek 是代表。美国国会相关听证会把美国缺席开源描述为向中国“拱手让出”,开源因而不再只是软件策略,而成为中美 AI 竞争的战地。
10. Sora 的关闭不是终局,Image 2 展示了知识与图像真正同桌
A16Z 的流量榜仍显示图片与视频是最大应用板块,但庄明浩认为 DAU 榜单价值正在下降。Sora 大约于 3 月 28 日或 29 日关闭后,“留存差”“AI 抖音不成立”等判断大概率正确,却也可能只是“人总会死”式的正确废话。
真正值得研究的是 OpenAI 的动态取舍:产品与组织架构如何调整,有限 token 如何在训练、研究和用户服务之间分配,以及一家具备特定估值与竞争位置的模型公司何时收缩。关闭 Sora,是为了避免摊子过大、进一步落后 Anthropic。
Image 2 随后带来反转。一句“生成抖音直播截图”的提示词,就能画出央视大楼前售卖 39.9 元北京一日游的中年女性,并准确处理评论、点赞、红包、在线人数、排名和小黄车,显示它理解的不是画面,而是产品 know-how。
《原神》《鸣潮》《洛克王国》《黑神话:悟空》联动海报更极端:模型不仅生成视觉,还写入米哈游、库洛、腾讯、游戏科学的版权说明并处理大小写。“多模态和语言是一桌”,Image 2 在世界知识上甚至显得比 Nano Banana 更进一步。
11. 垂直 AI 的收入兑现首先出现在高价值知识工作
从 0 做到 1 亿美元 ARR 所需时间不断缩短,Legora、Harvey 等法律 AI 公司刷新记录。Harvey 在不到两年内,从 A 轮融资 5000 万美元走到约 110 亿美元估值,成为“当时就应该投、但没有办法投”的典型遗憾。
CIO 调查显示,企业最想砍 IT 和 SaaS 预算,最不愿砍的是安全预算;释放出来的钱继续流向 AI。庄明浩引用的替代框架认为,最危险的是已经外包、又主要依赖信息搜索的工作,保险和 IT 服务首当其冲。
依赖人类判断的外包工作短期更像 Copilot,内部判断型岗位仍处观察期;下一波则可能吃掉内部的信息型工作。结论不是某个行业绝对安全,而是“几乎包含所有垂直行业,只是先后的问题”。
12. SaaS 的估值崩塌源于商业模式被反向书写
截至 2026 年 2 月底,软件是标普 500 表现最差板块,跌约 20%;大量知名 SaaS 公司跌去四分之三,Figma 跌了 80% 多,可能接近九成。部分公司已落到约 10 倍 P/E、明年约 4 倍 P/S,即使毛利仍接近 70%。
ServiceNow 的收入持续稳定增长,P/E 却从峰值约 132 倍压到 23 倍,随后财报后再跌十多个点。自 2025 年 Q2 起,财报电话会上“AI”的提及度超过“盈利”,市场开始拒绝为传统增长兑现买单。
这与软件长期的优等生历史形成冲突:平均收入增长约 17%,标普其他公司约 6%;平均毛利约 74%,订阅模式还提供极高可预测性。正因基本面仍好,这轮下跌才不只是普通业绩衰退。
庄明浩给出的成本梯度是:传统开发六个月、50 万美元,低代码六周、5 万美元,Web coding 六小时、50 美元。“Software as a Service”由此反转为“Service as Software”——用户购买结果,软件本身可现场生成。
13. Mag 7 被重估的不是收入,而是自由现金流
2023 年 Mag 7 引领市场,2024 年优势收窄,2025 年让位于 AI 软件与能源,2026 年 Q1 则全部下跌。微软跌约三分之一,是 1998 年以来最差季度;庄明浩说,除 Copilot 做得不够好之外,微软并没有做错什么,市场更在意投入回报。
三家云公司加上“不顾一切投入”的 Meta,一年 CapEx 约 3000 亿美元。收入和经营现金流仍可增长,但自由现金流被数据中心吞噬,短期又无法回收,市场于是重新定价整个 Mag 7。
英伟达收入继续增长、两次财报均超预期,股价却曾在 180—200 美元横盘九个月,forward P/E 一度只有 17 倍。微软、亚马逊、Google、Meta 约 20—30 倍,而沃尔玛、Costco 在收入仅预增 4%—9% 时获得 40—50 倍。
这组反差提出的是市场到底“在买什么、又在怕什么”:英伟达收入预期约增 70%,现场引用的规划甚至从 2026 年两千多亿美元指向 2027 年 1 万亿美元,但资金仍更愿意给传统消费确定性溢价。
14. 科技溢价消失后,回调又被一周迅速抹平
2026 年 Q1,信息科技板块超过 90% 的公司收入超预期,英伟达、苹果、高通、微软、Google、亚马逊、Meta、特斯拉却普遍下跌。标普单股盈利仍涨,自由现金流却明显下降,科技股 P/E 也回落至标普平均。
市场剩下最明确的两条线是存储和光:SanDisk、西部数据、希捷、美光领跑,光模块公司同步上涨,A 股中际旭创也受同一逻辑驱动。它们是数据中心 CapEx 最直接的交付环节。
但截至 4 月 17 日,标普 500 已重回历史新高,英伟达突破 200 美元并回到约 5 万亿美元。庄明浩引用王慧文“人类容易用历史经验过度简化概率预测未来”,并重提自己的判断:剧烈回调也可能被极短时间拉回。
15. 数据中心成为 token 工厂,CPU 被 Agent 拉回舞台中央
2026 年,美国数据中心投入超过办公室投入,此后两条曲线将继续分叉:“给硅基世界的办公室在暴涨,给人类的办公室在跌。”未来五年,AI 训练与推理可能占数据中心需求的 60%—70%,token 直接对应收入。
微软、Google、亚马逊、Meta、Oracle 五家掌握的算力约占市场 60%—70%;即便把中国视作一个整体,规模也只与 Oracle 接近。老一代 H100 上季度租赁价格仍涨,显示供需远未转松。
训练型数据中心通常约 1 个 CPU 配 7—8 个 GPU,推理和强化学习阶段约 1:4,Agent 编排与任务处理则走到 1:1。Harness 需要更多外围计算,CPU 因而变得更重要。
英特尔财报后涨约 20%,AMD 跟涨约 14%;年内英特尔翻倍、ARM 涨约 68%、AMD 涨约 50%。英特尔股价超过 2000 年互联网泡沫高位、P/E 超过 100 倍,接近当年思科 117 倍的疯狂水平;庄明浩只把它定义为适合有勇气者的短期高波动交易。
16. 物理约束会卡住最宏大的算力叙事
云厂商可以快速上调 CapEx,半导体和数据中心却受先进制造、封装、产线设计、政府审批、工人、电力与发电机限制。“建设 1GW,不是那么容易的事情。”
现场统计称,2025 年美国超过一半的数据中心项目延期。Stargate 规划的多个基地在卫星图上大多进展有限,原先约 5GW 的叙事,在接近两年后真正运营的可能只有约 0.3GW。
数据中心也开始遭遇社会反制:密歇根州通过截至 2027 年 11 月的暂停建设措施,背景是当地电价一年上涨约 17.6%;全美约 11—12 个州正在认真讨论禁止或暂缓建设。
庄明浩把这些限制视作科技故事遗漏的成本:电价、环境、社区与生活质量不会自动服从模型 scaling。甚至围绕 AI 已出现抗议,Sam Altman 住所还被连续以燃烧瓶和枪击方式袭击,冲突正在从财务报表进入现实社会。
17. 私募资本把 AI 推向更集中、更接近泡沫的位置
2026 年仅过去四个月,一级市场柱状图已像完整年份;Q1 投资约 3000 亿美元,创历史季度纪录,甚至超过 2021 年放水期。前五大基金募走约四分之三资金,前五大项目也拿走约四分之三。
私募市场自己的“Mag 7”几乎全是 AI:SpaceX、OpenAI、xAI、Databricks、Anthropic,加上同样受益于 AI 支付增长的 Stripe。YC 项目则从 AI 与其他并列,变成“只有 AI,没有其他”,占比超过 95%。
OpenAI 约 8000 多亿美元估值对应约 250 亿美元收入;SpaceX 与 OpenAI 未上市,已足以进入全球最值钱公司前十五。Coatue 一位投资人给 Anthropic 的目标是 2030 年 2 万亿美元,而 Anthropic 在一级市场已可达到近 1 万亿美元估值;就在当天,Google 又加码投资 400 亿美元。
庄明浩不回答市场究竟在山脚、山腰还是山顶。若类比 1999 年,泡沫确实更近,但也意味着“最疯狂增长期”可能尚未来临;一级市场的循环融资网络只让这张表更复杂。
18. AI 狂喜最终落在人如何度过自己的四十年
书店里 OpenClaw 相关书籍立着摆,豆包这类书只能横放,几个月后两者又可能被新品替换。庄明浩把畅销解释为“巨大的焦虑”,因为技术水位已“淹到脖子”,学习速度永远追不上版本更新。
红果短剧宣布拿出 5 亿元扶持真人短剧,同一天又取消 AI 剧与真人剧分榜,热门前十可能已有六七部 AI 剧。4 月 15 日 AIGC 总消耗约 9968.92 万元,很快可能稳定超过 1 亿元;所谓扶持反而暴露真人内容已成弱势方。
他借“恩格斯暂停”描述可能的过渡:新技术推动 GDP 上涨,普通工人的工资福利却可能四十年不变。但他拒绝“历史的一页就是很多人的一生”这种上帝视角——四十年不是一页纸,而是每个人完整且不可替代的一生。
狂喜活动里的 AI 内容占比从约 12% 降到 6%,这次更低;庄明浩认为这不是无知,而逐渐成为一种态度。既然 AI 越来越擅长正确且不出错的事,“我们就把那些正确而不会出错的事情交给它吧,我们去做那些能出一点错的事情。”