先锋 趋势 方法 投研 作者
返回先锋
Henry Yin
投资人 3 场深度对话收录

Henry Yin

硅谷投资人 / 创业者

前沿洞察

基模巨头正以全栈集成与标准框架通吃通用Agent脚手架,依托操作系统级分发吞噬浅层套壳空间;初创企业的真正壁垒转向专有工作流沉淀,以及身份、可观测性与“失败记忆”等闭环控制点。伴随高频调用将极端成本优势转化为杀手级杠杆,个人端正迎来软硬件协同的“iPhone时刻”,但安全与遗忘缺陷仍是规模化扩张的生死关口。

观点集合

156: 与 Henry 的「AI季报 26Q1」:OpenClaw、OpenAI vs Anthropic的三重对阵、自进化

  • 🗓️ 日期2026-03-31 | 🎙️ 节目:晚点聊 LateTalk

OpenClaw把本地权限、聊天入口、长期记忆和工具循环组合成“AI Agent的iPhone时刻”,Anthropic则凭Claude Code收入飞轮正面威胁OpenAI。coding Agent的胜负将取决于完整工程循环的可靠性、推理成本与生态分发;AutoResearch已验证小规模自进化,但持续学习和安全仍未突破。

查看访谈对话精读提要
  • OpenClaw 是 26Q1 最重要的应用信号:它没有发明新的 Agent 技术,却把本地权限、聊天软件、长期记忆、定时任务和工具循环组合成了“AI Agent 的 iPhone 时刻”。 Henry 称其 GitHub Star 约六十天超过 React 十年积累,核心变化是让“AI 来到你的生活,而不是你去找 AI”;它既证明个人 Agent 的大众需求,也为 Claude Code、NVIDIA 和 OpenAI 标出了产品路线。

  • Anthropic 本季从“技术上受尊敬的挑战者”变成了足以正面威胁 OpenAI 的平台型对手,驱动力主要不是 benchmark 领先,而是 Claude Code 的产品—收入飞轮。 节目给出了多组口径:Henry称 Anthropic 收入增长大约以每月 50 亿美元的速度增长;曼祺称 Claude Code ARR 从 2025 年 12 月的 9 亿美元升至 2026 年 3 月初的 19 亿美元,Henry另称 Claude Code 约 25 亿美元 ARR。OpenAI 则从 214 亿美元升至 250 亿;Anthropic 约 70%-75% 的收入来自 B2B 和 API。

  • Opus 4.6 与 GPT-5.4 的对阵揭示了 coding Agent 的真正胜负手:不是一次生成多少好代码,而是谁能更可靠地完成规划、改 bug、跑测试、读日志和提 PR 的完整工程循环。 Opus 4.6 有 one million context、据称可连续工作约 15 小时;GPT-5.4 在 OSWorld 得到 75%、高于节目所引人类的 72.4%,纯 coding 又常被认为更强。开发者却用 Claude Code 规划、调用 Codex 执行,形成“主人是 Claude Code,奴隶是 Codex”的尴尬分工。

  • Agent 的高频、多轮推理把价格重新变成模型份额的决定性变量,中国模型因此在 OpenClaw 生态获得了真实分发窗口。 MiniMax M2.5/M2.7 的输入、输出价格约为每百万 token 0.2/1.2 美元,对比 Opus 4.6 的 5/25 美元约差二十倍;节目估算切换后月成本可从 200 美元降至约 15 美元。“成本差二十倍乘以调用次数”,足以让阶跃、MiniMax、Kimi、智谱和小米进入 OpenRouter 的 OpenClaw 用量前列。

  • AI 自进化已经从科幻命题变成可跑通的小规模工程循环,但现阶段仍依赖人类限定目标和搜索空间。 Andrej Karpathy 的 AutoResearch 每次约 15 分钟、每晚可跑近 100 个实验,找到二十多个有效改进,把一个 GPT-2 级模型的训练时间缩短约 17%-20%;它最适合性能、kernel、数据库查询等“指标明确、反馈快速、结果可自动验证”的任务,是“加速度的加速度”,还不是自主选择研究方向。

  • 算力投资的主线正从训练转向推理,而且 Agent 会同时拉动 GPU、CPU、存储和安全基础设施。 Henry 转述 Vera Rubin 平台的推理性能提升约 3-5 倍、token 成本下降约十倍,Google 的 KV Cache 量化工作又可能把存储需求压到原来的六分之一;由于“everything is becoming a computer”,Agent 写完代码还要开 sandbox、执行程序,CPU 也可能短缺,他听到的一个投资思路是寻找 Arm 这类相对纯粹的敞口。

  • 企业组织已经开始把 AI 收益兑现为裁员和人才结构重排,这既抬高头部人才议价权,也可能压缩中间层岗位与传统 SaaS 利润。 Henry列举 Amazon 裁 1.6 万人、Block 裁 40%、Meta 拟裁约 20%即 1.5 万人并把 AI capex 加到约 650 亿美元;曼琪观察到中国创业公司也在从“一流加二三流”转向“超一流加 Agent”。这不是简单降本,而是资本、收入和湾区房产都可能进一步两极化,甚至催生“按 token 征税”的政策讨论。

  • 🔗 原始收听与视频来源: 156: 与 Henry 的「AI季报 26Q1」:OpenClaw、OpenAI vs Anthropic的三重对阵、自进化

收听完整访谈 →


146: Gemini 3翻盘背后、Agent需要什么大模型、RL创业机会|与前 Google 创业者、硅谷投资人聊湾区动向

  • 🗓️ 日期2025-12-26 | 🎙️ 节目:晚点聊 LateTalk

Gemini 3把长上下文、成本效率、多模态和开发者入口整合为产品优势,TPU、模型基础设施与Workspace形成长期协同。GPT-5.2的GDPval从38.8%升至77.9%且任务成本下降,但benchmark仍可能偏离生产;企业私有工作流、RL环境与To Agent工具层构成下一阶段机会。

查看访谈对话精读提要
  • Gemini 3 Pro的意义不是某项 benchmark 领先,而是 Google 终于把长上下文、成本效率、多模态、生成体验与开发者入口合成了一个“across different dimensions 达到 SOTA”的产品时刻。 嘉宾把翻盘归因于长期 co-design:TPU—模型 infra—应用垂直整合,Workspace 与多种硬件 surface 又持续回流数据;Google Labs 则用编辑、作家和擅长创作爆火帖子、作品的人打磨传播。更重要的信号是,团队称 pre-training 仍“no war in sight”,这不是一次性追平。

  • GPT-5.2的 benchmark 跃升只有放进成本曲线才有意义:GDPval 从 GPT-5.1 的 38.8% 升至 77.9%,ARC-AGI-2 从 17.6% 升至 52.9%,且同等任务的实际成本反而下降。 嘉宾认为这体现的是更高的“intelligence per token”,而不只是靠 test-time scaling 暴力搜索;但 GDPval 的问题分布与文档入口仍可能偏 toy,模型连 Garlic 有几个 r 都只能概率性答对,“AGI 还有 long way to go”。

  • 基础模型会持续内化通用 Agent scaffolding,却很难吃掉企业私有工作流形成的 heavy tail。 模型厂商能用 mock 工具交互训练出“自己的 shortcut”,但企业独有、不可公开的数据仍留下长期 gap;Cursor 等 Agent 拥有场景和用户,反过来又能推动模型强化 coding、debugging 与 multi-step 能力。因此“模型和 Agent 是相互成就的”,值得押注的是模型吞并旧功能后仍扩大的净增量市场。

  • Precur押注的是可训练工具层:工具不再是静态 API,而要记住“自己曾经在哪里跌倒过”,把 failure trajectory 沉淀为企业资产并自我迭代。 其 code-driven tool 试图降低长任务中的 context pollution,在早期客户的 blind evaluation 中相对原工具取得约 12% 提升,同时降低 latency、扩大 coverage,且无需更换现有 Agent。终局定位不是 To C 或 To B,而是服务由人和 vibe coding 批量创造的“To Agent”市场。

  • 强化学习创业正在从“继续榨数据”转向争夺 interaction、reward 与高保真环境,机会被拆成 RL environment、RL as a Service 和高价值垂直应用三层。 环境层是未来智能体的“练习基地和考试中心”,但复制 Jira 已不再构成门槛,网络安全攻防、机器人和自动驾驶仿真更依赖领域知识;服务层解决企业不会自研 RL,应用层则瞄准药物、交易与 science discovery。Moe Capital 已沿此逻辑投资 Preference Model,Periodic Labs 被作为第三类代表。

  • Agent选模型首先是云、折扣和生态问题,其次才是榜单:企业数据迁云常需一至两年,Azure、GCP的既有关系足以压过短期模型领先。 Claude 的优势也不只是写代码,而是 MCP、programmatic tool calling、Claude Code 与开发者范式形成的闭环;实时 Agent 则常宁愿选 Gemini Flash、OpenAI mini 等低延迟模型。Qwen 等中国开源模型提供尺寸选择和做 ablation 的空间,团队也会基于开源模型做 post-train;美国企业的政策限制和价值观顾虑仍给“美国版 DeepSeek”留下空间。

  • 下一轮 Agent 能力竞争集中在原生 long-horizon、多模态和可 post-train 的开放模型,而不是只靠再叠一层脆弱脚手架。 开发者需要训练中就见过大量 Agent trace 的开源底座,也需要模型直接理解脏 PDF、图像和混合模态,并在十几步任务中持续规划、行动和修正。即使模型把部分 context engineering 内化,框架使用数据仍会反哺模型训练;嘉宾的判断是,可服务范围扩张会快于被基础模型吃掉的部分。

  • 🔗 原始收听与视频来源: 146: Gemini 3翻盘背后、Agent需要什么大模型、RL创业机会|与前 Google 创业者、硅谷投资人聊湾区动向

收听完整访谈 →


137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6

  • 🗓️ 日期2025-10-16 | 🎙️ 节目:晚点聊 LateTalk

OpenAI以Agent Builder、ChatKit、评估和微调工具打通构建到优化的标准链,降低企业落地门槛,也可能压缩部分创业公司的性能护城河。Apps in ChatGPT借8亿周活获得操作系统级分发,Composio、LiveKit和Letta分别切入工具调用、实时语音与记忆,但平台依赖和可靠性仍是关键风险。

查看访谈对话精读提要
  • OpenAI 正把 Agent 的构建、部署、评估与优化压缩成一条标准化生产链。 Agent Builder 用拖拽式 workflow 编排 classifier 和 if/else,ChatKit 解决前端交付,datasets、trace grading、prompt 优化与 reinforcement fine-tuning 构成反馈闭环;Henry 的概括是,OpenAI “练出了一身武功,然后想把它传授给广大的开发者”。这会降低企业落地门槛,也可能让原本属于 Agent 创业公司的部分性能护城河逐渐标准化。

  • Apps in ChatGPT 的核心资产不是新 UI,而是 8 亿周活带来的操作系统级分发。 相比 2023 年多数只是“prompt 的包装”的 GPTs,新 Apps SDK 基于 MCP,加入 OAuth-style 授权、外部工具与交互组件,使 Canva、Figma 等应用能提供更完整的应用体验;但商业分成仍处实验期,所谓未来抽成 30% 只是类比 iOS 的推测。开发者同时面对数据与留存不对称:“有点像在别人家的地基上建房。”

  • Agent Builder 暴露了 OpenAI 商业化与 AGI 路线之间的真实张力。 AGI 路线希望模型吞掉人工写死的流程,Claude Code 式通用 Agent 会随底层模型升级直接变强;Agent Builder 却把流程画成图,优点是安全、可解释、今天就能卖给大客户。Henry 称其为一次“非常务实的转身”:OpenAI 既要追自主智能体,也要用当前企业收入支撑约 5,000 亿美元估值及更大的野心。

  • Agent Tooling 可能从约 200 亿—300 亿美元的 DevTools 子市场,跃迁为长期 2,000 亿—5,000 亿美元市场。 嘉宾的推演以全球约 6,500 亿美元软件收入、DevTools 占中低个位数百分比为起点,再引用软件因吞入服务业而可能扩至 10 万亿美元的判断;若工具层占新市场约 5%,规模可增长 10—15 倍。最有机会的不是工具拼盘,而是卡住身份、通信、观测或评估节点,并形成“越用通过率越高、成本越低”的数据闭环。

  • 工具生态正在从“能调用”转向“能完成任务”,Composio 是这一迁移的典型样本。 它用 Agent 自动编写、修复 MCP server,再以 Rube 充当“one MCP server to rule them all”,让 Cursor 根据任务从数百个 server 中选工具;这既缓解上下文和 token 压力,也把可靠执行变成产品。MCP 更适合高成功率、尤其带写操作的关键流程,browser use 则补足未开放接口的长尾网站,二者更可能长期共存。

  • 语音已经出现可量化的基础设施放大效应,LiveKit 一年内从每天承载约 100 万次语音通话增至 2,000 万次。 它不主要生产语音模型,而是承载实时音视频、turn detection 与 orchestration;其客户覆盖 Character.AI、Grok,并称支撑约 25% 的 911 traffic、平均每周帮助抢救一条生命。终局被判断为 speech-to-speech,但可插入 guardrails、成本和行为更可控的 STT→LLM→TTS cascade 仍有明确商业寿命。

  • Evals 与记忆不是附属功能,而是 Agent 从 demo 进入生产环境的控制层。 一个较大客户仍可能只让工程师试打三四通电话就发布,原因是标注数据昂贵、团队难对评分集达成共识,主观复杂任务又比 coding、数学更难验证;OpenAI 以 11 亿美元收购 Statsig,说明 A/B testing、灰度发布和指标闭环正在内建化。Letta 的 “sleep-time compute” 则代表另一条路径:Agent 在无人交互时花 token 整理长期记忆,把状态持续转化为可复用能力。

  • 🔗 原始收听与视频来源: 137: Agent 是机会,造 Agent 的工具也是|从OpenAI开发者日聊起|Agent#6

收听完整访谈 →