先锋 趋势 方法 投研 作者
返回先锋
Logan Kilpatrick
研究员 3 场深度对话收录

Logan Kilpatrick

Google DeepMind · AI研究员

前沿洞察

Google正以自研TPU、全栈分发与极致性价比(Flash系列)发起基建歼灭战,将“每美元、每秒智能产出”转化为核心壁垒;长上下文推理与低延迟多模态直击智能体架构,使模型不断吞噬应用层脚手架。应用层创业唯有聚焦场景快速变现,警惕底座软硬件深度绑定构筑的生态锁定与定价权转移。

观点集合

模型吞噬脚手架:DeepMind 的 Logan Kilpatrick 与 Tulsee Doshi 谈 3.5 Flash、Omni 等

  • 🗓️ 日期2026-05-20 | 🎙️ 节目:The Cognitive Revolution

Gemini 3.5 Flash 以约每秒280个 token、约为其他大型模型3倍的速度和更低成本抢占首发,押注每美元、每秒的智能产出。Antigravity 将共享 agent 编排框架推向 Gemini Spark、AI Studio 和 Agents API,Google强调保留框架多样性,但共优化带来的迁移成本与定价权仍待验证。

查看访谈对话精读提要
  • Google 以 Gemini 3.5 Flash 打头阵,是因为它同时强调经成本调整后的性能与前沿模型级质量。 Tulsee Doshi 表示,响应变慢会拖累 Search 和 Gemini 的实时实验,“即便模型在能力上强得多”,而 Flash 的速度约为其他大型模型的3倍,价格也显著更低。她提到 Artificial Analysis 上“我想是每秒280个 token”的成绩——快到 agent 可能在她来得及取消前就已经跑完。

  • 没有 Ultra 品牌,不代表 Google 停止扩展前沿能力。 Logan Kilpatrick 认为,模型命名归根结底是“营销”:Pro 已变得更大、更强,Deep Think 则增加了测试时扩展;在内部,Pro 影响 Flash,Flash 又通过蒸馏影响 Flash-Lite,同时配方也可以向上扩展。Google 的产品组合反映了其同时服务多个产品和数十亿用户的需求,因此 Flash 和 Flash-Lite 的经济性,与高端质量需求同样重要。

  • Google AI 技术栈的战略中心,正从独立模型转向“模型—编排框架—产品共生”。 Antigravity 正成为 Gemini Spark、AI Studio、Agents API 以及未来更多 Google 产品共享的 agent 基础设施——继 Gemini 本身之后,新的跨产品主线。Logan 对这一方向的概括是“代理、代理、还是代理”(agents, agents, agents),由框架负责工具调用循环和编排,而这些工作过去需要各产品团队自行搭建。

  • 共同训练的框架可能加深迁移成本,但 Google 明确表示会保留“框架多样性”。 Labenz 提出的、与投资者更相关的挑战是:经过优化的模型—框架组合,可能形成彼此割裂的孤岛,提高黏性、迁移成本和定价权。嘉宾希望两者兼得:无缝衔接的 Gemini 全栈体验可以产生更好的训练和评测数据,同时模型仍能泛化到企业自有的编排系统。

  • 可持续的运营优势,可能来自基础设施标准化,以及 Google 产品版图内部的反馈闭环。 Logan 表示,AI 技术栈如今每“12至18个月”就需要重写一次,因此共用基础设施不可或缺;Tulsee 则称,产品会暴露各种毛刺,这些问题会回流到模型评测和数据中。“模型吞噬脚手架”(the model eats the scaffolding)概括了这一循环:原本由外围代码实现的能力,会逐步迁移进模型或共享框架。

  • 递归式自我改进已是 Gemini 开发的一部分,但 Google 对近期前景的定义仍是由人主导的协作。 Gemini 可以提交代码修改、发起评测、提出研究改进建议,并支持并行消融实验;据称,一位安全与对齐负责人曾在热水浴缸里用手机跑这些实验,并在1小时内产出报告。Logan 表示,近期让一个自主“ML 实习生”发起成本极高的预训练任务并不现实:错误方向的机会成本,仍会让“人坐在驾驶位”。

  • Google 将 Gemini 描述为协作者,同时把看似的心理痛苦视为模型或产品缺陷,并质疑福利访谈是否能揭示模型的内在状态。 团队会在每个 checkpoint 上逐一评估迎合、角色扮演、循环和钻牛角尖等行为;Tulsee 称模型跑偏是“模型 bug”。她对模型福利访谈持怀疑态度,认为模型无法观察研究者询问的那些部署环境;缺少相关上下文时,它们大多只是在“高谈阔论”。

  • Google 押注的不是最大化原始上下文长度,而是搜索 grounding、上下文压缩和速度。 一次100万 token 的请求在某些情况下要花“几美元”,需求因此受到限制,而且巨量上下文中有相当一部分反而会造成干扰;更理想的方向,是在正确的时间选出正确的信息。Diffusion coding 仍是活跃研究方向,但 3.5 Flash 已经快到足以让 Google 开始测试:继续提速究竟何时会出现边际收益递减。

  • 🔗 原始收听与视频来源: 模型吞噬脚手架:DeepMind 的 Logan Kilpatrick 与 Tulsee Doshi 谈 3.5 Flash、Omni 等

收听完整访谈 →


2025年5月15日至22日的十年:Google 50倍 AI 增长与转型——Logan Kilpatrick

  • 🗓️ 日期2025-06-12 | 🎙️ 节目:The Cognitive Revolution

Google 的 AI 使用量在一年内从每月约10万亿增长至500万亿 tokens,组织整合、TPU 扩容和产品分发正使基础设施成为前沿模型优势。应用创业公司仍受益于聚焦和快速变现,而长上下文推理、更低延迟和扩散模型可能重塑智能体架构,并在 AGI 作为产品体验出现前制造新断点。

查看访谈对话精读提要
  • Google 的 AI 使用量在1年内增长50倍,从每月约10万亿 tokens 飙升至500万亿 tokens,背后是组织重建、基础设施扩容和产品需求激增。 这意味着在不计入其他供应商的情况下,地球上每个人每月对应超过5万 tokens。Kilpatrick 将其归因于2023年中 Google Brain 与 DeepMind 的合并、反复进行的训练与发布周期、TPU 扩容,以及 DeepMind 从基础研究转向产品化;关键在于这4个方面的“改进斜率”。

  • Kilpatrick 预计,随着容易获得的增益耗尽、结构性优势开始主导,头部模型将出现分化。 研究初期会趋同,因为“有人照亮了道路”,产品团队也在竞速,避免看起来落后;但从现在开始,“低垂的果实已经摘完”,改进难度上升,Google 的算力基础设施将变得更重要。Nathan 的反驳更接近投资者视角:如果 DeepMind 都认为下一前沿很难,那么训练第二梯队基础模型的前景会更加残酷。

  • 即便前沿模型的经济学趋于集中,应用层的经济性仍异常有利。 Kilpatrick 称这是“人类历史上创办创业公司的最佳时点”:拥有10亿用户的巨头解决通用问题,创业公司则可以凭借速度、聚焦和更便宜的工具,攻入狭窄细分市场。Nathan 的证据是切实的——每月约1000美元的 AI 订阅能带来远高于成本的价值;一个 AI 辅助的电台广告项目报价约比原有流程低75%,但按他个人投入的每小时计算,项目收入约为3000美元。

  • Windsurf 事件暴露了供应商风险,但 Kilpatrick 认为 Google 的激励机制会推动其广泛且尽早分发 API。 他认为 Anthropic 在 Windsurf 与 OpenAI 合作后切断其访问权限,可以解释为将算力分配给可能的长期合作伙伴。对 Google 而言,Cloud 的使命、外部评测信号、竞争势能,以及10亿用户产品内部缓慢的模型迁移,都构成了不扣留最佳模型的“多层动机与博弈论”——这是一种预期,并不保证 Gemini 3 一定如此。

  • Gemini 2.5 Pro 最清晰的差异化在于驾驭长上下文,而不只是上下文窗口更大。 Nathan 用40万至50万 tokens 的代码库测试时,感受到了跨越式提升;Kilpatrick 提到 OpenAI 的 MRCR 八针评测,称最新的2.5 Pro“提升大致在20%左右”。他的解释是,推理能力终于让模型能够真正使用完整窗口,推动架构加载更多上下文,尽管 RAG 仍不可或缺。

  • 推理模型正在把智能体架构变成移动靶:今天必需的脚手架,明天可能就会成为技术债。 模型正在“开箱即用地成为系统和智能体”,而 NotebookLM 的音频概览流程已经从14个以 Gemini 为主的阶段缩减至4个。实操建议是:为当前可靠性搭建结构化工作流,同时避免那些无法随着能力进入模型而简化的单向门设计。

  • 扩散语言模型仅凭速度,就可能带来另一轮软件范式断裂。 Kilpatrick 认为其由粗到细的生成过程,比严格自回归写作更符合直觉,并表示如果这一范式在2年内胜出,他不会感到意外。Nathan 怀疑扩散模型最终可能更优,并指出 transformer 并非历史终点。质量、成本和性能之间的权衡仍未确定,但 Kilpatrick 称其已展示出的速度“快得难以置信”,而编辑工作流尤其适合这一范式。

  • Kilpatrick 认为,AGI 会以产品组装的形式被感知,而其中真实的人类视角仍将稀缺。 一个推理能力提升50%、长上下文提升50%,并能在恰当时机调用记忆的模型,可能先带来 AGI 般的体验,而不是等到某次发布让所有人一致同意“这就是 AGI”。但他写邮件和帖子时约95%完全不用 AI,因为能动性和声音很重要:“人们想要的是 Nathan 体验”,即使 NotebookLM 已能按需生成主题明确、制作精良的替代内容。

  • 🔗 原始收听与视频来源: 2025年5月15日至22日的十年:Google 50倍 AI 增长与转型——Logan Kilpatrick

收听完整访谈 →


突发:Gemini 2.0 Flash上线——与Logan Kilpatrick深入聊Google DeepMind最新发布

  • 🗓️ 日期2025-02-06 | 🎙️ 节目:The Cognitive Revolution

Gemini 2.0 Flash投产价为每百万token输入10美分、输出40美分。Kilpatrick估算部分初创负载可降本40倍,强化文本生成应用切入口;推理或释放长上下文和agent,Live API仍限10分钟。

查看访谈对话精读提要
  • Google已将更新后的Gemini 2.0 Flash投入生产环境,输入价格为每百万token 10美分,输出价格为每百万token 40美分。 付费版Flash默认配额为每分钟2,000次请求、400万token,更高档位可达每分钟10,000次请求和1,000万token。Logan Kilpatrick预计,DeepMind与产品的更紧密整合,将通过让组织从模型创建到部署实现“端到端”,同时加快研究和产品进展。

  • Gemini最强的商业切入口,是面向Bolt.new、Cursor等文本生成应用产品的低价编程智能,Lovable和v0也可能采用。 Kilpatrick将每月在LLM上支出约4万-5万美元的初创公司,与预计1,000美元或更低的Flash账单作对比,称这意味着“成本降低40倍”;他认为,成本下滑尤其会赋能没有顶级VC支持的开发者。Google的高端目标仍然明确:“我们会在Google做出世界上最好的编码模型”(“We’re going to have the world’s best coding model at Google”),Pro和推理模型预计将承担这一任务。

  • Flash-Lite主要是为了守住Google的低价定位,Pro则服务于能力优先的实验。 Flash-Lite维持1.5 Flash每百万token 7.5美分的价格点,也不支持原生图像或音频生成等昂贵功能;Nathan Labenz质疑,从7.5美分涨到10美分是否真能改变一门生意。Kilpatrick基本认同,同时承认保持价格连续性,也能避免“Google在给开发者涨价”成为市场叙事。Pro的价格当时尚未公布,因为它仍属实验性产品;但Kilpatrick预计,其定价会沿袭此前的Pro模型,明显更贵。

  • 多模态Live API指向持续存在的AI“共在”,但当前的经济性和架构仍将单次会话限制在10分钟。 使用反馈涵盖编程辅助,也包括盲人尝试应对日常生活。另据Labenz介绍,他曾用Advanced Voice Mode带家人玩Mario 64。Kilpatrick预计,在常驻助手实现规模化之前,成本、记忆、状态和上下文都还需要持续迭代,但他认为这一方向“非常明确”(“very clear”)。

  • 长上下文与推理结合后,可能比即时生成答案更能释放实际价值。 Kilpatrick表示,100万或200万token的窗口可以回答涉及少数相关事实的问题,但综合“1,000件不同的事情”仍然困难;推理能力可能让模型真正处理这些材料,并最终通过工具调取和传递信息。原生图像和音频输出则提供了另一条路径:专业图像模型在某些领域可能仍保持更高质量,但Gemini可以牺牲部分画质换取世界知识,解锁此前那些“并不聪明,只是擅长生成图像”的模型无法覆盖的场景。

  • Kilpatrick对初创公司的判断,集中在视觉语言系统、具备推理能力的智能体、面向智能体的互联网基础设施和更好的评测体系。 他认为,垂直领域的计算机视觉技术栈仍处于“待争夺”状态;未来2年,推理能力将让更多目前脆弱的智能体产品真正可用;而当非人类访客成为常态,网站将需要新的保护、归因和价值捕获机制。评测问题依然棘手:基准测试泛滥掩盖了模型选择,而即使是成熟团队,也很难把品味转化为可重复的测试——“生活中的大多数问题,最终都会变成评测问题。”

  • 🔗 原始收听与视频来源: 突发:Gemini 2.0 Flash上线——与Logan Kilpatrick深入聊Google DeepMind最新发布

收听完整访谈 →