先锋 趋势 方法 投研 作者
返回先锋
Jonathan Ross
创业者 6 场深度对话收录

Jonathan Ross

Groq · 创始人兼首席执行官

前沿洞察

Ross断言算力范式正向推理不可逆转移(占比或达95%),token降价将引爆指数级消费。他以绕开HBM的LPU切入,试图在成本与能效维度降维替代传统GPU,甚至借资本杠杆谋求过半推理市场;同时指出,云厂商与顶尖模型巨头为掌控供给必将自研芯片,但面临极高的流片壁垒与电力能源天花板。其核心警示在于:推理基建将重构AI价值链,但数据中心过度建设、电网承载力及地缘监管盲区已构成行业最致命的系统性暗礁。

观点集合

为何提出正确问题,是 AI 时代最重要的能力

  • 🗓️ 日期2026-07-05 | 🎙️ 节目:David Senra

传闻中的200亿美元 NVIDIA 合作从首次通话到资金到账约3周,源于 Jensen Huang 看中 Groq 已完成的 GPU-LPU 混合系统,并希望向所有 NVIDIA 客户开放。GPU 与 LPU 分别应对不同瓶颈,速度还能让模型搜索更深并在代理协作中复合放大;算力短缺与资本优势是否消退,仍值得关注。

查看访谈对话精读提要
  • 传闻中的 200亿美元 NVIDIA 合作,从第一次通话到资金到账只用了约 3周。 Jonathan Ross 找到 Jensen Huang,原本是想买约 100,000块 GPU,部署 Groq 已经搭建好的 GPU-LPU 混合系统;Jensen 看到成果后,反而认为不如让所有 NVIDIA 客户都能用上。Ross 纠正了“走投无路才卖身”的叙事:Groq 这次并不缺现金,协议价值只比上一轮估值高出略多于 2x,而且 Groq 本可以按许可交易的金额融资。

  • 技术核心是,LPU 与 GPU 是互补关系,而不是替代关系。 “18轮卡车还是最后一公里的面包车,你会选哪个?答案是两者都要”:受算力约束的矩阵乘法交给 GPU,受内存吞吐约束的交给 LPU,因为不存在“唯一完美的架构”,两者结合才能“击穿瓶颈”。很多人误判在于把 prefill 与生成拆给不同硬件,但这不是正确的切分方式,因为“生成 token 才是难点”。

  • 速度让模型变得更聪明,而不只是更快——Ross 用自己在 Google 参与创造的 TPU 上运行 AlphaGo 证明了这一点。 Ross 给出的近似 Elo 是:AlphaGo 在 GPU 上约 3,200,Lee Sedol 约 3,550,同时提醒自己可能把首位数字记错了;对话中 TPU 的结果被描述为约 3,900 或 2,900。同一个模型只有在硬件支持更深层搜索后,才找到了概率约为 1/10,000 的第 37手棋。“思考得更快,就能思考得更聪明”,在 AI-to-AI 的代理流量中,速度还会以指数方式放大。

  • 就在 3、4年前,快速推理还不受待见,Groq 内部也不例外。 有人一边说它没有价值一边离职,客户会问“为什么我需要一个比我阅读速度更快的 LLM”,Ross 还曾两次被团队劝退 LLM 机会,包括 GitHub CEO 直接打电话来询问用于代码补全的芯片。最终奏效的办法是让人亲自试用:一段 LLM 在 Groq 上运行的 X 病毒视频,做到了多年第一性原理论证都做不到的事。

  • 正如 Senra 通过 Ross 的融资故事和凯恩斯选美竞赛所框定的那样,资本已经不再是 AI 里的制胜押注。 过去,创投机构抱团下注有其合理性:融资最多的创业公司看起来可能更占优势;但“历史上第一次,创业公司不再缺现金……投入更多资金不再构成优势,可人们仍然表现得好像它是”。反差在于,典型的西海岸 VC 放弃了 Groq,东海岸 crossover 基金却投中了 Senra 所称、规模几乎是 NVIDIA 此前最大交易 3x 的一笔交易。

  • AI 时代真正决定成败的能力不是回答问题,而是提出问题。 “信息时代的成功,取决于能否回答问题;AI 时代的成功,将取决于能否提出正确的问题。” 每个人都要从 IC 转向“AI 的领导者”;Ross 认为学校课程应围绕真实社区问题展开,让学生把问题拆解成一组可以交给 AI 的提问。

  • 代码的边际成本“正趋近于零”,软件创造将向更多创始人开放。 Ross 的 EA 不会写代码,却已经能搭建旅行应用;软件创作正像读写能力一样,开始向过去缺乏技术能力、但可能拥有良好品味的人开放。他预计,不依赖大型团队的个人创始人也能做出有价值的公司。

  • Ross 目前刻意维持的不满,来自全世界的算力短缺。 “如果因为算力不够,治愈癌症要多花 1年,那就是我的错。” 这背后的经历是:Groq 曾在仍未有产品时距离现金耗尽只剩 3周,靠“Groq bonds”——以薪资换股权——留住了团队;80%的员工参与,其中约一半降到了法定最低工资。

  • 🔗 原始收听与视频来源: 为何提出正确问题,是 AI 时代最重要的能力

收听完整访谈 →


推理革命:Groq、Nvidia 与 AI 的未来

  • 🗓️ 日期2026-05-18 | 🎙️ 节目:Sohn Conference Foundation

内存定价权可能自我约束:DeepSeek V4 据称将很可能是 KV cache 的部分压缩了90%,而瓶颈过大将推动建设更多内存晶圆厂。智能回报是否递减仍是核心分歧;Agentic AI 会调用更聪明的模型,模型自生成数据并持续改进,或支撑持续扩产。

查看访谈对话精读提要
  • 在 Irish Open 大会上,Groq 创始人兼 CEO、Google TPU 发明者——主持人介绍他时称其为 Nvidia 首席软件架构师,并说他“最近有点上新闻”——与对冲基金经理 John 坐下来交谈。 他的核心框架是:AI 不存在永久性瓶颈——“每当一个瓶颈变得足够严重,人们就会解决它”,所以零部件在成为问题时可以收取溢价,但问题不大时不行;而当它们变成更大的问题,人们就会开始解决它们。

  • 对今天最紧俏交易的直接推论是:内存的定价权存在自我约束。 内存曾是“半导体供应链中最商品化的环节”,这里讨论的不是奢侈品,而是吉芬商品:就像大米,价格可以一直涨到消费者转而吃玉米为止。DeepSeek V4 发布就是算法效率的一个例子,据称将很可能是 KV cache 的部分压缩了90%:“它就是那根长得过高的罂粟;一旦长得太高,就会被砍掉。”

  • 他不接受以机会成本为基础、用 Jevons 悖论为内存短缺辩护的说法。 解决内存问题的工程师意味着机会成本——“如果他们有足够的内存,就会去做别的事情。”他的处方非常直接:“开始建设更多内存晶圆厂。”

  • 两人长期以来的分歧,正是与投资论点最相关的地方:John 认为博士水平以上的智能存在边际递减。 他认为开源模型大约落后闭源权重模型实验室6个月,因此只要边际递减的判断成立,开放权重模型最终就会追上闭源权重模型。Jonathan 的反驳是:“对智能的需求不可能被满足”——癌症尚未被攻克、人类仍会因衰老死亡、运行某些 AI 模型的算力仍然不足;再加上人与人之间的竞争,即使模型差异细微到人类无法察觉,也会“体现在我的回报里”。

  • Agentic AI 会进一步巩固最聪明模型的护城河。 “AI 喜欢使用 AI”,即使人类分辨不出差异,AI 也会识别并调用更聪明的模型。一个支持性案例是:用 LLM 筛选简历的招聘人员更偏好由自己所用模型写出的简历——所以“用 Claude Opus 47 写一份,再用 ChatGPT 写一份”。

  • 他对能力不会进入平台期的判断,为持续扩产提供了支撑。 如今模型会用自己的数据生成数据、筛选数据并重新训练,“以相当线性的速度持续改进”;AI 的直觉已经超过人类。他表示,Waymo 每天产生的数据量开始接近一个人一生的驾驶数据,但不知道是否已经达到这一规模。还有一个值得保留的定义:智能是一种静态能力,即作出预测或影响结果的能力;感知性则是“智能自我提升的速度”——它是“文明的属性”,也是社会中不断加速的反馈回路。

  • 🔗 原始收听与视频来源: 推理革命:Groq、Nvidia 与 AI 的未来

收听完整访谈 →


Groq 创始人、TPU 创造者 Jonathan Ross:GPU ♥ LPU——你想知道的一切|Nvidia GTC 2026

  • 🗓️ 日期2026-03-26 | 🎙️ 节目:NoRush Invest

Nvidia与Groq整合已进入生产,LPX机架预计Q3供货,交易从接触到完成仅用数周。FFN层交给LPU、attention层交给GPU,可提升两类芯片利用率,达到每秒数千个token并提高每兆瓦吞吐。Ross预计快速档位价格继续超线性,但能源及内存、计算、网络瓶颈仍待观察。

查看访谈对话精读提要
  • Nvidia 与 Groq 的整合已经落地,范围广泛,并开始交付。 Ross 确认,LPX 机架“已经投入生产”,Q3 可供货——这“可能是半导体史上最快的爬坡之一”(“可能”是法务要求加入的措辞)。从 Groq COO Sunny Madra 联系 Jensen、询问能否接入 NVLink,到交易在数周内完成,Ross 于12月25日开始在 Nvidia 全职工作。

  • 这套产品将 LLM 的解码工作拆分给两类芯片。 FFN 层运行在 LPU 上,attention 层运行在 GPU 上——Ross 用物流网络作比喻:18轮卡车代表 GPU 的长距离吞吐,配送面包车代表 LPU 的低延迟。结果是两类芯片的利用率都得到提升,帕累托曲线在高速区间“向上弯曲”,达到“每秒数千个 token”这一“原本不可能实现”的水平。

  • Ross 预计,快速档位的定价仍将保持超线性。 Anthropic,以及很可能包括 OpenAI,已经对快速档位收取超线性价格;Ross 用煤炭与石油作比喻:石油每 BTU 成本约为煤炭的7倍,但人们仍愿意支付,因为“你不能用煤炭让飞机起飞”。企业应把超高档位的 token 配额给最优秀的工程师;如今每月花费1万美元的客户“可能还只是低端”,未来可能走向工程师每年消耗数百万美元 token。

  • 速度就是智能,甚至可以胜过模型质量。 Groq 内部发现,Qwen-32B“是一个不错但算不上顶尖的模型”,仅仅通过增加迭代次数,就能比 Anthropic 的 Opus 更快、更便宜地解决每一道形式化推理数学题——快速反馈循环胜过更少但昂贵的迭代。

  • 推理驱动收入循环。 “训练规模取决于研究人员数量,推理规模取决于用户数量。收入来自用户,而不是研究人员。” 这会形成正向循环:推理侧领先,带动客户收入增长,进而推动客户购买更多训练硬件。

  • 能源正在限制推理规模。 “现在全球没有足够的推理算力,也没有足够的能源来驱动足够的推理算力。” 混合机架的核心卖点,是提高每兆瓦的 token 产出;这正对应 Jensen 提出的关键问题:在吉瓦级数据中心里运行什么,才能最大化收入。

  • 从内部看,NVDA 的文化是:即便有超过4万人,也和450人的 Groq 一样快,丝毫不慢。 Ross 称 Nvidia“几乎没有真正的官僚主义”,并在台上针对 Google 的推进速度作了意味明确的调侃。

  • 🔗 原始收听与视频来源: Groq 创始人、TPU 创造者 Jonathan Ross:GPU ♥ LPU——你想知道的一切|Nvidia GTC 2026

收听完整访谈 →


Groq 创始人 Jonathan Ross:OpenAI 与 Anthropic 将自研芯片,NVIDIA 能否涨到10万亿美元

  • 🗓️ 日期2025-09-29 | 🎙️ 节目:20VC

Jonathan Ross预计,超大规模云厂商会为掌控供应而自研芯片,而推理算力翻倍可能让OpenAI和Anthropic一个月内收入接近翻倍。Nvidia的客户集中度与HBM瓶颈支撑其冲击10万亿美元市值的可能性,但新进入者面临三年周期、14%的首次流片成功率和能源约束。

查看访谈对话精读提要
  • Ross 的核心判断是:「5年后,如果 Nvidia 的市值还不到10万亿美元,我个人会感到意外。」 但更尖锐的版本是:Nvidia 只需销售少数芯片,却持续拿走大部分收入——可能是10%的芯片贡献51%的收入;随着贡献90%-99%总支出的35-36家客户开始按性能而非品牌采购,格局会变化。而他更希望你问的是:「5年后 Groq 的市值会到10万亿美元吗?有可能。」

  • 如果把 OpenAI 和 Anthropic 现有的推理算力都翻倍,它们的收入将在1个月内接近翻倍。 Anthropic 最大的抱怨之一是速率限制;OpenAI 通过降低聊天速度来限流,牺牲了用户参与度。2周前,一位客户要求 Groq 提供其总容量5倍的算力,没人能接下这个需求。

  • OpenAI、Anthropic 以及所有超大规模云厂商都会自研芯片,但目的未必是击败 Nvidia。 真正的奖品是「掌控自己的命运」,摆脱 Nvidia 对 HBM 的买方垄断——Nvidia 每年可以制造5000万颗 GPU die,但实际出货量约550万颗 GPU。至于新芯片创业公司,Ross 认为「已经太晚了,这艘船已经开走」:即使一切顺利,从设计到流片也要3年,而首次流片成功率只有14%。

  • 判断泡沫与否,应该看聪明钱在做什么:它们都在加码。 在 Goldman Abu Dhabi 的一场活动上,管理着100亿美元以上资产的50多位经理中,没有1个人确信10年后 AI 不会取代自己的工作。「它们当然会像醉酒水手一样花钱」——而 AI 也打破了 SaaS 的经济学,因为每次查询投入更多算力,就能直接改善产品。

  • 中国模型的运行成本约为 GPT OSS 的10倍。 它们优化的是低成本训练,而封闭市场的定价让供应商可以围绕稀缺性收费,导致人们把价格和成本混为一谈。中国可以赢下本土主场——拥有150座核反应堆和补贴;但在无法自行建设电厂的盟友国家这场「客场赛」中,美国还有2-3年的窗口期。

  • 「掌控算力的国家将掌控 AI,而没有能源就不可能拥有算力。」 欧洲选择「通过立法」竞争,而不是建设基础设施;如果不能以足够速度行动,「欧洲经济将变成旅游经济」。拥有风电、且风电规模达到水电5倍的 Norway,理论上可以提供与美国同等的能源;日本的2nm晶圆厂、650亿美元 AI 投资和重启核反应堆,则展示了所需的行动速度。

  • AI 带来的将是大规模劳动力短缺,而不是失业。 它会对整个经济施加通缩压力,让人们更早退出工作,并创造今天无法想象的新职业。「我们将通过生产更多算力,把更多劳动力加入经济体系……这在经济史上从未发生过。」

  • 行业格局上,长期对决仍是 OpenAI 对 Google;Anthropic 则在做不同的事——编码。 5000亿美元的 OpenAI 和1800亿美元的 Anthropic 都「被严重低估」,因为这些实验室会成为「Mag 9、Mag 11、Mag 20」。Microsoft 短期内会重置与 OpenAI 的关系;CUDA 的锁定效应「对训练成立,但对推理不成立」。

  • 🔗 原始收听与视频来源: Groq 创始人 Jonathan Ross:OpenAI 与 Anthropic 将自研芯片,NVIDIA 能否涨到10万亿美元

收听完整访谈 →


Jonathan Ross,Groq 创始人兼 CEO:NVIDIA 对决 Groq——训练与推理的未来 | E1260

  • 🗓️ 日期2025-02-17 | 🎙️ 节目:20VC

Groq正将绕开HBM的LPU定位为Nvidia的推理互补方案,宣称成本低逾5倍、每个token能耗仅为三分之一,且资本模式不再受融资限制。Aramco支持的部署计划旨在2027年底前拿下全球至少一半推理算力,但电力供给、数据中心过度建设、竞争执行和经济性的持续性仍是关键风险。

查看访谈对话精读提要
  • Groq 的 headline number 被误读了:Jonathan Ross 表示,“我们没有融资 15 亿美元——那是收入”,规模约为 OpenAI 收入的 30%。 Aramco/沙特交易方承担资本开支,Groq 负责部署并按约定 IRR 偿还,之后再切换分成——“我们不再受资本限制”。公司目标是在 2027 年底前至少拿下全球一半的 AI 推理算力,并坚持一个信条:“当你的增长速度超过指数增长时,赚多少利润都不重要。”

  • Ross 拒绝把 Groq 与 Nvidia 定义为竞争关系,反而将训练视为“已经解决的问题”,并乐于让给 Nvidia——他甚至告诉自己的客户:“能买到的每一块 GPU 都买下来”。 Groq 接手 Nvidia 70-80% 毛利业务之外的低毛利(前端约 20%)、高规模推理需求。其宣称的经济性包括成本低逾 5 倍、每个 token 能耗仅为三分之一,以及“最新 GPU 光是内存成本,就高于我们每颗已部署芯片的全包资本开支”。

  • 结构性突破口在于:Nvidia 是 HBM 的买方垄断者——只有 SK Hynix、Samsung 和 Micron 能生产 HBM,而 Groq 的 LPU 完全绕开 HBM。 LPU 采用与手机芯片相同的硅工艺,因此“我们的扩容实际上几乎没有上限”:2024 年初投产 640 颗芯片,年底达到 40,000 颗,今年目标超过 200 万颗,几乎需要占满晶圆厂产能。

  • Ross 最大的宏观担忧是 3-4 年后出现电力危机:潜在电力需求约 20GW,而全球现有数据中心约 15GW,当前正在过度建设。 一旦亏损的建设者收缩,而芯片数量仍每 18-24 个月翻倍、推升芯片驱动的需求至 120-240GW,“电力就会变成硬瓶颈”。与此同时,大量“假数据中心”——只有地产、没有发电机和水的项目——正在虚增表面供给。

  • 关于 scaling laws,所谓渐近线只是把所有数据视为同等质量的结果;LLM 生成并筛选自己的合成数据后,可以突破这条表面渐近线,再与测试时推理叠加,形成“几何级增长的改进”。 算力只是“软瓶颈”,DeepSeek 做的是算法改进;Nvidia 在 DeepSeek 后下跌 15%,只是“市场的 popularity contest……与 weighing machine 毫无关系”。

  • 对泡沫的判断,两半都成立:“我可以保证会有大量资金被烧光,但我也押注最终赚到的钱会多于投入的钱。” 本轮的新鲜之处,是凯恩斯的选美竞赛“已经彻底失控”:多个竞争者手里都握有数十亿美元,资本不再决定赢家,“真正拥有最佳产品的人最终会赢,因为所有人都能获得资本”。

  • 这套定位论,是在长达 7 年没有产品市场匹配的经历中磨出来的:“你的工作不是追随浪潮,而是为浪潮做好位置。” Groq 靠“Groq bonds”活了下来:80%的员工用薪资换股权,其中一半降至法定最低工资。他对下一轮浪潮的判断指向 4 类定义时代的公司:解决幻觉、拆解 agentic 子目标、实现“发明”,以及替人做决策。

  • 中国真正的短板不在 Blackwell 是否能拿到,而在审查制度:云端租赁以及马来西亚/新加坡“wink wink”的 GPU 部署,可能让物理接入不再决定胜负;但如果中国不允许“更开放、更真实的模型”,就天然处于劣势。 对 Nvidia 下一个 10 年,Ross 也没有单边判断:“如果它变成现在的 3 倍大,我不会惊讶;如果它仍大致维持原状,我也不会惊讶。”

  • 🔗 原始收听与视频来源: Jonathan Ross,Groq 创始人兼 CEO:NVIDIA 对决 Groq——训练与推理的未来 | E1260

收听完整访谈 →


Jonathan Ross:DeepSeek 专题——OpenAI 和美国政府应如何回应|E1253

  • 🗓️ 日期2025-01-30 | 🎙️ 节目:20VC

Ross认为600万美元只是营销,DeepSeek真正突破是全自动可验证奖励RL;零切换成本使价值流向品牌、应用与基础设施。他认为推理占比或达95%,token降价会放大消费;云端租GPU削弱出口管制,数据获取仍是CCP核心风险。

查看访谈对话精读提要
  • Ross 的核心判断是:DeepSeek 是「Sputnik 2.0」——NASA 太空笔对俄罗斯铅笔的故事“刚刚又发生了一遍”,但 600万美元是营销话术。 “他们在训练上确实花了大约 600万美元,但在蒸馏或抓取 OpenAI 模型上花得多得多”;既然 OpenAI 据报道每个 API token 都在亏钱,它实际上“无意中补贴了这个模型的训练”。真正的创新是全自动、可验证奖励的 RL,整个过程不需要人类介入。

  • 模型如今已经赤裸裸地商品化——“如果之前还有任何疑问,现在疑问已经结束了”——而 LLM“完全没有切换成本”,云计算的类比因此失效。 如果 Ross 是 Sam Altman,他会选择“为 OpenAI 的模型开源做准备”来回应——“开放总是赢,永远如此”,Linux 已经证明了这一点——因为“很明显你会输掉这一局,不如试着赢得所有用户和他们的喜爱”,再退回 OpenAI 真正的七大力量护城河:品牌。

  • 5000亿美元的 Stargate“不是花得太多,而是花得不够”。 Ross 在 TPU 时代看到 Google 的推理投入是训练的 10–20 倍;Harry 认为 Jenson 说过 Nvidia 的收入已有一半来自推理;Ross 则认为推理占比最终可能达到 95%——“你不会为了成为心血管外科医生而训练,然后一生只有 5% 的时间真正做手术”。测试时算力进一步放大这一趋势:DeepSeek 的一次回答烧掉了 18,000 个中间 token。

  • 可交易的判断是:Harry 在 16% 的暴跌中“刚买了一大笔 Nvidia”,称这是“本世纪最明显的买入机会”。 Ross 也从称重机视角认同这一判断:Nvidia“实际上因为 DeepSeek 更有价值了,而不是更没价值”。Jevons 悖论意味着,算力成本每十年下降约 1,000 倍,消费量却上升约 100,000 倍,因此支出增长 100 倍。训练是高毛利的“主机”利基市场;推理才是更大的市场,而 Groq 承接低毛利规模业务“可能是 Nvidia 股票有史以来发生过的最好事情”。

  • CCP 的风险在数据,而且情况很快会变得更糟。 “现在 CCP 可能会把武器上的保险栓拿掉……现在我们要数据了”;Harry 认为北京把 DeepSeek 当成另一个 TikTok 的概率是 100%。与此同时,出口管制只是做戏:“你完全可以登录、刷信用卡、租 GPU”——“这就像马奇诺防线,绕过去就行了。”

  • 接下来所有人都会复制 DeepSeek 的极稀疏混合专家架构(约 671B 参数、约 250 个 2B 参数专家,每次只激活少数几个),以及基于合成数据的再训练——Llama 3.3 70B 已经通过在更好数据上的微调击败了 3.1 405B。 DeepSeek 只允许中国手机号注册,说明“他们的推理算力用完了”:训练规模取决于 ML 研究员数量,推理规模取决于终端用户数量。

  • 给基础模型公司的建议是:“转向,接受现实——直接转向。” 模型是引擎,不是汽车;当幻觉率下降时,Perplexity“处在完美位置”(在今天的模型基础上构建应用,就像“还没有智能手机时试图创建 Uber”);而欧洲的处方是:今年年底建成 100 个 Station F,明年达到 1,000 个。

  • 🔗 原始收听与视频来源: Jonathan Ross:DeepSeek 专题——OpenAI 和美国政府应如何回应|E1253

收听完整访谈 →