深入 xAI:3个月打造 Grok Imagine、视频生成模型对比世界模型,以及视频 Agent——Ethan He
摘要
Ethan Caballero 的核心判断是,视频模型未来的增量主要来自语言智能,而非扩散技术突破。 扩散模型本质上仍是字面意义上的生成器:输入“a cat”,可能只得到一只静止在空白背景上的猫;更大的语言模型则负责补足动作、场景、构图和意图。他从 Cosmos 转向 Grok Imagine 后的结论是:“视频模型的瓶颈其实在语言部分,也就是 Agent。”
视频 Agent 可能在今年年底前把生成式媒体推过商业可用门槛。 Agent 不只是生成一个片段,还能理解 brief、生成多个版本、编辑素材、编写代码,并调用 FFmpeg 或确定性文字叠加等工具。嘉宾预计,届时视频质量将达到适合广告投放的“生产级质量”(production grade quality);由于 Agent 会执行大量昂贵的中间步骤,这将为模型和推理服务商打开规模大得多的企业预算。
视频领域的资本门槛接近中等规模语言模型训练,而且还包含一笔常被忽视的存储和 I/O 成本。 10亿个5 MB视频在存储同等规模的 VAE 特征前就需要5 PB;Ethan 估计,一套严肃的视频语料库规模将达到数十 PB,讨论中进一步估算,仅网络成本每月就可能达到“几百万美元”。Dense 模型规模可达约19B参数,探索中的 MoE 约为20B active/100B total,Cosmos 披露的视觉 token 数量则达到数十万亿。
xAI 从“没有基础设施、没有数据、没有模型”到 Grok Imagine 0.9 的3个月历程,更多体现的是迭代速度,而非算法突破。 Ethan 将成果归因于一支规模小且高度协同的团队、成熟的内部基础设施、充足算力,以及从新数据或新算法到评估的快速端到端循环。令人不适但重要的教训是,“很多改进并不来自新算法”;小数据问题和训练流水线 bug,往往带来最大的质量提升。
嘉宾将世界模型定义为“实时、可交互、长时程的视频”,因此上下文管理成为核心技术约束。 他对比了两种场景:300 FPS 的高要求游戏交互意味着每帧约3 ms,而数字人可能可以容忍约200 ms。无论哪种情况,数分钟或数小时的视频都会让朴素注意力机制不堪重负;5秒视频就可能对应50K–60K tokens,因此未来需要选择性检索——记住人物、物体和相关场景,而不是携带此前的每一帧。
生成式 UI 的讨论押注于一种更大的界面变化:语言模型在幕后处理意图和工具,扩散模型则渲染个性化像素。 其核心概括是“用户意图直接到像素”,界面可以为每个用户即时发明,而不是一次性写死在代码里。按每个 H100 小时$1、每天运行8小时计算,每月成本为$240;但随着推理成本下降,未来或许能够实现主持人所称的“扩散前端、确定性后端”。
嘉宾离开 xAI,是因为视频方向把他重新引向了具备上下文意识、甚至可能自我修改的语言模型。 他预计,模型将知道自己何时接近上下文上限,并决定检索、丢弃哪些信息,把今天由 harness 完成的剪枝、压缩和时间感知逐渐内化为模型行为。他更具推测性的终点是,一个“能在测试时在线编程自身的模型”,而强大的视频理解能力最终可能让机器人只是这类 AI 可以操作的另一个工具。
精读
上游暂未提供,后续同步将继续补齐。