先锋 趋势 方法 投研 作者
开源胜出,AGI 已至:与 Cerebras 和 Black Forest Labs CEO 对谈 Scorsese 的 AI 工具箱
返回节目精读

开源胜出,AGI 已至:与 Cerebras 和 Black Forest Labs CEO 对谈 Scorsese 的 AI 工具箱

摘要

  • Cerebras 表示,AI 基础设施服务的是已签约需求,而不是押注客户最终会出现。 Andrew Feldman 披露,公司积压订单达250亿美元,并称客户正“试图捕捉昨天的需求”(“trying to capture yesterday’s demand”);占地一个足球场的数据中心,耗电量甚至超过中型城市。对投资者而言,运营难题在于:当需求超过数据中心建设和填充能力时,如何留住客户。

  • 推理模型让推理速度和 token 可用量成为产品能力的一部分。 Rombach 表示,“Fable”和“5/6”等模型越来越能在无需“提示词耳语者”的情况下推断用户意图;他进行 Hermes-agent 实验时,通过一个运行 Z.ai GLM-5.2 的 Bittensor 项目,让模型在行动前先讨论自身的研究策略。长时间运行的任务已经能产出“惊人的东西”;Rombach 假设,如果 Cerebras 的推理速度提升15倍,就能把“数周或数月的思考”压缩到1天内完成。

  • Cerebras 预计,未来18个月其年轻架构的进步速度将大幅超过传统摩尔定律。 Feldman 的判断是“远超2倍”,因为新架构仍有大量面向特定工作负载的优化空间,而一套已有20年历史、依赖更小制程的 GPU 架构则不同。超大规模云厂商自研芯片,并不意味着商用芯片需求失效:它们的首要目标是避免完全依赖任何单一供应商。

  • 开源模型正成为前沿 AI 底层的成本、控制权与主权层。 Feldman 的比喻是,用户不该“开着 Ferrari 去买菜”:前沿模型负责最难的问题,开源模型则承接日常 G&A 和“剪切粘贴经济”。受监管企业同样希望在本国部署、在本地运行;因此,Cerebras 同时运行 gpt-oss-120B、GLM、Kimmy、“Quincy”系列模型、OpenAI 专有模型以及客户自研模型。

  • 当模型能在数小时内暴露严重软件漏洞时,分阶段发布和红队测试就具备了合理性。 Rombach 转述,Palo Alto Networks 发现了此前未知的漏洞,并暂停其他工作、花费6周打补丁;Feldman 表示,给政府防御方“2或3周修补明显漏洞”是合理的。他同时警告不要条件反射式监管,并认为未来发生大规模数据泄露不可避免:“事情总会发生。”

  • 按20年前采用的任何 AGI 定义,Feldman 都认为门槛已经跨过;真正悬而未决的是递归式改进会在哪里停止。 反复要求模型学习、重试并扩大搜索范围,带来的不是“好一点的答案”,而是“好得多的答案”,把数千轮人类式迭代压缩为机器速度。他的账本中包括真实的就业冲击,但也包括这样的可能性:孩子及其至亲不再因癌症离世,每个孩子都能拥有自适应导师。

  • Black Forest Labs 将生成式媒体视为多模态世界模型的基础,而不只是图像和视频工具业务。 Robin Rombach 从潜在扩散讲起,进而展望在图像、视频、音频上预训练、再结合动作预测的模型:同一个模型既可以帮助拍电影,也可能成为“机器人的大脑”。短期价值仍由人来主导:Martin Scorsese 用模型把脑中的场景外化;IP 持有者则可以结合可控生成、定制模型,以及潜在的授权粉丝创作。

精读

1. AI 基础设施正在追逐昨天的需求

  • Feldman 对规模的描述刻意落在物理层面:即将建成的数据中心,耗电量可能超过地球过去50年的总和;单座占地一个足球场的数据中心,接入电力甚至超过中型城市。建设范围覆盖美国、加拿大、北欧、法国、欧洲、中东、哈萨克斯坦、塔吉克斯坦、格鲁吉亚和亚美尼亚。

  • Cerebras 的积压订单达250亿美元,但 Feldman 表示这并非个例。OpenAI、Anthropic、Google、Microsoft 和 AWS 都希望获得更多数据中心,Rombach 还点名 SpaceX 和 xAI 是永不满足的容量买家。这些客户不是在赌“只要建起来,客户自然会来”,而是在“试图捕捉昨天的需求”。

  • 关于 token 最大化,Feldman 表示,实验确实可能浪费一部分资源,但净价值巨大。他把早期获得 token 的体验比作没有经验的 Costco 顾客:先买下“4件你根本不需要、每件还要22美元的东西”,之后才学会有策略地购物。

  • 企业行为已经从“所有人、想要多少 token 就给多少”转向差异化分配:高生产力团队拿到所需资源,其他工作则交给更便宜的模型或开源模型。Rombach 表示,个人“开始把玩工具,然后工具开始反过来把玩他们”,迫使用户明确目标、系统和需求。

2. 推理把 token 规模变成硬件问题

  • 早期计算机和提示词“只会完全照你说的做”;措辞稍有变化,输出就可能彻底不同。Feldman 表示,如今“Fable”和“5/6”越来越能自行推断用户想要的图表、布局或解决方案,不再要求用户成为“提示词耳语者”——这意味着能力正从总结实质性转向理解意图。

  • Rombach 的 Hermes-agent 实验通过一个 Bittensor 项目使用 Z.ai 的 GLM-5.2,并拥有无限容量。当被要求成为世界上最好的趋势猎手时,智能体先讨论应该搜索 Hacker News、Reddit、社交媒体还是 Instagram:“你正在看着一个推理模型推导出自己的工作方式。”

  • 无限 token 可能意味着“无限推理”,因为模型可以花25或48小时探索一个问题。Rombach 明确称其为假设的 Cerebras 案例:如果模型以15倍速度持续运行24小时,就可能产生“数周或数月的思考”,使推理延迟成为答案质量的一部分,而不只是用户体验问题。

  • Feldman 表示,Cerebras 打破了传统的18个月翻倍曲线,并预计未来18个月的改进将“远超2倍”。他的逻辑是:新架构仍保留大幅面向特定工作负载优化的空间,而一套已有20年历史的 GPU 架构更多依赖制程缩小。

3. 开源模型成为企业 AI 的小面包车

  • 超大规模云厂商自研芯片,并不意味着每一款芯片都必须击败商用芯片的前沿水平。Feldman 的解释来自行业记忆:云服务商曾经依赖 Intel,而 GPU 厂商也曾依赖少数超大规模云厂商。“你不可能完全依赖别人的芯片。”

  • 模型路由遵循同样的多元化逻辑:“你不会开着 Ferrari 去买菜。” OpenAI、Anthropic 和 Gemini 可以处理前沿问题,而日常的 Workday 操作、G&A 以及“剪切粘贴经济”,需要的是可靠的开源能力,而不是“奥数金牌级数学”。

  • 主权需求带来了第二个驱动因素。金融、医疗和其他受监管行业可能要求在本国、在本地部署系统,以更严格地控制数据泄露和智能外流;Feldman 认为 gpt-oss-120B 是正确的一步,但美国需要“更多本土开源模型”,为市场提供中国模型之外的选择。

  • Feldman 表示,Cerebras 能够运行广泛的模型,包括 GLM、Kimmy、“Quincy”系列、闭源 OpenAI 模型、GlaxoSmithKline 内部开发的模型,以及 G42 和 MBZUAI 的模型。他称,政府围绕“Fable”和“56”采取的行动,尤其是在欧洲,已经敲响警钟。

4. 模型找到严重漏洞后,分阶段发布显得合理

  • 被问及强大模型是否应该逐步推出时,Feldman 坦诚承认自己的局限:“我以前没见过这种情况”,因此无法判断那次具体发布是否正确。但原则上,分阶段开放类似于对强效药物采取的预防措施,也能给政府红队“2或3周修补明显漏洞”。

  • 他的平衡点是,极化立场“会损害清晰思考”。美国应维持 Dario、Sam 及同行之间的激烈竞争,避免成为一个第一反应就是监管的地区;同时也要承认,开发者正在没有操作手册的情况下,同时发明技术和配套护栏。

  • 护栏本身会增加延迟。Cerebras 在此前6周的实践中发现,更快的芯片能让这些保护措施“没那么痛苦”,说明安全和性能是相互耦合的,而不是彼此独立的产品层。

  • Rombach 提供的最有力证据来自 Palo Alto Networks 的 Nikesh:据称,一款经过测试的模型发现了公司此前并不知道的漏洞,迫使其投入6周打补丁。Feldman 预计大规模泄露最终会发生——某种未指明的“未知的未知”——并认为机构应在“事情总会发生”之前准备好应对方案。

5. 旧 AGI 测试已经过时,递归学习才是现实问题

  • Feldman 认同:“按我们20年前采用的任何定义,我们已经达到 AGI。” 早期的图灵测试和科幻式里程碑都已被超越;更困难的任务,是针对前人没有预料到的能力,提出与之匹配的问题。

  • 递归机制很简单,却可能呈指数级增长:提出问题,从答案中学习,带着更多信息重试,并扩大搜索范围。这些循环带来的“不是好一点的答案,而是好得多的答案”;目前未知的是,改进会在算力、token 或预算限制处停止,还是会继续攀升。

  • 他用大型工程作类比来支撑这一论点:凡尔赛宫等重大建筑,依靠3或4代专业家族积累经验;而人类往往要等20或40年才迎来范式变化,因为“范式不会死,人会死”。AI 则接近果蝇式迭代——“每天2代”——将数千轮等价世代压缩到极短时间内。

  • Feldman 不否认经济冲击;汽车出现后,马掌匠和马车制造商确实遭遇了打击。他给出的另一端账本是:癌症研究可能让孩子及其至亲免于失去彼此;自适应导师也能为每个孩子提供个性化教学,而不是今天这种“工厂化养殖”式课堂。他认为,只要以“周到且公平”的方式书写,这本账最终可能算得过来。

6. Black Forest Labs 正在构建多模态世界模型

  • Rombach 将 Black Forest Labs 的基础追溯至潜在扩散:这是他与合作者在慕尼黑读博期间开发的方法。该方法把自然数据压缩成高效表征,原理上类似 JPEG 或 MP3,再在这些表征上训练 Transformer;团队随后以此为基础构建了 Stable Diffusion 和 FLUX。

  • 当前路线图将图像、视频、音频预训练模型与动作预测结合起来。Rombach 区分了直觉式视觉智能和深层推理层:完整智能需要两者兼备,但视频预训练已经能够提供关于物理规律和现实互动的隐性知识。

  • 控制能力也在逐步扩展:从文生图,到文本加图像编辑,再到通过提示词对多张图像进行语义组合。将同一模式延伸至视频、音频和动作后,每种模态都可能成为输入或输出,并向用户和开发者开放更多“操控层”。

7. Scorsese 的用例是沟通,而不是一键拍电影

  • Rombach 拒绝规定生成式模型应该如何使用:“这些 AI 模型,它们是一种媒介。” 与 Martin Scorsese 合作时,团队围绕一个东欧村庄反复迭代,从导演的描述出发,直到图像比语言更直接地传达他脑中的场景。

  • 关键在机制,而不是明星背书。语言是一种“有损通信媒介”,而图像或视频包含异常丰富的信息;这项技术可以“并行化你的头脑风暴”,延伸熟悉的分镜和微缩模型工作流,而不是取代电影人。

  • Rombach 不确定生成整部电影是否是最终目标。他倾向于人参与其中的工作流,也不会预测高端电影何时到来;不过能力已经从他读博时的64×64像素图像,发展到高分辨率、数分钟长度的视频。

  • Robin 提供了生产经济学案例:Gal Gadot 曾描述一部 Bitcoin 电影,影片在摄影棚拍摄、使用生成式场景,据称成本为3000万美元;如果搭建实体布景,成本则需要1.5亿美元。Rombach 确认存在类似的制作应用,但强调技术仍处于快速进化轨道。

8. 同一套视觉技术栈正延伸至机器人、IP 库和消费者

  • Rombach 最具扩张性的判断是:“同一种 AI 模型”既可以用来拍电影,也可以充当机器人的大脑。生成会变成模拟,动作预测则要求模型具备感知和理解能力。当前,不同工厂硬件仍需要数小时的任务专属微调数据;长期目标则是让机器人能够理解“拿起一个玻璃杯”这样的自然上下文指令。

  • 在知识产权方面,Black Forest Labs 会在公共工具中屏蔽部分 IP 的生成。公司也直接与 IP 持有者合作开发定制模型,有时以开源基础构建,有时则使用更强大的专有系统;对拥有大型内容库的权利方而言,这是一种兼顾控制力与能力的方案。

  • Robin 提出的消费者模式是授权粉丝创作,把 Star Wars 粉丝小说和粉丝电影延伸到 AI 生成的未述故事。Rombach 认同,如果模型既能获得权利方接受,又能实现“超级创意式定制”,观众就可以把自己已经想象过的替代事件和不同解读视觉化。

  • 公司成立仅2年,员工数刚超过100人。Black Forest Labs 正在德国和旧金山招聘大规模模型与扩散模型研究人员、负责构建实体 AI 或 IP 解决方案的客户工程师,以及专注于稳定训练和最大化 MFU 的基础设施专家。