先锋 趋势 方法 投研 作者
发明 Prompt Engineering 的人谈 AI、AGI 与人形机器人:Richard Socher & Salim Ismail
返回节目精读

发明 Prompt Engineering 的人谈 AI、AGI 与人形机器人:Richard Socher & Salim Ismail

摘要

  • 基础 AI 正在变成电信式基础设施,持久价值将更多流向客户触达、专有数据闭环和与模型无关的信任层。 Ismail 和 Diamandis 认为开源正在取得优势;Socher 警告,纯模型供应商可能最终像资本密集型电信运营商,其基础设施让其他人攫取经济价值:“没有无处不在的互联网,就不可能有 Uber,但 Verizon 并不能从 Uber 分成。”
  • Socher 认为,投入几十亿美元、用“1年半到2年”,可能就能造出数字超级智能,但他拒绝把 AGI 定义成单一基准测试或机器人测试。 他的务实门槛是自动化约80%的数字化工作,以及其中可能约80%的工作流;严谨定义还必须衡量样本效率、推理、知识、视觉和社交智能。“超级智能完全可以是纯数字的。”
  • 更便宜的智能可能在每单位效率大幅提升的同时,推高算力和能源总消耗。 Ismail 认为,数据中心仍在按照6个月前的成本假设设计,而创造下一代模型所需的增量投入每一轮大约下降10倍;Socher“总体上不同意”,援引 Jevons 悖论称,个人助理、导师、医疗团队和其他高能耗用途会不断增加。
  • AI for science 是本期最具决定性的上行场景,医学、蛋白质、材料和量子模拟都正在进入更快的实验闭环。 Socher 的 Salesforce 团队生成了与天然蛋白质差异40%的功能性蛋白质,而 Frances Arnold 获诺贝尔奖的定向进化流程达到的是3%;Peter 还提到,一名 AI 科学家在48小时内复现了10年的抗生素耐药性研究。Socher 的核心判断是:“凡是可以模拟的东西,AI 基本都能解决该领域里的几乎所有问题。”
  • 当前 AI 估值可能把“种子轮风险”和“后期回报”叠加在一起,形成极高的收入门槛,也让防御性成为核心。 讨论中 Thinking Machines 的起始估值达到300亿美元,而 Socher 偏好的模式要么是横向基础设施,要么是深度理解买方需求、并拥有随着客户使用而持续改善的“良性数据循环”的垂直应用。
  • 人形机器人正在快速进步,但非标准化家庭环境、资本密集度、隐私问题和形态优势不清晰,可能推迟大规模部署。 Diamandis 引用预测称,到2040年机器人数量可能达到100亿台;Ismail 不断追问,一台家用机器为什么需要两条手臂和两条腿,而不是“轮子加7条手臂”。Socher 的平衡判断是,人形机器人和专用机器“不是零和博弈”。
  • 知识工作智能体已经具备实用价值,但真正的 Jarvis 受阻的主要是上下文、信任、法律和互联网经济,而不是模型原始智能。 You.com 称用户已经创建了超过50,000个定制智能体,覆盖营销、新闻和风险投资工作流;完全自主的智能体仍需要细致的偏好数据,也可能遭到依赖广告变现、却被其跳过的网站抵制。“最终,在网上冲浪的 AI 智能体会比人更多。”
  • Bitcoin 的韧性正在增强,但托管和交易设计与消费者金融的可撤销性和保险机制相比仍然逊色。 Ismail 将10亿美元 Bybit 黑客事件以及承诺赔偿客户视为生态系统更具韧性的证据,但建议持有而不是交易,因为一年约80%的上涨空间可能集中在5个无法预知的交易日里。Strategy 再买入20,000枚 Bitcoin、耗资约20亿美元,凸显机构信念;讨论也强调了 Michael Saylor 极具感染力的布道能力。

精读

1. 前沿模型正在甩开用于排名的基准测试

  • Elon Musk 投入60亿美元打造 xAI,成为讨论的锚点:据 Diamandis 称,一个据报道规模最大、结构完整的 GPT 集群在122天内完成组装。Socher 认为这一速度令人惊讶但并非不可能,因为指数级技术遇上资本后会加速,而 Musk 少见地能够把硬件和软件整合起来,而不是把 AI 当成纯软件问题。

  • Ismail 质疑 Grok 3 击败所有竞争对手的说法,称早期报道显示其排名可能略低,但其推出速度仍然“不可思议”。Socher 更广泛的判断是,普通信息需求已经基本得到满足;前沿正在转向“编程、科学、研究”,其中包括 Anthropic 新近发布的 Claude 3.7 模型。

  • You.com 聚合超过40个模型,并根据推断出的意图和用户反馈分发请求。OpenAI 的 o1 和 o3 仍然受欢迎,而 Socher 称 Claude Sonnet 3.5 是最好的编程模型之一。DeepSeek 没有大规模营销预算,却获得了非同寻常的关注度——但 Socher 强调,用户偏好的模型变化非常频繁。

  • 单一智能分数如今掩盖了测试时算力的作用。只要告诉模型“回答前先等一等”,准确率就可能提升,速度也因此成为智能的另一维度;即便是图灵测试也会失效,因为“最好的失败方式”可能是回答得好到不可能,比如在30秒内写出一个应用。

2. AGI 更应按能力定义,而不是靠一场戏剧化测试

  • 当被问到投入几十亿美元是否能让他造出数字超级智能时,Socher 回答:“可能需要1年半到2年。” 他承认,这个问题触及他个人重新投入高强度研究的冲动:商业产品和收入固然重要,但仍有多个研究瓶颈尚未解决。

  • 他从财务结果出发对 AGI 的务实定义,是自动化约80%的数字化工作,再自动化其中约80%的相关工作流——这已经对应“非常大的一部分 GDP”。这个定义之所以有用,正是因为更宽泛的定义极不一致;但 Socher 并没有把它当作完整的学术智能定义。

  • 更完整的定义必须区分视觉、语言、数学、推理、知识和社交能力,还应测试样本效率:人类从1到2个例子就能学习,因此真正智能的系统也应当在某些维度上用远少于现有系统的数据获得能力。

  • Ismail 提出煮咖啡或组装 IKEA 家具等物理测试。Socher 拒绝把具身性视为前提:失明、失聪或瘫痪的人完全可以高度聪明,因此“超级智能完全可以是纯数字的”——物理操控只是另一组能力,而不是智能本身的定义。

3. 开源让智能商品化,而信任捕获价值

  • Ismail 明确认为开源正在取得优势:主流市场的兴奋会吸引过多分布式力量,封闭系统长期很难轻松竞争。眼下的证据就是 DeepSeek;Ismail 想象未来出现一个类似 Wikipedia 的系统,由大量人共同贡献。Diamandis 则把这一趋势与开源 Web 服务器相提并论,称如今99.9%的 Web 服务器已经是开源的。

  • 一家纯基础模型公司最终可能像电信运营商:巨额资本开支打造不可或缺的基础设施,却不保证自己能捕获价值。本期最清晰的类比是:“没有无处不在的互联网,就不可能有 Uber,但 Verizon 并不能从 Uber 分成”;建立在智能基础设施之上的应用,可能拥有客户和经济收益。

  • 因此,You.com 会微调开源模型并聚合外部模型,而不是投入巨资从零训练所有模型。其“信任层”结合公开数据和企业内部数据,提供可直接跳转到原文高亮位置的引用、用户认证和培训,并训练模型在缺少信息时说“我不知道”,而不是编造答案。

  • 这一与模型无关的层能够“让组织面向未来”,避免在更好的模型两个月后出现时,被锁定在一份为期1年的合同里。当前部署包括 Mimecast 等网络安全公司、针对特定出版商的助手,以及把规模最大达到30,000人的学生群体接入平台的大学——这迫使教授重新思考那些模型可以立即解决的作业。

4. AI for science 把发现变成引导式搜索循环

  • Socher 认为,科学和医学获得了异常广泛的支持,因为人们并不想在这些领域增加更多人力;“他们只是想要更多突破和酷的发现。” 目前,人类仍在引导 AI 追逐有价值的问题,随后越来越多地让 AI 在自动化闭环中生成并检验假设。

  • Peter 提到,据报道,一名 AI 科学家在48小时内复现了10年的抗生素耐药性研究,随后转述 Dario Amodei 的预测:未来5到10年将完成“相当于一个世纪的生物医学研究”。与之相关的寿命翻倍被呈现为一种可能性,而不是承诺。

  • Socher 最有力的案例来自他在 Salesforce 推动的蛋白质语言项目,项目始于2018年。团队合成了与天然蛋白质差异40%的蛋白质;Frances Arnold 获诺贝尔奖的定向进化流程达到的是3%。蛋白质正确折叠且具备预期属性,说明模型已经学会了“这些蛋白质的语法和文法”。

  • 机器人实验室可以把生成的假设连接到物理实验;MatterGen 风格的提示词则可以要求具备指定元素、成本、可制造性或超导特性的材料。量子计算可能扩大可模拟的范围,但 Socher 仍保留 Sabine Hossenfelder 的警告——“到时候再看它们是否真的能扩展”——因为离子阱、中性原子和拓扑量子比特等路线仍在竞争。

5. 算力过剩之争,关键在 Jevons 悖论

  • Ismail 认为,数据中心正在被过度建设,因为每座设施反映的都是规划开始时、可能是6个月前预期的模型规模和成本。DeepSeek 表明,打造下一代模型的增量投入每轮大约下降10倍,因此等设施建成时,所瞄准的训练需求可能已经不存在。

  • Socher“大体上不同意”:效率提升会降低智能价格,从而扩大智能的使用范围。每个人都可能通过个人助理、导师和医疗团队消耗算力;充足的能源也会把看似的资源短缺转化为工程问题——例如,海水可以通过海水淡化变成可用水。

  • 双方的部分共识在于区分能源总量和特定数据中心资产。Ismail 预计社会会用掉所有可获得的能源,但传统数据中心的数量会少于预测;Socher 也承认,设施仍然需要足够的数据和工作负载来填满,否则行业可能面临“没有租户的建筑引发的房地产危机”。

6. AI 初创公司定价跑在产品市场匹配证明之前

  • Ismail 对 OpenAI 高管离职给出3种解释:新近变得极具价值的研究人员可以追求个人使命;有人不喜欢“快速行动、快速犯错”的文化;还有人担心能力进步速度超过了智慧增长速度。Socher 将视角拉回加州无法执行的竞业限制:一旦高成本研究证明某件事可行,掌握相关知识的员工就能在其他地方以更低成本复制出来。

  • Thinking Machines 集结了 Mira Murati、John Schulman 等经验丰富的建设者,但 Socher 希望它不要“只是再造一个 LLM”。在讨论中的300亿美元起始估值下,他的投资人框架非常直接:“种子轮风险叠加后期回报”,对应的收入门槛也极其夸张。

  • Socher 把机会分成一小层横向基础设施和数千个垂直应用。他称自己的第一支基金在约4年后达到约5倍 TVPI,并回忆曾以500万美元估值投资 Hugging Face,后者后来达到45亿美元;垂直投资既需要真正的 AI 能力,也需要深入理解买方需求。

  • 最强的护城河是“良性数据循环”。自动驾驶初创公司为每一英里的训练数据支付人工成本,而 Tesla 车主购买汽车的同时免费生成数据;You.com 也会从用户对好答案、坏答案和不喜欢的段落的明确反馈中学习,让产品使用持续改善系统。

7. 机器人会先走向多样化,再决定哪种人形胜出

  • Ismail 持续反问:机器人为什么需要人类形态?他偏好轮子加7条手臂,并认为一台快速机器人可以完成7台机器人的工作。Socher 也追问,既然专用机器可以完成特定工作,为什么需要肌肉骨骼人形机器人,还打趣说:“如果你想要一个肌肉骨骼人形机器人,就找一男一女,生个孩子,再把孩子养大。” Diamandis 则设想每个家庭拥有多台机器人。

  • Socher 拒绝二选一。Machina Labs 的大型机械臂可以成形金属板,把类似工厂的设备运到需要零件的现场——适用于只需要生产200件、而不是数百万件的场景;人形机器人可以与这类专用机器共存,因为机器人产业“不是零和博弈”。

  • Diamandis 称 Unitree 可能是“黑马”,其带轮子的四足机器人能够跳跃、攀爬并快速移动。Socher 开玩笑说,所有人都在制造最初版的 Terminator,却没人尝试制造 T-1000;随后他表示,最近与一名硬件黑客的讨论,让自己原本的变形机器人概念看起来可能真的可行。

  • Peter 重点提到 NEO Gamma 和 Figure 的 Helix,同时承认精心剪辑的演示会省略“37,000次失败的尝试”。家庭环境比道路更不标准化,使操控更难、资本投入更高;早期远程操控还可能意味着,远程工作人员在采集训练数据时能够看到儿童、门和私人空间。

8. 加密资产的韧性提升快于可用性

  • Socher 只持有有限的加密资产敞口,主要把它视为对 AI 的干扰。智能体可以使用加密货币,但也可以使用信用卡;他曾做过尝试,发现 Gas 费几乎和刷卡手续费一样贵,除非交易成本接近于零,否则加密货币的逻辑就站不住脚。

  • Ismail 认为,10亿美元 Bybit 黑客事件是一次韧性测试,而加密生态处理得比早些年更好。一只持有 Ethereum 的冷钱包被清空,但链上资金流动仍然可见,交易所也承诺赔偿客户;讨论甚至延伸到 Ethereum 是否能在盗窃发生前回滚这些交易。

  • Socher 指出了消费者金融的权衡:被盗的信用卡可以申诉并获得赔付,而去中心化也把“风险、安全……以及责任”去中心化了。Diamandis 说,即便对自己而言,使用 Trezor 或 Ledger 也并不简单;Mt. Gox 则被视为一个早期警告,提醒人们不要把大量财富放在中心化交易所。

  • Strategy 又买入20,000枚 Bitcoin,耗资约20亿美元。Ismail 认为,一年约80%的上涨空间可能发生在5个交易日内,并承认自己“惨烈地”错过了其中4天,因此他的建议是买入自己能承受的数量,然后“闭上眼睛持有10年”。Peter 和 Ismail 也强调,Saylor 的布道能力异常有感染力。

9. 智能体先自动化工作流,再成为自主代理

  • Diamandis 将行动视为另一种可以通过模仿和探索学习的序列;Socher 称用户已经在 You.com 上创建了超过50,000个定制智能体。Diamandis 给出的简洁定义是“白领工作描述”:只要一个重复性的知识工作流能够被清晰解释,模型通常就能执行其中相当一部分。

  • 最清晰的例子是,营销人员把每份产品发布 PDF 转化为竞品研究、2个行业邮件营销活动和3篇 LinkedIn 帖子。每当新文件出现,智能体就重复这些步骤;记者可以自动化跨多个指定来源的研究和综合,风险投资机构则可以编码重复性的数据室分析。

  • 预订旅行暴露了自主性的缺口。Socher 作为收入微薄的研究生时,愿意接受10小时中转来节省200美元;如今他可能多花数千美元购买直飞。智能体必须先学会这些不断变化、依赖具体情境的偏好,“砰、砰、砰,一下就完成”才会可信。

  • 真正的 Jarvis 面临4个障碍:同意相关法律限制对他人进行录音;Microsoft 的屏幕监控概念引发了隐私反弹;年轻的 AI 公司还没有获得观察一切所需的信任;网站可能会屏蔽绕过广告的智能体。预订飞往 Utah 的工作航班时,“你的 AI 助手不会被下一次度假的广告分散注意力”——这会威胁 Expedia、Amazon 以及整个互联网依靠注意力变现的方式。