先锋 趋势 方法 投研 作者
哪些行业能在 AI 时代存活、新的 AI 基准,以及 2026 年递归学习时间线 | #218
返回节目精读

哪些行业能在 AI 时代存活、新的 AI 基准,以及 2026 年递归学习时间线 | #218

摘要

  • AI 会率先冲击文档密集型行业,而不是同时抹平所有行业。 Fitzpatrick 将媒体、法律服务和业务流程外包列入爆发区,而石油天然气、房地产仍保留大部分底层职能;竞争关键在于“初创公司能否在大公司造出技术前先拿到分发”,尤其是银行业——其大量应用系统已有 20 多年历史。

  • 企业 AI 缺的不是又一个宽泛的模型分数,而是任务级基准。 公开编码基准显示,模型在 3 年里多项指标提升了 50% 到 100%,但企业需要的是“某项具体任务上的准确率或人类等效水平”——从理赔处理到产权保险都如此;即使达到“80%准确率的超聪明部署”,生产风险仍然过高。讨论因此指向数千个窄领域基准,其所有权可能为被忽视的行业带来曝光度和议价能力。

  • 2026 年的实操打法是跟着价值走,挑 2到3 个用例,并让运营负责人而不是技术部门负责。 Fitzpatrick 建议约 1 个月内做出可运行原型,将其绑定到 CSAT、库存周转天数、缺货率或每通电话成本等指标,并追问:“你愿不愿意拿全年奖金下注,保证部署的用例有效?”对于第一个项目,他倾向于向第三方供应商发出按结果付费的 RFP。

  • 对大多数企业而言,一开始就追求完全自治是错误的架构。 据报道,Klarna 曾称其 AI 每月处理 230万通电话,完成 700 名全职客服的工作,并可每年节省 4000万美元,但在 8到12 个月后逆转方向;Fitzpatrick 的结论是,让智能体处理常规工作,把复杂退款、回写源系统以及希望联系真人的客户升级给人工。“人在回路中将是功能,而不是缺陷。”

  • 通用模型可能让模型构建商品化,但公司上下文、定制评估和数据安全仍是企业问题。 Fitzpatrick 预计企业会定制前沿模型,而不是自行预训练模型,让可替换的模型位于公司专属文档、工作流和基准之下。关键是区分真正的专有信息——例如 Jane Street 的交易数据——与普通后台数据;有必要时使用本地部署或小语言模型,而不是把所有数据一视同仁。

  • 最强的部署都从窄范围的数据整合开始,并且已经带来可量化的运营改善。 Invisible 整合了 750 张 SwissGear 表格,将整体库存覆盖率提高约 30%,并在几个月内让获得可靠预测的 SKU 数量翻倍;它还为 Charlotte Hornets 构建球员移动模型,为 Lifespan MD 搭建符合 HIPAA 的控制塔,并为美国海军提供水下无人机决策系统。反复出现的模式是:具体数据、边界明确的决策,以及可观察的结果。

  • 本期的核心分歧在于,递归自我改进是否会很快消除对专业人类反馈的需求。 Wissner-Gross 给出保守的“最多 2到3 年”外部上限,认为 AI 研究员将达到或超过人类模型研究员;Fitzpatrick 则认为,隐性专业知识、公司特有工作、新模态、新语言、机器人和多步推理会持续制造新的评估需求。他不排除有用的训练前沿在 10到15 年后耗尽,但认为人类专业知识和人在回路中的工作仍将在很长时间内重要。

  • 2026 年的架构判断是多智能体、多模态和重模拟,政府流程自动化可能是最大受益者之一。 Fitzpatrick 预计由 LLM 编排任务专属智能体,增加音频、视频和图像交互,并通过“镜像世界”或 RL gym 在真实部署前测试系统;引用的估算显示,AI 辅助审批可能将能源和数据中心建设周期缩短 50%,许可、福利审批和合规周期则可能缩短 70%。

精读

1. AI 冲击将集中在“文档就是产品”的行业

  • Fitzpatrick 不接受所有行业会受到同等冲击这一前提。媒体、法律服务和业务流程外包产生大量知识工作和文档,这些活动最直接暴露在冲击之下;而 Wissner-Gross 谨慎收窄了自己的判断:“按我们目前理解的知识工作”已经走到尽头,但不一定意味着知识工作者或整家公司会消失。

  • 石油天然气和房地产明显不同,因为它们的核心职能仍然存在。Fitzpatrick 认为,决定买哪套公寓或哪栋办公楼,整体上仍会像 5到6 年前那样运作,即便 AI 改善了辅助分析;企业应找出真正能够改变的运营环节,而不是宣布整个公司“AI-first”。

  • 竞争关键在于“初创公司能否在大公司造出技术前先拿到分发”。银行业体现了这种张力:其大量应用系统已有 20 多年历史,而 Revolut 等新金融科技公司可以用不同方式搭建系统,不必背负同等的现代化改造包袱。Fitzpatrick 没有判断哪一方会胜出。

  • 能力是另一个独立于行业暴露度的约束。一家 50 人的公司可能连 CTO 都没有,成熟的 IT 团队也未必具备相关技能;即使会 Python,也可能存在能力缺口。Fitzpatrick 的建议很直接:无法招聘或培养相关能力的公司,就通过合作伙伴租用这些能力,不要假设每家公司都能内部自建。

2. 可量化基线决定采用能否安全推进

  • 抵押贷款承保之所以取得进展,是因为银行可以用统计上有效的基线回测决策,并检查最终的信贷决策是否有效且没有构成红线歧视。联络中心也有类似的清晰指标——通话时长、每通电话成本和 CSAT——按理应成为特别适合 AI 的领域。

  • 法律工作分为咨询和商品化生产两部分。Fitzpatrick 预计,一笔大型并购交易仍需要高端法律顾问,但常规 NDA 和标准化文件会大幅压缩;Diamandis 指出,风投文件反复带着 5万美元法律费用上限,只有“大约 8 个旋钮”,却不知为何总是做到“49,999.99美元”,尽管彼此几乎完全相同。

  • Klarna 成为了反面案例。据报道,该公司曾称其 AI 每月处理 230万通电话,替代 700 名全职客服的工作,每年可节省 4000万美元;在成为智能体成功案例的旗舰故事约 8到12 个月后,公司却宣布回归人工客服中心。

  • Fitzpatrick 提出的是推测,并非内部消息:一些客户就是要求和另一个人沟通,而退款及其他非一线事项则需要向源系统进行复杂回写。他困惑的是架构——合理设计本来就应该是不断变化的智能体与人工组合,而不是“全人工、全智能体、再回到全人工”。

3. 企业 AI 需要价值驱动的操作系统,而不是战略文件

  • 面对董事会“你的 AI 计划是什么?”这一问题,CEO 应该“跟着价值走”。Fitzpatrick 会选择 2到3 个足以实质性推动业务的杠杆——客户服务、FP&A 预测、库存管理或数字营销——然后只把其中 1到2 个带入真实试点,而不是鼓励无重点的试验。

  • 生成式 AI 颠倒了过去的机器学习部署路径。原型大约 1 个月就能运行,而不是先花几个月搭建,但可靠性要靠之后密集的测试和验证来形成。战略演示文稿不是进展,决定性问题是:“你愿不愿意拿全年奖金下注,保证部署的用例有效?”

  • 对于第一次实施,Fitzpatrick 建议向第三方发出按结果付费的 RFP。内部团队可能缺乏经验,也无法接受“有效才拿钱”这样的约束;与结果挂钩的合同既转移部分执行风险,也迫使所有人事先定义成功标准。

  • Fitzpatrick 援引一份 MIT 报告称,只有 5% 的企业模型进入了生产环境,并指出组织本身是失败的核心原因之一。应让最好的运营负责人、而非技术组织负责人牵头,并分配一个业务 KPI:服务场景看 CSAT 或通话时长,预测场景看库存天数和缺货率。否则,“百花齐放”最终只会变成无人负责的科学项目。

4. 窄领域基准将成为企业 AI 的控制层

  • 广泛的公开基准,尤其是编码基准,仍然是衡量整体进展的有用指标;按 Fitzpatrick 的解读,模型在 3 年里大多数可观测维度提升了 50% 到 100%。但它们的局限在于相关性:企业需要的不是抽象智能,而是“某项具体任务上的准确率或人类等效水平”。

  • 联络中心基准应把 AI 智能体与公司自己的专家客服在代表性通话上进行比较。理赔处理需要自己的人工等效数据集。“80%准确率的超聪明部署”仍可能风险不可接受,因此每条工作流都需要围绕实际错误、阈值和升级条件构建定制评估。

  • Diamandis 看到了创业机会:既懂 AI 又懂产权保险等被忽视领域的从业者,可以在其他人之前定义并传播该领域的基准。按他的说法,对无人认领的评估类别建立可信的所有权,可能让一个人“一夜成名”,因为创建基准可能比创建后训练模型更难。

  • Invisible 已经围绕单项任务构建客户专属基准。通用销售智能体不能像传统 SaaS 那样直接购买;它必须学习公司的产品、知识库、销售方法和“说话方式”,再通过本地评估检验定制后的行为是否真的有效。

5. 通用模型赢得底层,企业上下文留在本地

  • Wissner-Gross 提到那个“臭名昭著的 BloombergGPT 时刻”:Bloomberg 拥有专有金融数据,希望获得领域优势,但据报道,前沿实验室的通用模型在几个月内就超过了该项目。他质疑,如果通用模型持续吸收专业能力,内部数据和后训练是否还有持久价值。

  • Fitzpatrick 区分了构建语言模型与添加公司上下文。他不认为单个机构会自行预训练计算密集型 LLM,而是预计它们会利用私有文档、偏好的输出形式和工作流来定制领先模型,同时搭建一个企业层,使更新的基础模型日后能够被“直接替换接入”。

  • 律所偏好的并购文件说明了公共模型无法知道的部分。相关信息仍需要本地定制、后训练或评估。Ismail 将论点进一步推进:关于“我们是怎么做事的?”这类商业秘密知识,可能成为公司的最有价值优势,从而增加内部数据与更广泛 AI 世界之间的保护需求。

  • Fitzpatrick 反对把每一个字节都视为圣物。银行、医院和交易公司可能会将敏感信息留在本地部署环境,或使用小语言模型,但 Jane Street 的交易数据与其后台预测数据并非同等程度的专有信息。可行的政策应根据实际竞争或监管敏感度对数据分类,而不是拒绝所有外部模型。

6. 数据就绪意味着组装“最低可用真相”

  • 建立在分散客户和产品记录上的智能体“按定义就会出问题”。因此 Fitzpatrick 每个用例都从输入开始,但他不主张耗费 5 年完善整个企业数据湖——许多大型组织已经走过这条路,却仍没能让每个数据仓库都准确、可访问且相互一致。

  • 信贷承保可能需要 5到6 个核心类别:贷款本身、市场环境、公司财务状况、信贷担保以及相关变量。它不需要商业银行的每一条记录。实际问题是:“针对这个具体用例,我需要哪些数据?”然后进行有针对性的修复。

  • 生成式 AI 还提升了那些从未进入记录系统的信息价值:视频、图像、自由文本和其他非结构化文件。这些资产过去并不是人们试图掌握的对象,因此第一步是明确任务,并让相关数据具备可用性。

  • Blundin 的 Vestmark 案例进一步说明了这种区别:对账记录展示账户最终如何完成对账,却没有记录员工为解决问题做了什么。AI 助手可以先观察并加速工作流,再生成自动化所需的人类反馈或调优数据。另一位银行 CIO 则面对 300 个受保护的客户数据库,每个数据库都由不同的产品孤岛负责。

7. 当决策和数据边界清晰,领域部署才能奏效

  • 对 Charlotte Hornets,Invisible 基于来自多个大学和国际比赛场馆的单点视频,微调了计算机视觉模型。传统统计可以捕捉得分、篮板或正负值;该模型则衡量球员移动、空间以及谁在创造空间,跨越不一致的镜头角度,为选秀评估者提供交易型统计数据无法揭示的特征和球员适配度证据。

  • Lifespan MD 从数据架构开始,而不是自动诊断。Invisible 的 Neuron 平台整合出符合 HIPAA 的多租户患者、医生和诊所绩效视图,使用户能够提出“35到50 岁男性最常使用哪些长寿测试”等问题。患者数据仍保留在各个诊所,临床医生和中央运营人员只能获得与其职责相匹配的访问权限。

  • Fitzpatrick 认为,临床决策比行政事务更模糊。美国人均医疗支出约为 1.3万到1.4万美元,德国或加拿大约为 2500到3000美元,其中约 30% 到 40% 流向行政环节。更近的机会是消除排班和文书工作,同时让医生“获得更强的能力”。

  • 其他项目扩大了这一模式,但没有改变其本质:Invisible 与 SAIC Vantour 和美国海军合作,研究围绕传感器丰富的水下无人机群进行决策;在 SwissGear,它整合了 750 张表格,将整体库存覆盖率提高约 30%,并在几个月内让获得可靠预测的 SKU 数量翻倍。库存项目的目标是同时减少缺货和过量库存。

8. 人类反馈正变得更专业,而不是简单消失

  • Invisible 的 Meridial 业务负责训练模型,企业业务则构建定制应用。Wissner-Gross 追问:如果 AI 研究员能够构建模型、数据集和基准,是否会消除人类机器学习贡献者市场的必要性;Fitzpatrick 回应称,RLHF 即将消失的预言已经持续了 5 年,却始终没有与部署现实吻合。

  • 工作正从商品化的“猫狗、猫狗标注”,转向博士和硕士级别的评估、受控 RL 环境、模拟和 RL gym。Fitzpatrick 表示,研究和运营经验都支持合成数据与人类数据结合,尤其是在多步推理场景中,因为幻觉可能沿着推理链不断累积。

  • 他最典型的例子刻意保持窄范围:一个研究 17 世纪法国建筑演变、并且用法语工作的模型,仍然需要合格的人类来验证。同样的逻辑适用于新的法律数据集:律师助理或并购律师必须判断生成的文件是否真正达到专家工作的可比水平。

  • Wissner-Gross 的反驳针对的是效率,而不是否认反馈价值。强化微调可能比大规模标注劳动力需要更少的人类工时,而 RL 环境一旦建成就可以扩展。Fitzpatrick 承认形式会演化,但指出后训练反馈只占总算力成本的一小部分,却是最有价值的输入之一。

9. 递归自我改进可能跑赢企业吸收速度

  • Wissner-Gross 给出“2到3 年”这一保守外部上限,认为 AI 研究员将达到或超过构建机器学习模型的人类研究员。他预计递归自我改进能力将在 2026 年加速,而企业仍会“以蜗牛般的速度”前进,使实施、变革管理和工作流瓶颈成为硬约束。

  • Fitzpatrick 不排除机器可能在“10到15 年后”耗尽有用的训练前沿,但认为短期内不存在供给不足:新语言、新模态、机器人任务、法律细分领域和公司专属工作流,会持续创造更窄的评估需求。通用能力不会凭空制造私人先例,也不会制造只存在于资深人士头脑中的隐性专业知识。

  • 销售是他反驳完全通用化的例子。最优秀销售人员的打法通常没有文档记录,而一个充斥着 500 家邮件型 SDR 供应商的市场,可能让真正的互动变得更加稀缺和有价值。“人与人接触的元素会变得越来越重要”,尤其是在信任、例外处理或真实性决定结果的场景中。

  • Wissner-Gross 将商业机会定义为能力与采用之间的缺口:Invisible 这样的公司可以成为连接前沿实验室与企业的“润滑剂”。在他的联络中心测试中,80% 的人更喜欢 AI,而不满意的 20% 可能把系统“折磨到彻底崩溃”,从而为路由、评估、数据和异常处理创造有利可图的业务。

10. AI 原生挑战者会重构流程,而不是自动化岗位盒子

  • Ismail 的 Canon 思维实验以功能流程取代部门思维:营销、零售销售、注册、墨水补充、预测性维修、追加销售和会计,成为由 AI 管理的一体化打印机生命周期。产品自行报告状态并触发下一步行动,最终可能让人类“90%退出回路”。

  • 他把当下逐个员工自动化的做法称为“电视上的收音机”——就像把广播员放到电视里照读旧稿,而不是适应新的媒介。AI 原生公司从目标功能出发,重建整个运营系统;传统企业则倾向于把助手贴到既有岗位和交接环节上。

  • Diamandis 再次回到传统企业的分发优势。他的方案是邀请全球 AI 创业者展示他们将如何颠覆公司,资助最好的 5 个项目,给予数据和访问权限,然后收购有效项目或取得多数股权,把它们变成新公司。目标是先“边缘创新”,再让边缘取代传统中心。

  • Ismail 将 Apple 的小型秘密团队视为组织范本,称大约有 18 个团队在研究不同产业,并耐心迭代,直到进入时机成熟。大型运营商可能难以攻击自身已经优化的核心业务,但它们对相邻行业的理解,可以支持面向邻近市场的 AI 原生创业项目。

11. 多智能体团队、多模态和镜像世界定义 2026 年

  • Fitzpatrick 对架构的第一项判断是多智能体团队。企业不会让一个智能体做出所有决策,而是把任务专属智能体训练到高准确率,再置于一个负责编排整体逻辑的 LLM 之下。联络中心就是天然案例。

  • 第二项判断是多模态跃迁。音频、视频和图像将成为人们与模型互动方式中更大的组成部分,让交互超越历史上以文本为主的界面。此前篮球、医疗和无人机的案例说明,即使软件界面不是多模态,企业数据表面早已是多模态的。

  • 第三项判断是“镜像世界”或 RL gym:通过模拟环境和数字孪生,让编码、联络中心或制造系统在接触生产环境前执行任务并接受测试。对于现实错误代价高昂或具有危险性的系统,模拟提供了可重复的测试方式。

  • 数字人也是 2026 年可能出现的发展方向。Fitzpatrick 表示,用他的公开言论训练一个数字人并不困难,并提到体育相关数字人项目已经在推进;他预计,人们可能更愿意通过数字人与熟悉的人物交谈,而不是使用通用聊天机器人,让合成人格更自然地成为交互的一部分。

12. 人类工作将转向实体存在、真实性和新类别

  • 被问到“最后留下的专家”时,Fitzpatrick 给出的是大类,而非 3 个精确职业。地震勘探、钻井现场运营、房地产选择、实体技工以及围绕人与人互动展开的工作,会存续更久,因为它们的功能不只是搜索文档。近期冲击仍集中在业务流程外包、法律服务和媒体。

  • 他不认为任务被冲击就等于就业下降。媒体的经济模式和渠道发生了变化,但 Substack、Medium、博客和其他形式创造了更多媒体创业者。Fitzpatrick 援引估算称,美国每届高中毕业生中约有 25% 最终进入一个在其高中时期尚不存在的领域,而美国就业中已有 20% 属于数字生态系统岗位。

  • Wissner-Gross 给出 3 个相互竞争的最终职业候选:政治家,因为他们制定法律;最伟大的物理学家和数学家,因为他们代表人类智力工作的顶峰;或者那些客户要求真实人类作为交易对手的职业。Diamandis 将第三种假设概括为:“品味定义者将占据主导。”

  • 政府可能带来最清晰的社会回报。Fitzpatrick 援引一项研究称,AI 辅助审批可能将能源和数据中心建设周期缩短 50%;OECD 的估算则显示,许可、福利审批和合规周期可能缩短 70%。他认为,围绕支出和基础设施部署进行项目管理、压缩建设周期,是简单且价值很高的应用。