
Arvind Jain
前沿洞察
基础模型正加速商品化与多模互换,顶层霸权终将被稀释;AI应用的真正决胜盘绝非盲目堆砌参数或上下文,而在专有数据上下文、权限安全治理与深度嵌入业务流的执行吞吐。企业若仅沉迷模型能力,必将受困于治理漏洞与失效代理;唯有掌控机构学习与高可信度的Agent协同闭环,方能撬动服务业规模化转化的持久护城河。
观点集合
为什么 OpenAI 和 Anthropic 赢不了应用层|Glean 创始人
- 🗓️ 日期:
2026-07-11| 🎙️ 节目:20VC
开源模型正进入企业拐点:Jain称90%以上用例已可由多种模型处理,Glean团队也首次信任 GLM 5.2 承担大多数工作负载,预计3年内占多数。前沿模型业务将面临降价压力,企业更需要控制 agent 和机构学习;Glean 95%的工程分诊自动化表明,ROI取决于吞吐量、上下文和执行,而不只是模型能力。
查看访谈对话精读提要
开源模型刚刚跨过企业应用拐点。 Arvind Jain 表示,如今包括开源模型在内的众多模型,已经可以完整处理90%以上的企业用例;GLM 5.2 在距离前沿能力不到3个月、也就是“就在上个月”的情况下出现,是Glean团队首次愿意将“大多数工作负载”交给它。Jain的判断是:3年内,企业工作负载的多数“肯定”会运行在开源模型上,唯一的门槛是能否接受中国模型——“这不是开源对闭源的问题。”
前沿模型生意可能被错误定价。 单独看,模型业务“可能没有所有人想象的那么赚钱”:即便是3家实验室的竞争格局也已极其激烈,而开源模型便宜“一个数量级”;Jain还“听说 OpenAI 可能会大幅下调模型价格”。与此同时,过去6-9个月每家模型公司都反常地上调了token价格;Stebbings讽刺说,“他们需要证明自己是好生意,才能上市”,并警告,如果AI大幅降价,这些“支撑着整个全球经济”的亏损实验室将受到严重威胁。
实验室向应用层的推进仍然很浅。 Anthropic面向Figma、法律和金融的垂直产品包“相当浅”,带来的是扩张市场的新使用量,而不是替代既有工作负载;企业则“非常恐惧”运营依赖:机构知识会沉淀在执行工作的agent里,因此企业必须控制agent及其不断复利的学习。Jain给创始人的建议是:把实验室视为“巨大的资产,而不是竞争对手。”
Jain认为团队应该变大——这是本期最尖锐的分歧。 Glean目前有1,000多人,Jain希望5年后达到5,000人:在所有人都能平等获得AI的情况下,仍然维持人数的竞争对手会交付好10倍的产品,“他们会打败你”。对于劳动力与token的取舍,Jain认为技术成本应该下降:“我们过去从未把技术成本和劳动力成本放在同一句话里……技术不是这样运作的”——推理成本会下降几个数量级。
AI回报的核心是吞吐量,而不是模型。 Glean近100%的代码由AI编写,但在企业层面,“产品实际发布速度并没有提高”。其triage agent为一支15人的on-call团队自动解决95%的生产问题,每月成本100万美元,Jain也曾拿它与人工成本比较。先进用例目前只覆盖约5%的员工;解决办法是投资上下文,而不是让模型通过原始MCP连接“暴力搜索”出答案。
按消耗计费可能打破捆绑。 Microsoft如今是重要竞争对手(“很难和免费竞争”),但“一旦转向按消耗计费,就不存在天然的捆绑优势”——企业会在用户选择的任何工具中按工作量付费,这会削弱Stebbings所强调的Copilot锁定逻辑。
中国拥有领先的开源模型,美国正在追赶。 OpenRouter按使用量排名前6的模型都是中国模型,Anthropic作为首个美国模型排在第7;Jain表示,中国是美国之外唯一能产出模型的国家,Stebbings则提到法国“可能有一点”活动。Jain的解释是,模型训练需要前期资本投入,无法由开源式的秘密研发项目负担。美国需要打造自己的开源模型,Nvidia等公司正在成为有动力的出资者。
🔗 原始收听与视频来源: 为什么 OpenAI 和 Anthropic 赢不了应用层|Glean 创始人
AI 企业——Databricks 与 Glean|BG2 嘉宾访谈
- 🗓️ 日期:
2025-12-23| 🎙️ 节目:BG2
Ali Ghodsi 认为有用的 AGI 已经存在,因此 LLM 正趋于可互换的商品,而专有数据、业务流程、治理和应用构成企业持久护城河。投资关键在于 AI 能否规模化转化服务业收入;研究、药物发现和营销已有早期成果,但失败代理、价值归属不确定和主动式工作伙伴仍待验证。
查看访谈对话精读提要
Ali Ghodsi 的核心判断是:“我们已经有 AGI,真的已经有了。” 按他所在的 Berkeley AMP Lab 在 2009 年采用的定义,AGI 已经达标,如今行业只是在“移动门槛”。他将行业分成3派:追逐超级智能的前沿实验室,吸走大部分资本(“我会非常担心那一派”);图灵奖研究者阵营(Sutton、LeCun),判断还要20年(“很可能他们才是对的,可惜了”);以及 Databricks 和 Glean 所在的第三派,专注从我们已经拥有的 AGI 中提取经济价值。
LLM 是商品。 它们像加油站一样可以互换,“只要比价格”即可,用户一天之内就能切换模型,这在此前的平台大战中从未发生。模型公司仍可能很有价值(“TSMC 就很有价值”),但更像晶圆厂;真正的护城河是专有数据和业务流程——“没有任何 AI 理解你的独门诀窍和数据,那才不是商品。”
Arvind Jain 给出的解法是:AI 不是在延长软件,而是在把服务业收入转成 AI 收入。 从向 Nvidia 支付约2500亿美元、推导出约5000亿美元资本开支,再推导出需要约1万亿美元 AI 收入,而整个软件行业收入只有4000亿美元来看,服务业的规模是软件的25倍。Ali 的答案取决于阵营:如果超级智能落地,“那你的任何成本方程都相形见绌”;第三派则根本不需要超级智能。
泡沫确实存在,但不是非黑即白。 “有些零收入创业公司,估值却达到200亿、300亿美元,那就是泡沫。”但两人都预计 OpenAI 和 Anthropic 未来12个月上涨;ChatGPT 和 Gemini “势头正猛”,而编程目前“只吃掉了这个市场的一小部分”。
MIT 所说的95%失败率,恰恰是实验阶段想要看到的结果。 Ali 希望明年也出现类似统计,因为当前真正重要的是激进试错,而不是命中率。那5%的有效案例包括:RBC 在财报电话会后15分钟产出股票研究报告,而行业标准是2小时;Merck 用名为 Teddy 的 transformer 做基因调控药物发现;以及7-Eleven 完全由智能体驱动的营销体系。
Ali 认为大部分价值会流向应用层,“我只是不知道会是哪类应用”。 Arvind 则认为智能层会保持足够厚的价值占比,或许拿走企业价值的一半。Ali 借用1998年的教训:当年所有人都押注 Cisco 路由器和门户网站,最后的赢家却是 Facebook、Airbnb 和 Uber。软件并没有消亡(Salesforce 是“完整的工作流生态”,而不只是数据库),但数据录入是切入口——“Zoom 真的是完美的数据录入应用。”
Ali 看多智能体和语音。 “只要你还在用键盘,我们就还没解决语音问题”,而键盘“基本上会消失”。Arvind 认为编程和客服自动化“有点被过度炒作”。Brad 看多主动式 AI:AI 主动找到用户,把“5%的重度用户”扩展到“100%”。Glean 刚实现2亿美元收入年化规模,正在打造一个具备权限、面向个人的工作伙伴。
🔗 原始收听与视频来源: AI 企业——Databricks 与 Glean|BG2 嘉宾访谈
Arvind Jain 谈 Glean 的打造与企业 AI 的未来
- 🗓️ 日期:
2025-08-05| 🎙️ 节目:Gradient Dissent
Glean早期押注基于BERT的企业搜索,后来成为生成式AI入口:它将客户专属检索和权限控制,与GPT、Gemini或Claude的通用推理结合。商业价值来自对非结构化企业数据的推理,但可靠性更取决于新鲜且获授权的证据,而非流畅生成;更大的机会是让员工完成10倍工作,而非单纯裁员。
查看访谈对话精读提要
Glean 的创立逻辑是企业搜索,但早期押注 transformer,让 2019 年的产品在生成式 AI 到来时占据了异常有利的位置。 Arvind Jain 从一个普遍痛点切入——研究显示,员工有 1/3 的工作时间花在寻找信息上——并使用基于 BERT 的模型匹配概念,而不是关键词。随着生成和推理能力提升,Glean 从“工作生活里的 Google”演变成了“工作生活里的 ChatGPT”。
Glean 在通用能力已经成熟的地方使用 frontier models,同时自行构建企业级检索能力。 它在客户语料上训练小模型,生成定制 embeddings;同时单独微调小型开放域模型,用于拼写检查、同义词处理和缩略词扩展等窄域搜索任务。综合回答和多步推理则交给 GPT、Gemini 或 Claude。Jain 的原则很直接:“不要重新发明已经被发明的东西。”
权限和数据新鲜度,而不只是模型质量,才是企业 AI 的核心约束。 Glean 从 Google Drive、Slack 和 Salesforce 等系统导入治理规则,将权限写入索引,只检索当前登录用户有权访问的文档。由于 embeddings 本身可能泄露受限信息,针对客户的模型只会在 Glean 判断安全的子集上训练。
Jain 的连续创业模式,是在其他人已经放弃的市场里押注普遍存在的问题。 Lukas Biewald 追问 Rubrik 和 Glean 是否体现的是非凡执行力,而非新颖想法;Jain 同意,企业搜索曾经“只有失败”,并成为投资人不愿投入的“死区”。他的信念来自两个变化:SaaS 让碎片化数据问题恶化,却也让数据更容易获取;transformer 则让语义理解在技术上成为可能。他从 Google 带来的运营模式是把创新放在第一位,招募聪明的工程师,并基本放手让他们构建。
一个具体的 ROI 案例,是对企业 95% 的非结构化数据进行推理。 在出现客户流失后,Glean 财务团队一名非工程师员工要求一个 agent 汇总 Salesforce 客户名单、共享 Slack 中的情绪信息和产品使用数据,将客户风险划分为绿、黄、红三档。Jain 认为,这份结果优于传统仪表盘,因为它能够纳入带有主观判断的文本证据。
Glean 评估的是完整的回答链路,同时承认企业 AI 不可能消除错误。 它从真实互动中提取“黄金”问答集,例如获得良好反馈的 Slack 回复,用来测试检索和模型变更,并使用 LLM 作为评审。针对幻觉,它会将回答逐行与提供的源材料核对,并可能压制缺乏依据的表述或直接拒答;但 Jain 表示,过时、缺失或检索不佳的知识,比模型凭空编造本身造成更多失败。
Jain 不认为减少人力是最有价值的 AI 策略;他更希望每名员工身边都有一支可规模化的“梦之队”。 他设想 assistants、coworkers 和 coaches 帮助每个人完成所需工作的 90%,同时企业保留甚至扩大团队,让成员能够完成“10 倍的工作量”。这场变革可能显得渐进——一次只改变一个任务——直到员工发现,自己已经与 2 年前截然不同。
🔗 原始收听与视频来源: Arvind Jain 谈 Glean 的打造与企业 AI 的未来
AI 正让企业搜索重新具备价值:Glean 的 Arvind Jain
- 🗓️ 日期:
2025-05-15| 🎙️ 节目:No Priors
SaaS API、云基础设施和transformers让Glean得以解决企业搜索问题,但其优势取决于筛选当前且权威的信息,而不只是扩大上下文窗口。安全与采用仍是商业化瓶颈:权限索引会暴露治理漏洞,员工也需要训练才能使用对话式AI,而Glean正从搜索扩展到助手和agents。
查看访谈对话精读提要
Jain 认为,企业搜索是在 SaaS API、云基础设施和 transformers 到位后才变得可行。 他在 2018 年底开始思考 Glean,2019 年初创办公司,第一版使用 Google 的 BERT 模型,以及基于企业内容构建的客户专属 embeddings。Glean 最大的客户之一拥有超过 10亿份文档;按 Jain 的比较,这相当于 2004 年整个互联网的规模。
好的企业搜索,不能只靠向量搜索或不断扩大的上下文窗口。 企业系统必须区分当前有效、权威的信息与数十年来积累的过时材料,并以连贯方式呈现;把“100万份文档”按时间顺序打乱后全部塞进模型,仍然会制造推理难题。Jain 说,找到正确来源——或者发现根本没人记录过答案——往往比解决幻觉更难。
Glean 已从“工作中的 Google”扩展为建立在企业数据和知识之上的助手与 agent 平台。 Glean Assistant 将世界知识与经过权限控制的内部数据结合起来;面向特定职能的应用和 agents 则可以限定信息来源、指定语气,并在连接的系统中执行工作。最典型的场景是 HR:员工可以询问福利或 PTO,但答案只能来自 people team“授权或认可”的内容。
安全既是企业 AI 的准入门槛,也是 Glean 相邻的产品机会。 Jain 估计,公司知识有 90% 以某种形式属于私有信息,因此平台的所有访问都必须遵守源数据权限。更好的搜索暴露了原有治理漏洞——包括薪资和一份敏感的 M&A 文件——形成了“产品太好,反而卖不出去”的悖论,也推动 Glean 转向 AI-ready 和安全产品。
员工采用 AI 是行为改变问题,即使界面只有一个输入框。 20 年的 Google 使用习惯训练用户只输入 1-2 个关键词,很多人并不知道如何使用对话式助手;Jain 的结论是,“AI 实际上非常不直观”。除了短期 ROI,他认为企业现在就应培养 AI-first 劳动力,为 3 年后的组织形态做准备。
Glean 的自上而下销售模式由产品架构决定,尽管 Jain 最初的愿望是做 PLG。 即使只有 1名员工进行搜索,也需要索引整个公司的知识库,因此小席位部署成本高昂,而全公司推广才能跑通经济模型。在条件允许时,他建议 PLG 与企业销售同步启动,把 PLG 当作获客漏斗,而不是等 3 年后再建立商业化动作。
管理层仍将重心放在助手和 agent 平台上,因为它承诺的价值本身仍远未实现。 Jain 的销售话术是:用户提出任何问题或交办任何任务,Glean 都能安全调用公开知识和内部知识完成,但这距离现实仍“非常非常遥远”。最终目标是让每名员工拥有一支由助手、同事和教练组成的个人团队,“完成你 90% 的工作”,并“让我们所有人都成为 10Xers”;这显然是愿景,而非当前能力。
🔗 原始收听与视频来源: AI 正让企业搜索重新具备价值:Glean 的 Arvind Jain