先锋 趋势 方法 投研 作者
摆脱 AI 垃圾内容:Atlassian 如何让 AI 队友拥有品味、知识和工作流——与 Sherif Mansour 对谈
返回节目精读

摆脱 AI 垃圾内容:Atlassian 如何让 AI 队友拥有品味、知识和工作流——与 Sherif Mansour 对谈

摘要

  • Mansour 对企业 AI 的核心判断是:围绕“虚拟队友”的权限化工作流上下文,比任何单一模型都重要。 Atlassian 被描述为一家400亿美元、全球前100的科技公司,如今用户已主要来自非技术团队,约350万人在使用其 AI 能力。战略重点正从个人聊天提效,转向让智能体参与共享项目和服务工作流。

  • 摆脱千篇一律 AI 产出的操作配方是“品味、知识和工作流”。 品味赋予智能体团队的声音与判断;知识让它扎根于组织资料;工作流决定它在哪里行动、由人在哪里复核。Mansour 举的采购案例,把 Confluence 和 SharePoint 中的指引接入 Jira 流程:智能体审阅新收到的合同、起草回复,再交给人工处理。

  • 仅靠具备权限意识的 RAG,回答不了许多企业真正关心的问题。 “我的团队上周做了什么?”这类查询,需要 Atlassian 的团队协作图谱穿越人员、团队、Jira 条目、Confluence 页面、Figma 设计、GitHub pull request、目标和协作信号;返回语义上最相似的5份文档远远不够。相反,“年假流程是什么?”仍是典型的 RAG 问题。

  • Mansour 预计,通用模型会在“80-90%”的普通知识工作场景中商品化,路由基础设施和模型稳定性将比品牌选择更有价值。 Atlassian 通过一个覆盖云端和本地模型的网关,在困难任务上保留昂贵的能力,把摘要等简单任务分流出去。客户还需要识别何时 AI 只是“火箭筒”,却被拿来打蚊子,并改用确定性规则或代码技能。

  • 聊天可能是 AI 的通用界面,但 Mansour 认为,从长期看它往往会是“最差的界面”。 他的 MS-DOS 类比是:命令行保持通用,但专业应用最终赢得了具体工作;同样,可预测的垂直界面应当建立在对话模型之上。这意味着,即使几乎所有功能都能先用 prompt 做出原型,设计和领域专属 UX 仍然具有防御性。

  • AI 应该提升个人杠杆率,但不会自动催生外界热议的“一人独角兽”。 Mansour 观察过的一家5人初创公司也在使用编排式智能体、重复性工作流和人工复核;员工依然是瓶颈,想法多于执行能力,而监管和领域专业知识仍需要人参与。他更深层的反对理由在于差异化:没有持续的人类品味,多家 AI 原生公司最终会产出“80%相同”的结果。

  • Atlassian 收购 The Browser Company,押注的是工作浏览会像企业消息一样,最终与消费级浏览分道扬镳。 一个理解用户权限、组织知识、团队协作图谱、SaaS 工具和虚拟队友的浏览器,可以围绕知识工作重建。对于 AI 并购,Mansour 更看好拥有高价值最后20%、并与用户或买方保持“工作流近距离”的垂直产品。

  • 企业采用 AI,关键不在强制推行,而在同步、无风险的实验。 Atlassian 为一场 AI builder week 统一腾出时间,约1,000名产品经理、设计师、工程负责人和研究人员参与,并把“结果”定义为学习,而不是交付产品。Mansour 的实践建议是,把现有任务拆解为知识、指令和行动,而不是凭空发明一个“杀手级用例”;同时要个人充分使用 AI,让新行为变得自然。

精读

1. Atlassian 看到 AI 从个人助手走向团队参与者

  • Mansour 将 Atlassian 描述为一家协作公司,而不只是软件开发供应商。公司早期客户主要是软件和 IT 团队,但如今大多数用户来自 HR、财务、市场、法务等非技术部门,这些部门要么负责项目,要么提供内部服务。

  • AI 用户规模是这一判断的重要依据:约350万人已经在使用 Atlassian 的 AI 能力。Mansour 区分了个人聊天提效与让“团队智能体进入他们的上下文”这两件事,后者可以帮助多人通过协作流程推进共享工作。

  • Labenz 强调,能够随时接入的知识工作者之所以有吸引力,是因为软件式智能体可以7×24小时运行、扩展为多个并行实例、在不需要时关闭,还可以被复制。但它们的毛刺仍然存在,使组织无法完全像对待人类队友一样对待它们。

  • Mansour 的回答有意保持平衡。没人想要一个“极其机械”的东西,但一个过度模仿人类的系统同样会让人觉得不真实;因此 Atlassian 使用“虚拟队友”和“协作者”这样的说法,但不假装它们就是人。

2. 信任与团队性格,是对抗 AI 垃圾内容的解药

  • 在商业场景中,真实性最终体现为信任,而信任高度依赖透明度。Mansour 希望用户能看到智能体的指令、创建者和近期操作;Atlassian 甚至设有专门团队,持续改进 Rovo 的引用,让回答可靠地暴露底层来源。

  • 团队智能体也应体现所加入团队的特征。每个团队都有自己的“性格”:内部笑话、词汇、语气、创作直觉和规范。服务客户的银行团队,不应听起来像一家面向年轻人的数字营销机构,即便两者调用的是同一批底层模型。

  • Mansour 对 AI 垃圾内容的定义很窄:产出技术上正确,但“创意很偷懒”,不同用户拿到的结果基本一样。他的应对方式是加入“你们团队的性格、你们团队的灵魂”,在不让智能体虚假模仿人类身份的情况下保留差异化。

  • Labenz 的开场介绍正好说明了这一点。过去2年,从 Claude 2 开始,他一直把既有文章和本期节目的文字稿提供给 Claude,再对草稿进行大量编辑;Gemini 3 则生成了他有史以来最好的初稿之一,似乎从写作样本中“读懂”了他。模型固然重要,但经过筛选的示例才真正承载了品味。

3. 品味、知识与工作流,把模型变成商业系统

  • Mansour 将有用的企业部署归结为3个要素:“品味、知识和工作流”。品味是组织对于某件事应当如何呈现、如何表达、如何运转的判断;缺少它,企业就可能用广泛可得的同一批模型,生产出相同的网站、产品和服务。

  • 知识意味着决定智能体可以访问什么、或者基于什么训练——这是两个相关但不同的选择。接入的资料可能来自 Confluence、SharePoint、GitHub、Salesforce 及其他系统,并且要服从每个用户自己的权限,而不是进入一个组织级共享池。

  • 他最典型的案例是采购。团队把合同审查标准记录在 Confluence,把补充材料放在 SharePoint;当一个带有供应商合约的 Jira 工作项到达时,智能体审阅合同、起草回复,再将工单交给人工批评和迭代。

  • 实际的发现方法应从当前工作出发,而不是臆想一个杀手级应用。Mansour 会让团队解释自己已经在做什么,再找出品味在哪里介入、需要查阅哪些知识,以及智能体可以插入现有工作流的哪个位置。

4. 采用沿金字塔上行,但上下文与评估仍然是本地问题

  • Mansour 用一座受埃及风格启发的金字塔来描绘 AI 成熟度。底层是提问;下一层是生成提案、节目说明等成品;第三层则是把团队知识和指令组合成可重复的工作流,提升质量、效果、效率或创意产出。

  • 个人记忆能帮助用户向上攀登,而不必每次手动搭建完整的上下文包。在 Confluence 里使用 AI 辅助写作时,“短一点”或“你太正式了”这样的修正会直接发生在工作现场;例如,Rovo 已经知道 Mansour 喜欢在标题前加合适的 emoji。

  • Atlassian “默认开放”的传统,可以帮助组织快速建立上下文。一个刚入职、处于封闭文档环境中的员工,在获得权限前可能几乎得不到有用答案;在开放知识库中,同一个人可以直接调取机构信息,否则可能需要分别联系50位同事。

  • 但 Mansour 不接受魔法般的个性化:“你得投入努力,才能得到结果。”熟悉的最后20%可能还要再耗费5到6个小时。产品信号包括用户是否实际使用产出、点赞评分和反复改写;专业智能体的创建者则需要定义自己的成功标准,并加入优质和劣质回答示例。

5. 企业检索需要具备权限意识的 RAG 与团队协作图谱

  • Labenz 将技术问题界定为上下文窗口中的工作记忆与模型权重中固化的知识之间的空间。Mansour 把这块空间拆分为个人记忆、具备权限意识的企业检索,以及结构化的组织关系,而不是押注不断扩大的上下文窗口能解决一切。

  • 企业 RAG 之所以格外困难,是因为可见性可能细到单个字段。一个用户可能只能看到 Salesforce 记录或 GitHub issue 的部分内容,另一个用户则能看到更多;因此覆盖 Salesforce、SharePoint、GitHub 等系统的语义索引,既要执行权限控制,又要保持速度。

  • Atlassian 的团队协作图谱映射用户、团队、目标、工作项、文档、设计、pull request 及其相互关系。Jira 往往充当记录系统,追踪工作进展,并链接到实际发生工作的地方;日常使用中,人们粘贴相关链接,也会继续为图谱补充信息。

  • “给我一份关于我的团队上周做完所有事情的状态更新”,暴露了 RAG 的边界。系统必须识别“我的团队”,遍历其成员及关联的 Jira 条目、Confluence 页面和 Figma 设计,再套用组织的状态更新格式;仅仅总结5条蓝色链接远远不够。

6. 图谱遍历与语义检索,解决的是不同问题

  • Mansour 并不认为图谱可以取代 RAG。公司年假流程这类请求,最适合检索相关政策;而团队状态问题,则需要沿着明确建模的人员、工作和时间关系进行广泛遍历。

  • Labenz 将这种架构比作 HippoRAG:识别并对齐实体,沿一个或多个跳数向外扩展,再在形成的范围内进行搜索。Mansour 同意多跳遍历很重要,但补充说,Atlassian 还可以在文档关系之外叠加一张独立的协作图谱。

  • 点赞、评论、分享、浏览和反复协作,都可以为相关节点加权。如果 Labenz 经常评论 Mansour 的页面,这种关系就可能帮助引导人员与工作查询;当用户的问题需要时,系统还可以区分已经看过的资料和未看过的内容。

7. 有用的组织记忆,必须学会遗忘

  • 默认开放的知识会带来反作用:一些客户拥有20年可访问内容,而旧页面可能早已不再描述现实。企业记忆因此需要时间、活跃度等信号,以及权限检查和语义相似度。

  • Mansour 亲自遇到过这种失败:Rovo 用4或5年前的一个目标,重写了团队章程。由于他从未将该目标归档,它仍被标记为活跃状态,因此系统合理地把过时源数据当成了当前组织事实。

  • 系统会尝试根据时间、活跃度、协作情况和对象状态施加不同形式的衰减,但 Mansour 仍把责任留给客户。当有人提议接入整个约1 TB 的 SharePoint 实例时,他的回答基本是:能不能接入,可以;有没有必要,不确定。

  • 原则仍然是“垃圾进,垃圾出”。评估企业 AI 系统的买方应当追问:接入的数据源是否表达了生命周期状态,旧信息能否失去权重,以及当问题确实需要历史资料时,系统是否仍能把它检索出来。

8. 模型路由与确定性代码,胜过不加区分地调用推理

  • Atlassian 内部首先处理“风险最高的假设”:先证明 AI 功能有价值,再纠结推理成本。在探索阶段,可以通过受控发布管理成本;只有当产品契合度开始显现后,团队才会优化延迟、模型选择和费用。

  • 主要应用中已经有“远超70或80项” AI 能力,反复出现的模式开始足以支撑基础设施。AI 网关让团队能够替换和测试大量云端及本地托管模型,把摘要等简单任务发送给更便宜的选项,同时将复杂任务留给更强的模型。

  • 客户工作流带来另一种优化问题。现有 Jira 流程包含数百万条工作流和潜在的智能体插入点,但一次确定性的字符串检查,可能比 LLM 更快、更便宜、更可靠地完成工单分类。一位客户意识到,他们手里有“一具火箭筒”,却在“拿它打蚊子”。

  • 因此 Atlassian 的智能体框架同时支持无代码技能和代码技能:模型可以调用精确函数,完成数学计算、账单核验或其他业务规则。Labenz 也同意,凡是传统代码能完成的事情,通常都应继续交给传统代码,即便正则表达式或函数本身是由 AI 写出来的。

9. 通用模型走向商品化,但行为稳定性仍然重要

  • 客户过去坚持说:“我想自己选模型。”Mansour 现在看到,这种担忧的重要性正逐渐接近 PostgreSQL 与 MySQL 之争。Atlassian 使用广泛组合,包括 GPT、Claude 和 Mistral 的不同版本,并公开主要功能所使用的模型信息,而不是把某一家供应商当成通用答案。

  • 他给软件构建者的建议是结构性的:建立网关,因为模型、成本和相对优势都在持续变化。代理、切换、测试和重新路由工作负载的能力,已经让 Atlassian 的开发速度和运营经济性提升了“数量级”。

  • Mansour 对商品化明确加了一个限定。通用模型可以“轻松”解决普通桌面知识工作问题中的约80-90%,但垂直模型——例如专门用于 DNA 测序或医疗保健的模型——仍可能保有差异化价值。

  • 模型可互换性也会止步于评估环节。智能体创建者可能围绕某一种行为特征调校指令和测试;如果一夜之间换掉底层模型,输出可能发生实质变化。因此,即便模型品牌不再是终端用户的卖点,稳定性仍类似于 API 稳定性。

10. 聊天是 AI 的通用界面,也是最差的界面

  • Labenz 提出,只有在需要人类智能、品味或判断时,软件才应当展示 UI;如果 AI 能提供这些输入,理想产品可能会变成用户几乎不需要触碰的软件。他追问,如今的 SaaS 界面是否应逐步抽象为智能体任务。

  • Mansour 用 MS-DOS 回应。终端曾是操作系统的通用界面,能够支持写作、数学或 ASCII 艺术,但专门的文字处理、图像生成、表格、音频和播客录制工具仍然出现了,因为通用界面往往不适合具体工作。

  • 同样的模式还会重演:“聊天是通用界面,但从长期看它是最差的界面。”Mansour 会问产品团队,一个功能是否可以先通过 prompt 做出“穷人版”;如果可以,产品真正要做的就是把数据、控制和交互包装成更好的体验。

  • 他不认为不断生成界面就能消灭设计。动态表单适合输入可预测的场景,但用户仍需要校验、条件字段和稳定的习惯性行为。Labenz 的儿子用 Leonardo AI 制作游戏精灵,正说明了这一点:对于可预测的精灵变体,专门设计的体验会胜过每次都在通用聊天框里重新描述。

11. AI 不会抹掉 SaaS,反而提升编排价值

  • Labenz 提出了更强的反方论点:既然 AI 可以回答工单,也许工单分流本身就会消失——类似 Elon Musk 所说的原则:“最好的步骤就是没有步骤。”智能体最终可能以不同于人类的方式组织工作,为人类限制设计的工作流会变成在位者的陷阱。

  • Mansour 承认,智能体未必会像人一样工作,但它们的行动仍会以工具或技能的形式,在某个序列中被调用。依然需要决定哪些行动交给智能体、哪些由人保留,以及人和智能体如何分工、如何处理交接。

  • 在这一框架下,Jira 的价值不只是一个通用的“待办、进行中、已完成”看板。客户通过编码产品构建、事故处理、客户服务、员工入职和变更响应的方式,把 Jira 变成自己的系统——将组织品味表达为工作流。

  • 他的结论是绝对的:“智能体编排加人工工作流”会成为关键,而“所有人都会从做事转向设计事情”。即使是动态生成的专业软件,最终也必须变得可预测、可扩展;围绕引用、司法管辖区和判例设计的复杂法律界面,正说明垂直工具仍会存在。

12. AI 杠杆改变团队形态,但不会消除人或判断

  • 针对一人独角兽的论点,Mansour 提到一家5人的销售 AI 初创公司:其智能体通过 Jira 工作流,定期向 WordPress——或者他们的博客系统——发布思想领导力内容。人类仍然会审阅和批评草稿;高杠杆来自编排,而不是创始人随手输入几个 prompt。

  • 在他观察到的精简公司里,经营者依然是瓶颈,并且持续招聘,因为他们拥有多于员工和智能体执行能力的想法。监管、合规和领域专业知识,也进一步限制了那些没有合格人工介入就无法推进的行业。

  • 他更深层的反对理由是创意趋同。给7个工具同一个 prompt,得到的结果可能“80%相同”;第一家公司也许能率先把这种垃圾内容变现,但追随者会和它越来越像。要建立持久的生意,仍然必须通过品味、声音、上下文和有意识的流程,让 AI 变成“你的东西”。

  • 这也不意味着只能招聘资深员工。Mansour 开玩笑说,Atlassian 想要更多曾经用 AI“作弊”的学生,因为他们是 AI 原生的一代;有经验员工反而可能更难改变行为。审阅者也会在评估 AI 产出的过程中学习领域判断力,最终成长为工作流架构师。

13. 原生工作浏览器与 AI 并购,都奖励近距离关系

  • Atlassian 收购 The Browser Company 的出发点,是重置假设,而不是争夺普通消费级浏览市场。Mansour 将这个机会比作 AOL Messenger 和 ICQ:企业消息最终发展出渠道、集成、权限和工作流结构,使 Slack、Microsoft Teams 等产品从根本上区别于消费级消息产品。

  • 知识工作浏览器可以假设 AI 始终存在于各类 SaaS 工具中,同时遵守逐用户权限,调用组织知识和团队协作图谱。这会为人和虚拟队友创造协作环境,而不是主要服务于购物、旅行或随意上网的浏览器。

  • 对于收购,Mansour 警告要警惕笼罩 AI 的“迷雾”,因为很多东西一夜之间就能被复制。他的稳定判断方法是把长期定义为12个月,评估潜在轨迹,并追问目标公司能否把客户从通用模型的80%,带到客户愿意付费获得的高价值最后20%。

  • 他的第二个筛选标准是“工作流近距离”,并分为靠近用户和靠近买方两类。日历平台位于调度需求层级的底部附近,可以逐步向上攀升;只交付上游4个系统之后的第5步的初创公司则更脆弱,除非其细分市场足够大且足够专业。

14. 更便宜的创造,应当倍增软件并拆散工具

  • Labenz 用一条需求弹性光谱来描述这一问题:牙科服务即使免费,他也不会消费更多;按摩则可能多消费100倍。行业真正开放的问题是,软件创造成本大幅下降后,需求会像固定必需品一样有限,还是像潜藏需求巨大的服务一样扩张。

  • Mansour 预计,消费软件会继续在娱乐、休闲、烹饪和家庭项目中扩张,同时警告越来越多的合成内容正在模糊现实边界。在商业领域,他看不到收缩,因为开发者给 AI 更多工具后,AI 的能力也会随之增强。

  • 一个日历应用在人类眼中可能是一个产品,但对智能体而言,它可以拆解成约50个窄工具:寻找共同空闲时间、处理时区、屏蔽忙碌时段、调取公共假日等。设计这些可靠能力,可能比呈现一个单一 UI 更细颗粒度、更复杂。

  • 供应商可能会把价值从界面转向可调用工具;Mansour 提到 Apple 正在鼓励开发者构建 App Intents。但软件不会消失。具体结果会因市场而异,从汽车系统到合规和文件签署工作流,都不会遵循一条统一的人数曲线。

15. 当实验安全且具体,AI 采用会加速

  • Mansour 同意领导者应当示范 AI 的使用,但总结文档或起草邮件并不足以带来启发。他更丰富的个人案例包括可视化后院改造、用 Fortnite 段子制作结合课程内容的数学辅导工具、帮助女儿创作音乐,以及管理每日 MCL 康复训练。

  • 他反对强制推行,因为很多员工听到“使用 AI”,理解成的是“照做,否则走人”。Atlassian 转而组织 AI builder week,为约1,000名产品经理、设计师、工程负责人和研究人员同步腾出时间,让实验不会显得是在忽视队友或本职工作。

  • 活动庆祝的是学习,而不是交付产品:“结果就是学习。”这种设定很重要,因为采用新方法一开始可能更慢、也可能失败;在正常交付压力下,员工自然会回到最快、最熟悉的行为。

  • Mansour 的实施模板极其具体:选择一项已经在做的任务,列出每一步,再找出每个环节所使用的知识、指令和行动。如果当前没人真正执行这项工作,“昨天就该把它扔进垃圾桶”;从家庭作业到识别水龙头垫圈的个人折腾,最终才会改变职场直觉。