电子邮件的未来:Superhuman CTO谈你的收件箱才是真正的AI Agent(而不是ChatGPT)—Loïc Houssier
摘要
Superhuman的核心押注是:收件箱,而不是通用聊天机器人,将成为知识工作的主动式AI Agent。 Loïc Houssier认为,ChatGPT需要用户先提供上下文,而Superhuman可以从工作已经发生的地方直接行动:电子邮件、Coda摄取的知识,以及Grammarly跨应用存在的能力。“我们就在你工作的地方”(We are where you work),这场战略竞争本质上是“被动响应”对“主动出击”。
产品路线图依靠小步、 high-confidence 的自动化推进,而不是显眼的“AI功能和闪光特效”。 自动分类、邮件串摘要、两天后跟进提醒、预先写好的草稿、可用时间回复和新闻简报合成,都服务于Superhuman的核心约束:绝不能拖慢高要求用户。Ask AI如今专门对抗“Agent偷懒”,通过每次约40封邮件的分页持续搜索,直到找到那根针。
Superhuman想成为AI执行助理,但最后20%的判断仍是最难的部分。 自动草拟系统正在学习拒绝供应商、将求职者转给HR等重复行为;日程安排测试版则会把3个可用时间直接插入草稿。然而,“80%”的准确率仍可能制造过多丢弃工作,日历数据也无法可靠判断何时值得打断日程去响应VIP,或某段关系是否在上周发生了变化。
1支由3名工程师组成的AI团队,通过窄工具、模型路由和异常严格的端到端评测支撑产品。 不同工具分别检查可用时间、关系、搜索和写作;Sonnet尤其擅长Agent交接并避免偷懒式交接,测试中的OpenAI模型在这方面较弱,而Gemini最近也成为另一项强劲选择。校准测试包括Rahul要求找回5年前一封写明桌子木材的承包商邮件:“在我们搞定这个查询之前,他不会满意。”
质量优先于推理成本,这为高端定价和可预测产能的供应商创造了空间。 Superhuman会先从“最高端、最贵的模型”开始,体验跑通后再优化;Baseten的盒装产能模式比波动的按Token计费更有利于预测3个月和6个月的成本。一些客户表示,宁愿每月支付$200使用最好的模型,也不接受“半吊子的垃圾”(half crap),因为节省1个高管小时的价值可能是订阅费的10倍。
运营数据表明AI正在提高工程产出,但Loïc明确拒绝把全部功劳归给AI。 数据来自员工自报:约80%的人会给PR打标签;在被标记的PR中,约80%–90%涉及AI,其中约90%的使用效果为正面。人均每周PR数量从Q1约4个升至Q2的5个,再到Q3的6个。Superhuman还配套提供1小时预算审批、24小时安全审查、约50名工程师、约100,000名付费用户,以及平均任职约4年的资深远程团队。
随着实现成本下降,产品判断和工程基本功反而更有价值。 Loïc把AI编程比作从汇编转向C:这只是又增加了一层抽象,仍要求理解内存、服务器和底层机器。他的判断没有保留:AI“会更快地区分优秀工程师和糟糕工程师”(will separate faster the good engineers from the bad engineers);创业公司如今可以在2周内复制技术,差异化则转向工作流、延迟、界面质量和对用户的同理心。
精读
1. DocuSign让Loïc明白,分发和合规可能压过漂亮技术
Loïc最初学习数学,差点攻读3年制应用数学与密码学博士,之后转向进攻性安全。他在潜艇行业工作了约1年,也因此失去了作为安全研究员时所拥有的技术权威。面对鱼雷、雷达和核发动机领域的专家,他学会“把自我放进兜里”(put my ego in my pocket),通过提问来领导团队,并逐渐习惯帮助那些在各自领域远比自己懂行的人。
他在巴黎创办的电子签名公司技术实力很强,也正在成为法国行业领导者,但DocuSign使用的是另一套商业语言。欧洲团队向CIO销售技术能力,DocuSign则向HR负责人和其他职能部门销售商业价值。这种反差让合作、最终被收购,比继续单打独斗更具吸引力。
这笔交易需要6个月的业务剥离,因为法国财政部阻止了整体出售:这家公司还为法国国防部处理安全与身份认证工作。团队、源代码、系统,乃至数据中心基础设施,都必须拆分并复制,DocuSign才能收购签名业务。Loïc回头给出的建议极其直接:“疯狂。别这么干。”
Swyx提出“DocuSign的人都在做什么?”这个问题,揭开了隐藏的规模经济:本地数据中心、不同的欧洲签名标准、FedRAMP、各国数据驻留要求,以及密钥一旦被盗就会失效的本地部署设备。从外部看像是人员臃肿的配置,实际上可能是进入市场所需的基础设施;日本市场还要求理解印章文化,而不是想当然地套用西式签名。
他对法国更广泛的结论是:优质教育和工程能力还不够,还需要韧性、创业心态、产品驱动增长和全球野心。欧洲创业公司应考虑从一开始就面向英语世界和全球市场,而不是先从法国或意大利起步。
2. Superhuman只在能让高要求用户更快时加入AI
Loïc的产品原则不是上线“AI功能和闪光特效”;每项功能都必须让那些本来就有极高要求的用户更快。延迟和打扰都是产品失败,因此智能必须在正确的时点出现,同时不破坏Superhuman的速度。
早期功能刻意不炫技:给推介和营销邮件分类、总结长邮件串,并识别仍需回复的消息。邮件两天没有得到回复后,Superhuman可以重新推送这条线程;下一代功能则直接准备好跟进邮件,把“糟了,对,我本来想提醒大家的”变成按一下Send。
同样的演进也覆盖可用时间请求和任务委派。草稿可以建议抄送合适的执行助理,正在开发的日程安排测试版则会插入可直接使用的时间。每一步都在移除一个小决策,而不是要求用户进入单独的AI工作流。
Loïc如今会自动归档约30–40份新闻简报,周五再询问本周收到的全部内容,以及哪些值得关注。这种行为变化和功能本身同样重要:用户从ChatGPT那里学到,查询一个知识库可能比维护“一份邮件待办清单”更容易。
3. Ask AI的设计目标是完成任务,而不是返回选项
Swyx最初是在Superhuman搜索栏里误触发功能,后来开始主动提出更宽泛、尚未成形的问题。如今他用它找合同,Alessio用它找电话号码。Loïc则找回了6个月前一次会议中的PowerPoint链接,估计上下文搜索节省了约30分钟。
Loïc把“Agent偷懒”定义为一种明确的质量缺陷。当他说明天找15分钟审阅一份文件时,系统应该直接选择并预订一个时间,而不是给出几个选项后把工作交还给他。一个称职的人类行政助理听到的是“找到它,做完它”,Agent也应以此为标准接受评估。
深度检索无法把整个邮箱塞进一个上下文窗口,因此Ask AI使用语义分页。它可能先检查40封最有可能相关的邮件,排除后再检查下一批40封,不断扩大语义邻近范围,直到找到正确结果——即使有数百封邮件在语义上都很接近。
编排层由可用时间、联系人关系、草拟和其他动作的窄工具组成。Agent先制定计划,为每一步选择最佳工具,再执行;不存在一个“几乎什么都能做的万能大工具”。
4. 模型选择不如能暴露不同失败模式的评测重要
据Loïc介绍,只有3名工程师负责这套AI栈,但他们已经在框架、模型和内部代理层之间反复迭代。Sonnet在Agent交接和避免偷懒式交接方面尤其出色,测试中的OpenAI模型在这方面较弱,而Gemini刚刚加入比较,成为另一个有潜力的选项。
Superhuman最初的评测是朴素的“查询、回答、查询、回答”模式。后来它演变为按维度组织的标准查询集,覆盖Agent交接、在“海量邮件”中深度搜索、日期理解以及其他反复出现的弱点。每个端到端结果都按这些维度评分,而不是笼统判断好或坏。
Rahul提供了对抗式现实:他每天可能收到500–1,000封邮件,并要求找出5年前一段承包商讨论,确认一张桌子使用的木材。日期问题又增加了另一类失败,因为模型很难正确理解相对于今天的“上个季度”等表达。
Loïc区分了普通可靠性和Superhuman用户期待的“档次”。Toyota可以是高质量产品,但Audi或Porsche买家期待的是另一种东西;Superhuman的高要求用户迫使团队在细节上投入不成比例的精力,而低价、低强度的产品可能会容忍这些问题。
5. 收件箱正在成为可计算的权威记录系统
Swyx提出的挑衅式问题——“我上个月在Waymo上花了多少时间?”——把收据变成了一个会计数据库。Agent筛选Waymo邮件,提取行程时长,再通过生成代码汇总,因为“LLM不擅长数学”。Superhuman当时正与Anthropic讨论更广泛的代码执行组件。
Superhuman仍依赖Gmail和Outlook提供垃圾邮件识别等基础设施,而不是变成另一台邮件服务器。Loïc认为,重建客户公司系统里已经具备的能力,用户价值很低:“如果我们直接接入并把它做得更好”,在邮箱之上的那一层就足够了。
速度要求本地副本,因为每次交互都必须在100毫秒以内完成。安装时会下载最近30天的邮件用于离线运行,之后继续保留新增历史;一名使用2年的客户因此可能在本地存有2年的邮件。移动端曾使用Realm,但现在已基本停止维护,团队正考虑SQLite等替代方案。
AI检索则在Turbopuffer中对约5年的历史邮件增加嵌入和混合搜索。推理分布在OpenAI、Anthropic、Gemini,以及由Baseten托管的Llama或BERT分类器等开放模型和供应商之间;具体路由取决于使用场景和当前模型质量。
6. 离线推理首先是质量问题,其次才是成本问题
设备端创业公司往往主打更低的推理费用,但Loïc表示,Superhuman用户“要的是质量,而且愿意为质量付费”。他感兴趣的是离线语义搜索:产品本来就能在无网络时运行,但一旦远程推理消失,AI能力就会明显变弱。
限制不仅在智能,也在占用空间。Superhuman已经因为本地缓存邮件而消耗存储和内存;Swyx举出的DeepSeek-V3.1例子约有600B参数,说明直接把前沿规模模型装进设备并不现实。任何本地能力都必须适配现有占用,不能进一步恶化用户对应用体积的抱怨。
Superhuman更希望掌握端到端体验,就像其移动应用使用Swift和Kotlin,而不是React Native,以获得原生感。但Loïc也表示,他“很希望设备供应商能做得更好”;目前iOS方面的表现一直不尽如人意,这给专门供应缺失层的公司留下了空间。
7. 高端AI经济学偏好先证明价值,再优化Token
Loïc的排序非常明确:先使用最好、最贵的模型,建立所需质量,再降低成本。“如果它成功了,那就很好,即使它很贵。”成功会带来足够规模,使优化值得投入,而不是让一项尚未验证的功能一开始就背负过早的约束。
Baseten固定容量、盒装式的模型部署,比纯粹按Token计费的无服务器推理更容易控制支出。在更大的、“接近IPO阶段”的业务框架下,Superhuman越来越需要可信的3个月和6个月预测;即使采用率波动,固定容量也能给CFO一个有边界的成本区间。
Token预测仍然混乱,因为Superhuman处理的邮件从极短回复到超长线程都有。团队必须估算邮件中位长度、平均消耗量和采用率,模型里“总会有一些魔法”。Swyx把企业采购重新表述为每万亿Token的价格,而不是个人开发者关注的每百万Token价格。
Alessio问,如果给每封收到的邮件都生成草稿,会不会摧毁$40订阅的经济模型。Loïc的回答基于价值:一些客户明确要求最好的模型,并表示愿意每月支付$200,因为CEO或VC的1小时时间价值可能是订阅费的10倍以上。
8. AI执行助理受阻于判断,而不是草拟
内部自动草拟仍在测试,正在学习重复性行为:Loïc会礼貌拒绝每天收到的数百封AI工具推介,并把求职者转给HR。Swyx认为,把既有模板与AI个性化结合起来,可能无需接近AGI就能解决实际的“最后一公里”。
覆盖率是尚未解决的产品门槛。如果80%的草稿有用,但用户还必须丢弃20%,自动化可能带来烦躁,而不是杠杆。Loïc问,能够接受的比例究竟是90/10,还是80/20。真正相关的指标是节省了多少注意力,而不是生成了多少文字。
日程安排暴露出更深层的缺口。Superhuman可以草拟3个午餐时间,但Swyx希望自己完全不参与;人类EA知道哪个VIP值得调整繁忙日程,也可能知道上周的谈话已经改变了双方关系。仅凭交互次数无法编码这种判断。
Loïc仍将AI EA称为“目标”,同时让人类判断保留在流程中,可能由用户的EA参与。Swyx提议收购一家人类助理公司,观察工作流并生成专有训练数据;Loïc同意这可能是最好的学习路径,但也称其运营承诺“强度很高”。
9. 电子邮件可能从文字行走向语音和环境式沟通
Loïc的3个孩子用手机聊天,通过WhatsApp与家人联系,也通过Snapchat、TikTok或Instagram沟通;他说一切都在变成语音,而他们越来越想要一段关于文章的视频,而不是文章本身。他更大的判断是,人类过去写作,是因为口头故事缺乏存储能力;如今音频和视频无处不在,这一历史约束正在减弱:“还有什么必要写作?”
放到电子邮件上,问题就变成:1年后用户还会不会打字。Rahul也许会通过说话宣布一项功能,收件人在通勤时听到的是他的真实声音,而不是模仿他“声音和语气”的文字。机会在于重新设计沟通,而不是给今天的消息行表格外挂一个聊天机器人。
浏览器之争遵循同一逻辑。Swyx认为,掌握浏览器可以最大化上下文;Loïc则预计浏览器会变得更薄,甚至消失在操作系统中。Raycast已经替他取代书签和导航,浏览器最终可能只剩下网页视图、本地存储和扩展。
10. 跨应用上下文是Superhuman对ChatGPT的回答
Coda Packs是用于摄取数据的集成,Superhuman在技术上也已经拥有聚合公司知识的摄取管道。Grammarly可以知道用户正在Google Docs中工作、撰写LinkedIn帖子,或在Jira、Salesforce和LinkedIn之间切换,然后准备一封邮件——不过Loïc明确指出,知道这些并不意味着Grammarly会使用全部数据。
一旦这些资产汇合,系统就能把紧接在邮件之前发生的工作上下文加入消息。收购仅在3个月前完成,因此Loïc将这种融合描述为未来优势,而不是已经完成的能力。
ChatGPT则不会天然知道用户刚刚离开了哪个应用;它需要等待用户粘贴上下文。因此Loïc直白地将OpenAI和Superhuman描述为竞争对手。Superhuman想要的优势是无处不在:“相较于等待你提问的ChatGPT,我们可以更主动。”
Swyx质疑Loïc关于知识图谱系统“还没到位”的说法,因为Superhuman自己并没有尝试过;Loïc立即承认了这一点。他真正担心的是分类法:人物和公司显而易见,但项目、任务、计划、层级以及领域特有功能,在不同用户之间差异极大。
Obsidian用户可能建立一套完全主观的图谱,这让通用生产力本体变得困难。Loïc预计Superhuman会接入专门的图谱引擎,而不是自己构建:持续记住一切类似“Jarvis”,每当新邮件或交互数据出现,就需要大量重新计算。
11. AI提高产出,但组织质量决定这种提升能否复利
Q1,Loïc取消了采购摩擦:实验工具在1小时内获得预算批准,安全审查在24小时内完成。采用率迅速上升,在前端工作上的表现尤其好,但当时在Go后端和Swift上的效果较弱;v0赢得了内部交互式产品原型的自由市场。
Q2聚焦测量和用例发现。探索陌生代码区域的时间,在Claude Code帮助下从约1天降至约30分钟;在他的例子中,他还使用了Warp。工程师为每个PR标记是否使用AI,以及AI是否带来帮助;约80%的人提交了反馈,其中约80%–90%使用了AI,而报告中的约90%使用效果为正面。
人均每周PR数量从Q1约4个升至Q2的5个,再到Q3的6个。Loïc强调,AI只是原因之一,技术战略、组织设计和更清晰的优先级同样重要;PR数量也只是产出的代理指标,不是完整的生产力衡量标准。
Superhuman仍然精简:约50名工程师服务约100,000名付费用户,平均任职时间接近4年。其3人AI团队分布在Patagonia和加拿大;收购完成后,邮件业务作为拥有独立损益表的“复合型创业公司”运营,Rahul仍负责领导,而Shishir的管理团队实际上充当其董事会。
Alessio的反驳值得保留:工程速度加快,可能压垮市场、客服和产品一致性;发布更多功能,也可能意味着更多Bug。因此Loïc拒绝陷入“我们能做更多,那就做更多”的惯性循环,即使大公司为扩张提供了更多产能。
在劳动力问题上,Loïc不接受从每周4个PR增加到6个,就应自动带来50%薪酬增长的观点。公平薪酬仍然必要,但资深工程师也能从低摩擦团队中交付有用工作获得满足:“我基本上可以成为最好的自己。”
他最后的判断毫不含糊:人们仍然应该学习编程。AI更像从汇编转向C,而不是废除底层系统知识;优秀工程师会变得“惊人”,而“糟糕、懒惰”的工程师可能把生成结果误认为理解,反而变得更差。
因此,商业护城河转向产品能力。如果创业公司能在2周内大致复制技术,差异化就来自对用户、工作流、视觉质量和延迟的理解。Superhuman正在美洲招聘远程、以产品为导向的工程师,包括那些关注延迟、因为用户能直接感受到延迟的后端工程师。