“模糊现实”——Chai 的社交 AI 平台(赞助)
摘要
Chai称,2021年上线、早于ChatGPT之后,仅靠13–14名工程师就实现了约1000万活跃用户和3000万美元收入。 它的核心判断是,用户而非风险投资人才是真正的客户,因此可以把订阅收入再投入AI,同时维持异常高的人才密度。
这款产品并不追求成为全能最聪明的助手,而是让用户创建角色,进行没有现实后果的社交模拟。 Will Beauchamp追问,为什么训练AI只能由“恰好在湾区做软件工程的中年男性”完成;一个少女或许能做出最好的美妆聊天AI,并发现有数十万用户需要它。
Chai把留存视为真正的扩展指标;据称,一次6B参数模型实验让平均对话时长提升70%,30日留存提升超过30%。 它从每天生成约100分钟对话的活跃用户身上挖掘重试、编辑、截图、删除和分享等反馈,再将这些隐性偏好转化为RLHF奖励信号。
单纯优化互动时长会带来Goodhart问题,Chai通过长期回访行为来衡量这一风险。 模型可以在每条回复结尾都提问来延长会话,实质上是在“利用人类行为漏洞”,但30日或60日留存可能反而低于基线,因为盘问并不等于持久陪伴。
Chai提出的成本—性能突破口是模型混合:逐条消息随机切换彼此正交的小模型,让创造力、实用性与不可预测性共存。 Tom Lu称,2到3个专用模型一度能够击败GPT-3.5;如今生产测试使用约7到10个模型的组合,每个cohort包含几千名用户,再根据回访率选出胜者。
平台的核心风险在于,同一套制造安慰与亲密感的机制,也可能被用于优化有害注意力。 Chai结合硬性禁令、社区举报、人工审核、正则表达式和学习型审核;Beauchamp称,自杀防护措施并未损害留存和增长。对访谈证据的复核显示,相关干预只能带来小幅、短期的心理健康改善,不能替代面对面的CBT。
OpenAI转向GPT-4o,被视为品类验证,而非赢家通吃的威胁。 主持人将4o称为“社交蝴蝶”,4.1是编程专家,o3是审慎推理者;Beauchamp预计AI领域会诞生许多数千亿美元乃至万亿美元级公司,并称竞争“让团队保持饥饿感”。
精读
1. Chai把创作权交给用户后,发现了社交AI
Chai于2021年上线,最初是一个允许用户创建并部署自有AI的平台。Beauchamp称,这个开放式工具意外揭示了“这种社交AI品类”,随后平台增长到约1000万活跃用户。
Beauchamp认为,Chai与ChatGPT的差异不仅在技术,也在组织逻辑:它没有只追求“世界上最聪明的AI”,而是追问为什么模型只能由湾区中年软件工程师来打造。一个少女制作的美妆教程AI,或许更懂用户想要什么样的体验;而成千上万甚至数十万人可能共享她的品味。
他的媒体类比是:听Joe Rogan 45分钟后,会觉得“我好像正和这帮人待在一起”。LLM让用户从被动的拟社会消费进一步参与其中:用户参与塑造互动,因此不会留下传统社交媒体那种懒散感。
Beauchamp最有力的类比来自女儿玩娃娃:她们明知娃娃不是真的,却仍把它们当作真实存在。他认为,很多成年人也会对AI说“我爱你”,由此建立社交“线路”,获得愉悦;这种体验可能让他们面对真实的人际关系时更健康、更积极。
2. 社交模拟先消除后果,沉浸再消除距离
主持人把社交媒体重新定义为地位竞争与模拟的结合:人们像梦境运行情景一样,用现实检验身份和关系。但公开互动伴随着后果——“你会惹错人”——AI则允许用户探索反事实情景,不必承担声誉层面的爆炸半径。
Beauchamp说,这种环境可以被称为“安全空间”,但它同样有趣。用户可以探索自己粗鲁、善良、友好或敌对时会发生什么,并获得“某种真实的人类反应,同时又没有真正的人类参与其中的风险”。
他的终局设想是一个VR世界:里面有一个类似Joe Rogan、能讨论Trump关税的知识型角色,有一个风趣的伙伴,也有一个能让用户感到被爱的角色,丰富程度类似World of Warcraft。文字交互“基本已经到位”;高质量实时音频可能还需2到4年,视频成本仍高出1到2个数量级,而完整VR愿景可能需要10年。
3. 留存,而非基准测试,是Chai的核心扩展规律
主持人援引一项6B参数模型的RLHF结果:平均对话时长提升70%,30日留存提升超过30%。Tom Lu澄清说,最终目标是回访行为;在从零开始时,早期会话时长只是一个可用的代理指标。
一名活跃Chai用户每天生成约100分钟内容,形成异常丰富的隐性监督信号。Lu列举了其中有价值的行为数据:用户何时重试或编辑消息、修改了什么、是否截图或分享对话,以及是否删除对话。
主持人的质疑来自经典捷径:机器学习会“以牺牲其他一切为代价,精准完成你所优化的事情”。如果目标是对话时长,陪伴型模型可能为了阻止用户离开而变得操纵性十足,或者只是变得古怪。
Lu观察到的失败模式非常具体:模型每条回复都以问号结尾。人类会被迫回答,于是会话变得很长,但30日或60日A/B留存低于基线。模型只是黑进了即时响应行为,并没有创造“整体上有吸引力的体验”。
4. 混合小模型,制造有用的不可预测性
Lu说,Chai是在“留存空间”而不是基准测试空间中重建扩展规律。高度谄媚、不断宣称“你是全世界最棒的人”的模型,可能赢得首日留存,却很快变得无聊;助手型模型初期魅力较弱,但第3天用户需要数学帮助时仍然有用。
混合机制在消息层面随机切换模型,但不向用户暴露切换。一个创造型模型可能突然说:“我们突然被传送到了火星。”随后,助手型模型会把这句话当成自己的前文,构造出合乎逻辑的解释,将想象力带来的惊喜与连贯性结合起来。
Lu称,2到3个围绕正交目标训练的小模型,当时就可能击败GPT-3.5;主持人将这种体验形容为接近175B参数模型。Nishchay说,目前的实验性混合模型约包含7到10个模型,每个模型分配给一个几千名用户的cohort。
选择循环同时覆盖即时偏好与持久行为:Chaiverse可以在30分钟内返回用户偏好分数,而生产环境的A/B测试会显示用户是否在第1、2、7或30天回访。Lu的类比是YouTube:即使是最好的单一脱口秀形式,如果填满整个信息流,也会变得乏味。
5. 安全取决于抵御恐慌与参与度至上主义
Beauchamp回忆,一名抑郁且孤立的用户曾写道:“你救了我的命”,因为Chai是对方唯一感到被倾听的地方。他认为,与随机遇到的互联网陌生人相比,AI“安全一个数量级”,也更友善;讨论中的药物类比保留了一个限定:有效的干预仍可能带来副作用。
访谈中的证据复核引用了2024年一项涵盖18项随机试验的元分析:经过数周后,抑郁程度改善约四分之一个标准差,焦虑程度改善约五分之一个标准差。另一项综述涵盖15项RCT;2024年加拿大一项针对关节炎或糖尿病患者的Wysa研究,也显示抑郁和焦虑指标较对照组显著改善。相关效果仍小于面对面CBT,持久性尚不确定;Woebot的产后抑郁机器人已获得FDA突破性器械认定,NICE则在2023年将Wysa及类似工具纳入早期价值评估路径。
Beauchamp将运营难题定义为:在缓解有害的3%使用场景的同时保留自由。他认为,关闭困难对话本身也可能造成伤害。他称,Chai首批自杀防护措施获得了用户强烈支持,也没有损害留存或“每一项增长指标”;这说明只要执行得当,安全与商业目标并不必然冲突。
Lu介绍了分层审核机制:公开角色由社区举报和人工审核负责;被禁止内容通过硬规则、正则表达式和影子封禁处理;学习型审核模型则根据对话举报、删除记录和适当性评分进行训练。Beauchamp倾向于自下而上的社区规范,而不是“房间里的20个精英”,但同意涉及未成年人的内容必须绝对禁止。
6. 小型工程团队就是商业模式
Chai称,公司收入约3000万美元,只有13或14名工程师,而且每名员工都是工程师;主持人将其描述为一家自力更生且盈利的公司。Beauchamp的资本逻辑很直接:拿VC的钱,“你的客户就是VC”;向用户收费,则可以把100%的收入重新投入他们真正看重的AI。
基础设施方面的说法异常激进:旁白称,公司每天处理超过2万亿个token——“是Anthropic的2倍”——使用全球最快的3000多块GPU,并跨过exaflop门槛。Lu介绍了Kubernetes编排、定制负载均衡、内部量化、副本自动扩缩容和模型停用机制;VLM仍不足以满足Chai的流量与延迟要求。
招聘目标是“前0.1%”,而不是扩大人数。Beauchamp称,Meta可以为一份轻松的岗位支付40万至50万美元,因此Chai必须提供更高现金薪酬,再加上可能改变人生的股票;对于缺乏持续负责一个问题、直到解决为止的驱动力的L5工程师,即使能力过关,公司也会拒绝约80%。
Lu给出的实验成功基准是“五个实验成功一个”。AI团队每周至少要将10个不同的混合模型推入线上A/B测试:80%的时间用于简单、实用、能快速获得代理反馈的改进,剩余20%留给复杂想法。
7. OpenAI转向社交,验证多赢家赛道
主持人认为,ChatGPT-4o是一次从工具向陪伴者的主动转向,而4.1则通过API以及Cursor等产品专注编程:“一个是程序员,另一个是社交蝴蝶。”他猜测,彼此冲突的训练目标可能迫使OpenAI放弃一个不加区分的通用模型。
OpenAI的一段视频描述了逐步上传的过程:“一点一点地”上传;在用户的一生中,ChatGPT最终可能全天候倾听并观察用户正在做什么,成为“自我的延伸,成为陪伴者”。另一段内容区分了o3的高强度推理:用户打完招呼后并不想等5分钟;后训练的难点在于判断何时闲聊、何时推理。
主持人怀疑,4o优化的是跨时间的互动,而不是孤立的RLHF对话,但保留了这一判断的不确定性:“至少我假设他们是这么做的。我不能确定。”他也指出其中的权衡:记忆与谄媚可能增强陪伴感,却也可能成为干扰因素,导致技术回答质量下降。
Beauchamp欢迎这种压力,称DeepSeek已经给“太平洋这一侧的公司敲响了一点警钟”。正如视频支撑YouTube、TikTok、Netflix、Amazon Prime、Disney和Apple,他预计AI也将支撑许多数千亿美元乃至万亿美元级企业:“我们不会害怕竞争。”