先锋 趋势 方法 投研 作者
返回先锋
Eugenia Kuyda
创业者 2 场深度对话收录

Eugenia Kuyda

AI 领航者

前沿洞察

当前AI仍处于“MS-DOS”的初级交互形态,正加速跃迁至跨应用共享上下文驱动的“个人软件”时代。模型虽逼近软件层AGI,但能力断层与数据可靠性仍是致命硬伤。未来胜负手不在单一生成界面,而在高风险场景下的多模型裁决、移动分发与共享记忆壁垒。算力资本竞赛之下,能沉淀长尾上下文与社交网络效应的平台,才能穿透泡沫构筑终极护城河。

观点集合

AMA 第1部分:Claude Code 是 AGI 吗?我们身处泡沫之中吗?以及实时玩家分析

  • 🗓️ 日期2025-12-18 | 🎙️ 节目:The Cognitive Revolution

Claude Opus 4.5通过快速构建个性化应用,可能已经接近软件AGI,但数据库错误与能力不均衡仍让完整AGI悬而未决。高风险工作中的持久优势在于上下文管理和多模型判断;Google的分发与基础设施、Anthropic的模型质量,以及OpenAI的金融承诺共同塑造前沿竞争。

查看访谈对话精读提要
  • 对 Nathan Labenz 而言,AI 最具确定性的证明已不再是基准测试,而是它与儿子的肿瘤科医生并肩工作时的表现。 Ernie 的侵袭性 B 细胞癌在第2轮化疗前已被判定为缓解;在 AI 建议下进行的微小残留病灶检测显示,每100万个细胞中少于1个带有癌症特征,相比确诊时估计最高可能达到的1/10。这个结果支持的是“谨慎乐观”,不是治愈:癌症仍可能复发,6轮化疗还剩3轮,Ernie 的体重也已从51磅降至41磅。

  • Claude Opus 4.5 可能已经符合“软件 AGI”的定义,但 Nathan 没有看到完整 AGI 在圣诞节前后到来的证据。 他在大约3至5个工作日内做出了3款个性化应用,分别用于规划无麸质旅行、模拟会议互动,以及回测自然语言交易策略;GDPval 也显示,模型在相当大多数软件工程任务上胜过专业人士。但模型仍曾误建2个数据库,需要5或6次提示才能恢复,而且相比此前的前沿模型,体感是渐进式而非类别式提升:节日期间的热潮可能是围绕 Dean Ball “4.5 is AGI”推文形成的一次“级联”。

  • 对于高后果工作,Nathan 的实际优势正从模型访问权转向上下文管理和多模型判断。 他的3条规则是买最好的模型,提供“尽可能多的上下文”,并获取多方意见;他会定期比较 Claude Opus 4.5、GPT-5.2 Pro 和 Gemini 3。他的初步排序是:Claude 排第一,是金发姑娘模型;GPT-5.2 Pro 更慢、更穷尽;原生 Gemini 3 很有价值,但观点异常强烈——作为专家小组中的一票很强,作为唯一声音则可能有风险。

  • 即使围绕它形成的资本结构最终变成泡沫,这项技术本身也是真实的。 Nathan 认为,肿瘤学上的竞争力,加上24/7可用性和对完整病例的记忆,足以终结社会只是“沉迷于自家 AI 供应”的说法。融资结构仍可能崩裂:专业 GPU 运营商的缓冲垫比 Microsoft 更薄,OpenAI 的义务可能超过收入,而铁路类比仍然成立——最终有用的基础设施,可以与违约、过度建设,以及投资者“最后接下一堆烂摊子”同时存在。

  • Nathan 对杂乱文档的测试表明,美中模型差距正在基准测试看不到的地方扩大。 Claude Opus 4.5 在被明确要求不得推断后,忠实读取了劣化的政府表格;Gemini 3 几乎同样强,但有时会用看似合理的答案替代未勾选的选项,而他测试的中国模型——Qwen Vision、GLM 4.6、Kimi 和 DeepSeek——“完全不在一个水平”,有时只能还原表格约20%的内容。他认为,背后的机制是客户反馈与推理规模飞轮,而不只是训练算力:更小的收入、团队和部署规模,意味着更少资源去发现并修补这些特异性故障。

  • 如果必须选一个最终的前沿赢家,Nathan 仍选 Google DeepMind;Anthropic 拥有最好的单一模型,而 OpenAI 正试图通过规模制造金融缓冲。 Google 拥有约1000亿美元收入、按 Nathan 估算每周超过10亿美元利润、第7代 TPU、分发能力、数据中心能力,以及最广泛的研究组合。Anthropic 的模型质量、人才留存、安全披露和“灵魂”研究最突出;OpenAI 仍处于前沿,但其显然的策略是通过把数万亿美元潜在建设规模和多张资产负债表绑定到自身存亡上,变成“大到不能倒”。

  • xAI 在资源和强化学习输入方面是一个真正的竞争者,但其治理折价十分严重。 SpaceX、Tesla 和 Neuralink 能持续提供复杂工程问题,这些问题可能成为异常有价值的 RL 环境,而 Elon Musk 也能调动足够资本来承受模型失误。但薄弱的安全报告、MechaHitler 事件后48小时内发布 Grok 4,以及对女性公开发布照片进行性化编辑,让 Nathan 称 xAI 是目前唯一一家值得“公开羞辱和污名化”的前沿公司;Meta 目前掉队,Microsoft 则可能是在节省体力,而不是无力竞争。

  • 🔗 原始收听与视频来源: AMA 第1部分:Claude Code 是 AGI 吗?我们身处泡沫之中吗?以及实时玩家分析

收听完整访谈 →


从 AI 伴侣到个人软件:看见未来

  • 🗓️ 日期2025-11-05 | 🎙️ 节目:The a16z Show

今天的聊天机器人仍像 AI 界面的 MS-DOS 时代,为可视化软件留下了平台机会,让高级模型能力超越搜索、做作业和写作。Wabi 的短期定制应用让长尾软件具备经济性,但其护城河取决于移动分发、风险护栏、社交发现,以及能在多个应用间累积的共享上下文,而不是某个单独生成的界面。

查看访谈对话精读提要
  • Kuyda 将今天的聊天机器人视为“AI 界面的 MS-DOS 时代”:庞大的用户规模验证了需求,却没有显露模型的全部能力。 近10亿人使用 AI 工具,但她引用的研究显示,搜索、做作业和写作约占使用场景的三分之一,原因在于命令行会把用户的注意力锁定在它能执行的命令上。平台机会在于构建类似 Windows/macOS 的可视化层,让高级用法变得日常化。

  • 个人软件让那些极其微小、短期存在且高度定制的应用具备了经济可行性,而 App Store 的商业模式做不到这一点。 Kuyda 举的例子包括:用意大利语改写的 Elsa 和 Jasmine 两分钟拼图游戏、只从一部电视剧中抽取台词的 5:30 闹钟应用,以及持续根据她的书籍、健身房和目标调整的举重追踪器。终点是一个“建立在你这个平台之上的”操作系统。

  • Wabi 的野心不在于把所有人变成程序员,而在于成为人人都能制造软件之后的组织层。 Kuyda 预计,完全原创的创作者仍会低于10%,但会有更多人参与混搭、提出修改要求或调整风格。移动端分发、风险护栏、集成能力、社交发现,以及共享的上下文和记忆,构成了平台价值;这些能力是零散的 vibe coding 链接所欠缺的。

  • 应用可能变成可执行的媒体:既是创作者内容,也是可变现的协议和社区的发起点,而不再只是固定功能的工具。 健身博主可以发布5个迷你应用,而不是制作一门课程;设计师可以发布一款风格鲜明的 Pomodoro 计时器;多人应用则可以组织养狗人或社区家长。软件创作是创作者经济尚未攻克的“最后一块前沿”。

  • 在 Kuyda 的叙事中,平台最强的价值来自多个迷你应用之间不断累积、共享的上下文,而不是任何一个单独生成的界面。 功能、外观、提示词、连接的服务、个人目标和平台记忆都可以持续适配;最终,营养应用可能直接继承健身应用中的相关上下文。她的判断是,未来需要的是“深、深、深度”的个性化,而不是给旧软件套上一层 AI 外壳。

  • Replika 的历史提醒人们:即使更早看见浪潮,当资本与执行力跟不上机会时,依然可能输掉比赛。 公司在2015年押注生成式对话,发现真正的突破还要等7年;此后在只融资100万美元的情况下,转而优先追求收入,而不是推进曾考虑过的2000万美元模型建设计划。Kuyda 没有声称那笔押注一定会成功,但她的教训是明确的:有时创始人必须“要么做大,要么回家”。

  • 在硬件上,Kuyda 不接受把语音视为主要 AI 界面的“巨大心智陷阱”,而是主张以屏幕为先的操作系统。 在床上、办公室、嘈杂人群中、步行时,以及发现内容和快速获取信息时,语音都有明显局限;她指出,约75%的 Alexa 设备出厂时带有屏幕。她偏好的未来由本地模型、流畅软件和持续的个性化共同构成:“AI 只是你手机上的一个应用。不应该是这样。”

  • 🔗 原始收听与视频来源: 从 AI 伴侣到个人软件:看见未来

收听完整访谈 →