Andrew Hsu
观点集合
个性化 AI 语言教育——Andrew Hsu 与 Speak
- 🗓️ 日期:
2025-07-11| 🎙️ 节目:Latent Space
Speak 聚焦韩国并采用高价策略,将2016年超人类语言导师愿景发展为 ARR 超过5,000万美元的业务,强调功能性流利而非游戏化学习。定制 ASR 负责低延迟练习,前沿模型处理开放辅导;AI 课程生成与学习者知识图谱可扩大规模,但评估、成本和轮次检测仍是约束。
查看访谈对话精读提要
Speak 的核心押注——语音和语言模型将在5到10年内达到超人水平——如今已成长为一家 ARR 远超5,000万美元的企业。 Andrew Hsu 表示,“现在已经有80%到90%的技术到位了”,这让公司最初的2016年愿景成为可能:用纯软件打造一名能比真人教师更快帮助学习者达到流利水平的导师。由于模型演进路径始终足够有吸引力,公司在没有转型的情况下熬过了痛苦的4到5年。
韩国的产品市场匹配,来自把产品、市场和客户都收窄,而不是把它们做大。 2018年,Speak 放弃免费、多语言内容目录,转向面向单一市场的引导式英语课程并改为收费,意识到“人们不想做选择”。如今 Speak 已是韩国最大的英语应用,约有6%的人口试用过,公司称其在日本和台湾也已走上正轨。
Hsu 将 Speak 定义为语言学习的“Gen 3”:追求功能性流利,而不是游戏化学习或电子化教材。 学习者反复练习句型和真实场景——比如和 Uber 司机交谈——直到说话变得自发,“几乎就像在健身房训练”。产品的私密环境也消除了在人类面前犯错的心理成本。
Speak 的技术栈是混合式的,并不依赖单一前沿 API。 其定制流式 ASR 基于大量非母语语音训练,负责对延迟敏感的练习;Whisper 和 LLM 则处理开放式表达、语义反馈与辅导。Hsu 的运营模式是先用产品把模型能力“榨干”,前沿能力进步后再重复这一过程。
下一阶段的规模化引擎,是由人类教学法约束、并由持续演进的个体学习者知识图谱驱动的 AI 生成课程。 Speak 希望获得“100倍的内容”、10倍的语言,以及最终100倍的语言对,借助导师和课程编写 agent,同时由人类审核教学大纲和课程。词汇、句型与聚类错误最终应汇总为一个完整的 Speak Score:即便不围绕考试训练,54分与5分之间的方向性差异也足够有意义。
实时语音已经近在眼前,但瓶颈在单位经济和交互设计,而非模型的原始智能。 OpenAI 的实时 API 定价更适合替代按小时计费的人工劳动,而不是让消费者连续对话数小时;在 Speak 的规模下,一个错误可能带来“数百万美元”的成本。Hsu 还称,除非把轮次检测纳入其中,否则首段音频延迟只是“虚荣指标”,因为学习者可能在回答中途犹豫10秒。
Hsu 认为实时翻译更像补充,而非生死威胁;语言则是更广泛学习平台的滩头阵地。 他指出,德语翻译成英语必须等到句末动词出现,认为 Speak 的亚洲用户想要的是直接的人际连接,而不只是一条巴别鱼;但他仍预计 Speak 会将翻译纳入产品。B2B 已开始向沟通、管理和酒店服务技能扩展,支撑了他的更大判断:AI 将重塑学习,尽管“现实世界的惯性极其强大”。
🔗 原始收听与视频来源: 个性化 AI 语言教育——Andrew Hsu 与 Speak