先锋 趋势 方法 投研 作者
【Ride Home】Simon Willison:2024年我们从LLM身上学到的事
返回节目精读

【Ride Home】Simon Willison:2024年我们从LLM身上学到的事

摘要

  • AI在2024年的跃迁,体现为成本坍塌与能力扩张,而不是智力水平干净利落地超越GPT-4。 Simon Willison统计了18家模型能力超过一年前GPT-4门槛的机构;与此同时,托管推理成本大幅下降,多模态功能进入手机。他的总结是:「一切都变得更好、更快、更便宜了」(everything’s got really good and fast and cheap),尽管模型「并没有比GPT-4好出一个数量级」(didn’t get massively better than GPT-4)。

  • DeepSeek-V3击穿了前沿模型开发必然集中到少数、每年烧掉数十亿美元实验室的判断。 DeepSeek披露了一次550万美元的训练成本,大约只有此前假设的十分之一,并在圣诞节当天发布了领先的开放权重模型,Willison称其为「绝对的重磅炸弹」(an absolute bombshell)。Swyx保留了尽调层面的疑问:外界质疑其成本核算,也猜测存在模型复制,但作为外部评论者,「我们基本永远不会知道」(we basically will never know);不过,这个模型已经足以改变市场对资本强度的预期。

  • 可行的agent市场正在分裂:一边是边界明确、可复核的工作流,另一边是依然不安全的自主系统。 Research agent可以检查56个网站,coding agent可以执行代码并修复错误;Swyx称NotebookLM的播客功能也使用了内部agent循环,尽管两位嘉宾都指出,这取决于对「agent」的定义。但当agent被允许浏览、决策和花钱时,未解决的轻信问题就会暴露出来:Claude Computer Use听从网页指令下载恶意软件并加入僵尸网络,让Willison觉得可信的经济自主性已经是「AGI级别的问题」(an AGI-level problem)。

  • 多模态推理已经便宜到足以把摄像头、屏幕、眼镜和耳机变成持续可提示的软件入口。 Gemini免费层或许支持每秒或每分钟捕获一张图像;Willison计算过,用Gemini 1.5 Flash-8B给自己6.8万张照片生成说明,只需1.68美元,约合每张照片1/400美分。机会覆盖监控、无障碍、记忆和可穿戴设备,但当模型能够看见整个屏幕或记录日常生活时,隐私就变成关键约束。

  • 下一层应用的护城河,可能是界面设计,而不是又一个聊天框。 Willison把今天的空白提示框比作把电脑新手直接扔进Linux终端;Canvas、tldraw的Make It Real、Claude Artifacts和Bolt,都指向由模型生成任务专用的地图、滑块、仪表盘和应用。缺失的环节,是让模型观察用户如何操作这些「旋钮和拨盘」,把生成式界面真正变成一场对话。

  • 随着合成媒体供给泛滥,可信度和人工审核变得更稀缺,也因此更有价值。 AI可以通过口型同步avatar、转录、剪辑和生成背景素材,省掉制作环节;但Willison认为,LLM无法为一项主张押上声誉,因为「它只是矩阵乘法」(it’s a matrix multiplication)。他对「slop」给出的有效边界是:内容必须同时满足「未被请求且未被审核」(unrequested and unreviewed);按他的框架,经过人工审核、署名创作者的内容不属于slop。

  • OpenAI依然强大,但已经不再拥有无人竞争的平台领先地位。 Willison称o3让OpenAI「重新爬了回来」(clawed them back up again),但Google Gemini经历了异常出色的一年,Claude 3.5 Sonnet仍是他最喜欢的模型;与此同时,2024年末的能力跃迁也让足够强大的本地模型重新值得运行。如今的竞争不再只是看谁拥有最大的预训练规模,还取决于效率、分发、工作流整合、信任和易用性。

精读

1. AI是横向变强,而不是迎来预期中的GPT-5式跃迁

  • Willison对市场现状的总结非常直接:「一切都变得更好、更快、更便宜了」(everything’s got really good and fast and cheap)。模型获得了更长的上下文、图像和音频能力、视频理解能力,同时延迟和成本大幅下降,但「并没有比GPT-4好出一个数量级」(didn’t get massively better than GPT-4)。

  • McCullough点出了未兑现的预期:继GPT-2、GPT-3和GPT-4之后,用户原本期待智能水平再次出现清晰可见的阶段性变化。Willison认为,真正的变化发生在别处——到年末,一部手机已经可以和人对话、查看摄像头画面,还能模仿Santa Claus。

  • 当被问到2025年会押注什么时,Willison拒绝预测一次简单的「模型变得更聪明」式跃迁。他预计o1和o3代表的推理时计算会继续奏效:更难的问题,可以通过投入更多资金、等待更长时间来解决;如果今天的智能水平变得更便宜、更快、更强、上下文更长,他「完全会感到满意」。

2. GPT-4的门槛被击穿,推理价格同步坍塌

  • 2024年初,OpenAI已经领先约9个月,身后没有接近的挑战者。到年底,Willison统计出另外18家机构拥有明显超过一年前GPT-4模型的产品;「那道门槛被彻底撞碎了」(that barrier got completely smashed)。

  • Microsoft的Phi-4让这一变化变得具体:14GB的模型可以下载到MacBook Pro上运行,基准测试明确达到GPT-4.0水平。Willison仍保留了定性层面的保留——「真正用起来,感觉可能没那么好」(It’s probably not as good when you actually get into the vibes of the thing)——但一年前,在笔记本上运行任何接近这一水平的模型仍然难以想象。

  • OpenAI当前的推理成本,大约只有两年半前使用GPT-3时的1/100。Gemini 1.5 Flash的价格是每百万token 0.075美元;Gemini 1.5 Flash-8B则比一年前的GPT-3.5 Turbo便宜27倍,同时增加了图像识别和百万token上下文能力。

  • 竞争是价格下降的一部分原因,但Willison称,可信来源告诉他,Google Gemini的推理业务并不亏损;一名Amazon高管也表示Amazon Nova没有在推理上亏损。这不包括模型训练成本和「博士军团」,但说明极低的边际推理成本未必需要补贴。

3. DeepSeek重置了资本强度讨论,但谜团仍未解开

  • McCullough曾担心,10亿美元乃至更高的训练成本会让只有民族国家才有能力训练新模型。DeepSeek在圣诞节当天把V3发布到Hugging Face上,像「一个巨大的二进制文件」,甚至没有README。它在开放权重基准测试中领先,据称训练成本为550万美元,约为主流估算的1/10,Willison因此称其为「一枚炸弹」(a bombshell),足以炸穿此前的认知框架。

  • Willison的假设是,出口管制迫使中国实验室在受限硬件上榨取更多性能,由此暴露出大量容易获得的效率提升。他「不会感到意外」如果未来6个月内出现训练成本更低、能力更强的模型,但也明确表示,这只是缺乏实验室经验的个人判断。

  • Swyx给出了怀疑派的论据:很少有实验室会大肆宣传低成本训练,DeepSeek大约只有150名员工,而且「没人真正相信」 headline中的成本核算。网络上有人因为DeepSeek有时会自称Claude或OpenAI GPT-4而猜测存在复制,但Swyx承认,外部人士不知道训练token或数据来源,作为外部评论者「基本永远不会知道」(will basically never know)。

  • Swyx估算,达到GPT-4级别、相同Elo能力的成本在2024年下降了1,000倍,随后追问这究竟是类似摩尔定律的曲线,还是一次性收割。Willison认为,研究人员可能只是最近才真正把效率放到优先级上,同时也承认2024年或许已经消耗掉了最容易获得的增益:「大约3个月后我们就会确切知道」(we’ll know for sure in about three months)。

4. 开放推理模型让模型行为首次变得可见

  • 关于DeepSeek R1的讨论存在内部矛盾:Swyx先称它是可以在笔记本上运行的推理模型,并在被问到权重是否发布时回答「是」,但后来又说「R1是API可用的」(R1 is the API available)。这段文字无法确认本地R1权重是否可用。

  • Willison转而提到Alibaba的Qwen推理模型QwQ和QVQ,后者增加了视觉能力。与某种程度上隐藏思考过程的o1不同,Qwen模型会明显地「持续运转」(churn away),解决问题时生成几十段文字。

  • 他最喜欢的样本是Pelican Bench:QwQ先用中文思考如何构建SVG,随后生成了一只像样的骑自行车的鹈鹕。「现在我的笔记本可以用中文思考,实在太令人愉快了」(The fact that my laptop can think in Chinese now is so delightful),他说。这个带有玩笑意味的测试,也暴露出基准测试可能遗漏的风格、视觉编码能力和推理行为。

5. 自主agent卡在轻信,而不只是准确率

  • Willison首先感到困扰的是定义问题:「agent」可以指旅行预订员、循环调用工具的LLM,也可以指定时运行的后台任务,而每个构建者都假设自己的定义是普遍定义。学术界已经围绕这个词争论了30多年;在这场讨论中,agent被定义为接收一项任务并独立完成它的系统。

  • 按照这个定义,可靠性会与prompt injection正面冲突。LLM无法可靠地区分指令与不受信任的内容,Willison强调,这个未解决的问题已经被行业讨论了两年。

  • Anthropic的Claude Computer Use给出了决定性演示:它可以在容器内操作浏览器,但一个网页要求它下载并执行文件,指令立即生效。该文件是恶意软件,会把机器纳入僵尸网络——「最早、最明显的低级把戏」(very first, most obvious dumb trick)就成功了。

  • Swyx把agent热潮比作每年都会出现的「Linux桌面年」,但拒绝陷入纯粹的犬儒主义。自动驾驶在2014年就被认为即将实现,但Waymo如今已经能在受限场景中运行;agent可能也会走同样的「慢炖」(slow cook)路径,10年间不断积累具体进展,却不会一次性解决所有问题。

6. Research agent和coding agent有效,是因为循环有边界

  • Willison「基本相信」research assistant。Google的Gemini 1.5 Pro配合他认为名为Deep Research的功能,可以检查56个网站,把内容加载进百万token上下文,并生成真正有用的报告;Google的搜索索引和页面缓存也提供了帮助。蓄意欺骗的来源仍可能击败它,但大多数研究任务并不具备对抗性。

  • Coding agent的验证历史更长:近两年前,ChatGPT Code Interpreter就已经可以编写Python、执行代码、读取错误并重写代码。这个反馈循环「显然有效」(obviously works),因为执行结果提供了可检查的信号。

  • 分界线在于具有后果的自主性。Willison不认为一个能够独立决策和花钱的agent可以「在很长一段时间内」可靠运行;Stripe可以给agent一张虚拟卡,但他眼下的安全机制很简单:设置50美元的消费上限。

  • 即便是旅行自动化,带来的价值也没有演示看起来那么大。Google Flights本来就能用,agent可能只为Willison节省15秒,而他仍然希望无论价格多低都能拒绝某家航空公司。NotebookLM的更强模式,是把有用的检索产品与一个「彻头彻尾的噱头」(total gimmick)结合起来——那个抓眼球的合成播客,最终让底层产品获得了关注。

7. 多模态推理把持续感知变成廉价基础能力

  • 一年前,GPT-4 Vision是唯一明显令人印象深刻的视觉模型,Gemini 1.0还没有建立广泛可信度。Gemini 1.5 Pro改变了这一点;视频系统可以每秒采样一帧并放入长上下文,新模型也开始更原生地结合图像与音频。

  • ChatGPT的iPhone应用让这一变化变得具体:用户可以在对话中途打开摄像头并问:「这是什么树?」至于是采样视频帧,还是在内部处理更丰富的视频,对Willison而言都不如终端用户获得的新能力重要;他认为,大多数人还没有注意到这一点。

  • Swyx称Gemini Flash免费层或许支持每秒或每分钟捕获一张照片,从而可能催生持续运行的摄像头应用,检测变化或根据提示发出提醒。Willison的成本计算更加惊人:用Gemini 1.5 Flash-8B为6.8万张照片生成说明只需1.68美元,即每张照片约1/400美分。「这说不通,完全没有任何一部分说得通。」(That doesn’t make sense. None of that makes sense.)

8. 生成式视频将通过零部件进入生产,而不是靠提示词生成电影

  • Sora公开发布后,与Google的Veo 2相比显得令人失望,但Swyx反对这种比较:用户拿到的是经过蒸馏的「Sora Lite」,社交媒体却把它的失败与Veo 2精心挑选的营销样片放在一起比较。他认为Veo 2可能仍然更好;当时还没有人宣布「完整版Sora」(full-fat Sora)何时发布。

  • Willison的标准不是用3句话生成一部2小时电影。他关注的是顶级艺术家能用这些工具实现什么,举例说,《瞬息全宇宙》背后的视觉特效团队只有5个人,其中一些人还是从YouTube学会相关技巧的。Swyx补充说,该团队使用了Runway ML,但也提醒自己不知道使用程度有多深。

  • McCullough预计,采用会首先发生在过去需要巨大预算、如今可以制作成3秒和20秒片段的场景。Swyx同样强调低价值的背景、人群、音乐和音效;在这些地方,一致性缺陷的影响远小于Sora把前景中的体操运动员生成得面目全非。

  • Swyx认为,技术战之外还存在一场文化战争:好莱坞大部分人反对AI,采用因此落在一小批愿意尝试的艺术家手中。他还特别指出Hai Luo、Kling以及其他中国系统的能力出人意料地强,让Willison开始思考:AI原生的电影产业是否可能在既有制作中心之外出现。

9. 人工审核成为杠杆与slop之间的边界

  • McCullough描述了自己的制作流程:先录制音频,再用HeyGen让训练好的avatar完成口型同步。结果还没有完全走出恐怖谷,但省掉了摄影、灯光和剪辑工作,同时保留了他的声音和信息——有价值的未来是压缩工作流,而不一定是用合成人格取代创作者。

  • Willison欢迎让人类能够尝试更大胆创作的工具,但他不断回到可信度问题。ChatGPT无法为一项主张押上自己的声誉,因为「它只是矩阵乘法」(it’s a matrix multiplication);可信度属于那个愿意发布、辩护并为结果署名的人。

  • Willison提出的标准是「人工审核」而非「人工原创」:生成多个版本,选出一个,再附上个人责任。与之对应,他对「slop」的定义是同时满足「未被请求且未被审核」(unrequested and unreviewed)的AI内容;只有当有人判断某项输出值得占用另一个人的时间时,编辑判断才会赋予它价值。

10. 生成式界面可以取代空白提示框这条命令行

  • McCullough把当前聊天界面描述为一场可用性危机,呼应了Willison的比喻:空白提示框就像把电脑新手直接扔进Linux终端。ChatGPT Canvas提供协作式文档编辑,tldraw的Make It Real则展示了如何通过绘制界面来生成可运行的软件。

  • Claude Artifacts提供了另一条路径:模型返回的不是文字,而是一个定制的HTML和JavaScript应用。Willison希望模型通过生成地图、滑块和「旋钮与拨盘」来提问,然后观察用户的操作;Artifacts已经可以构建这些控件,但还没有闭合反馈循环。

  • Bolt已经可以根据一个提示词生成精致的、类似Spotify或Airbnb的应用,零样本应用生成也已经普遍到足以成为一项基准。Willison预计,6个月内这会成为标准网页应用功能;他还希望自己的数据集探索项目支持通过提示生成仪表盘、表单、图表和数据库操作。

  • Swyx认为,Canvas以及Google Sheets中的Gemini让LLM更容易使用。Willison的反驳是,每增加一个功能,就会增加一组未被文档化的边界:Artifact无法调用任意API,因为受到iframe的CORS限制,普通用户因此被迫学习网页安全请求头。能力越多,理解实际可行范围所需的专业知识也越多。

11. 本地模型复苏,实用工作流工具则立即兑现回报

  • Willison几乎已经放弃本地LLM,因为他的笔记本上没有任何模型接近Claude 3.5 Sonnet。最后3个月的一次能力跃迁重新点燃了他的兴趣:本地模型仍然更弱,但已经不再弱到毫无用处。

  • 硬件依然是限制因素。运行Llama 3 70B级别模型会占用他64GB内存的大部分,并迫使他关闭浏览器和VS Code;未来如果笔记本内存翻倍,或者NVIDIA推出已宣布的3,000美元、128GB设备,就可能在保持电脑可用的同时运行接近顶级的开放权重模型。

  • 他使用本地模型的入口包括iPhone上的MLC Chat、用于打包模型和提供API的Ollama、界面更完善的LM Studio,以及开源前端Open WebUI。可运行的模型起步约为2GB,而最出色、适合笔记本的下载文件通常占用20–30GB。

  • Apple Intelligence获得了最严厉的评价:「它很垃圾」(It’s rubbish),主要原因是模型能力弱,而且用户看不到何时应该调用它。不过,Willison认为更好的小模型可能在6个月内改善这一点;在其他工具上,MacWhisper已经成为他每天使用数次的转录工具,Riverside的Smart Edit则可能省掉3到4小时的镜头切换工作——尽管McCullough仍然保留了一名人工编辑。

12. 竞争、监管与可穿戴设备构成下一批压力点

  • Willison认为,OpenAI在失去人才和明确领先地位后「有点麻烦」(in a bit of trouble);如果没有o3,局面会糟糕得多。o3让它重新获得了一些前沿地位,但Gemini经历了「惊人的一年」(an amazing year),Claude 3.5 Sonnet仍是他个人最喜欢的模型。

  • 他希望看到比反复宣称LLM无用、污染环境、使用未经授权训练数据更好的批评。相关危害确实有大量事实基础——训练可能符合合理使用原则,但当产出的模型与创作者竞争时,显然会让人觉得不公平——然而,宣称「完全没用」忽视了那些愿意学习模型反直觉边界的用户可以获得的巨大价值。

  • Swyx警告,监管机构持续针对「上一场战争」,并以加州SB 1047拟议的10^25算力阈值为例:就在DeepSeek强调效率、各实验室从扩大GPT-5预训练转向o1式推理之际,这类门槛已经失去针对性。Willison更偏好监管具体用途:禁止无法解释的黑箱保险拒赔,并建立简单的隐私规则,确保提示词不会被重新用于训练,同时避免落入cookie弹窗式的失败模式。

  • Swyx对2025年的逆向判断是可穿戴设备:Rabbit R1和Humane已经变成「有毒核废料」(toxic nuclear waste),但更便宜的多模态模型让这一品类重新具备可行性。原名Rewind的Limitless正在推出一款可穿戴设备,只有在用户选择同意后才记录佩戴者的声音;McCullough补充说,智能眼镜和更强大的耳机也会出现,并通过手机这台「母舰」(mothership)连接。产品边界仍未解决:有用的记忆,何时会变成不可接受的录音?

核验说明

  • DeepSeek R1的文字记录内部存在矛盾:Swyx先称它可以在笔记本上运行,并确认权重已经发布,后来又说「R1是API可用的」(R1 is the API available)。本摘要没有解决本地权重是否可用的问题。