先锋 趋势 方法 投研 作者
Vol.65 AI新时代,Google又行了?
返回节目精读

Vol.65 AI新时代,Google又行了?

摘要

  • Google 已重新站上 AI 第一梯队;本届 I/O 的关键不是某次榜单反超,而是它终于开始用 AI 重做搜索、Chrome、Gmail、Android 等既有业务。 节目对“真正拐点”仍有不同判断:庄明浩强调组织合并,挨踢牛魔王则强调 Gemini 2.0 的抢发;但本届大会显示,模型、产品与生态分发开始形成闭环,缓解了市场对 Google“技术强、应用掉链子”的长期折价。
  • Veo 3 把 AI 视频的行业标准从“画面生成”推进到音画原生同生,暂时领先可灵“半步”。 朋克周甚至把袋鼠叼机票登机的视频当成真人整活;按其测算,经 API 生成约需人民币 100 元一条,尚未普及,却已经能同时处理对白、环境音、眼神和场景匹配。“我这样看了两三年 AI 资讯的老韭菜,居然都没有发现它是 AI 生成的。”
  • Gemini 2.5 Pro 是整套 Google AI 产品的底座,写作、编码和推理都很强;Gemini Diffusion 则展示了每秒约 1,400—2,000 token 的低延迟方向。 挨踢牛魔王认为后者当前实用性仍弱,但若搜索和交互能从逐字输出变成“秒出”,产品边界会被重写;朋克周实测更新后的 2.5,两分钟即可生成一款 UI 完整、能连续玩多局的小游戏。
  • Google 最具投资含义的动作,是主动侵蚀搜索这台印钞机,而不是另做一个隔离的 AI 特价版。 节目以 Bing 为参照:全球搜索份额约 3% 时仍能贡献约 120 亿美元年收入,因此 Google 哪怕丢掉一两个点都不是小事。如今它在美国核心搜索中上线 AI Mode,兑现的是“我自己革,也不能让别人革”。
  • DeepSeek 与 Kimi 对推理训练路径的探索,令 OpenAI 原本可能维持一两年的 O 系列优势快速扩散,并间接抬高了 Google 等全行业的能力曲线。 庄明浩把 2025 年的进展概括成“连续踢两脚”:Q1 推理成为标配,Q2 又发现 pre-training 仍有空间,再叠加 post-training 和强化学习。市场因此期待基于 V3 的 R1-0528 之后,V4 与 R2 可能连续“各抬一脚”,但这仍是推演与期待。
  • 创业公司的安全区不是某个永远不会被模型覆盖的功能,而是模型越强、交付越好,且拥有可编码的行业 know-how、场景数据或显著成本优势。 挨踢牛魔王警告“不要站在大模型前进的前方”,因为一次升级就可能吞掉数月工作;庄明浩的补充是:“模型即应用,但应用不仅仅只有模型这一种。”美图、HeyGen 和垂直语音服务的共同路径,是卖具体结果而非通用 token。
  • 2025 年的主战场已从单纯拼模型转向 Agent、coding、多模态、浏览器和 AI 硬件,同时资本门槛正在急剧上升。 节目引用的市场口径是:垂类公司做到 1 亿美元 ARR 后可能获得 30—50 倍估值,Cursor 更传出约 5 亿美元 ARR、以 99 亿美元估值融资 9 亿美元。真正的长期变量则落在 OpenAI 所定义的 L4“创新”和 L5“组织”——技术只有与组织及商业模式重构结合,才会转化为生产率。

精读

1. Google 的回归首先是从“业界笑柄”恢复为确定的一线选手

  • 潘乱先把伤疤摆全:Bard 首秀答错常识问题,市值一夜蒸发约 7,000 亿;后续 demo 被质疑剪辑造假,生成内容又卷入种族偏差、毒蘑菇等争议。“反正过去这两年就是黑料频出。”

  • 更戏剧化的一幕是,Google 原计划展示能看、能听、能实时对话的 Project O,OpenAI 却在前一天发布 GPT-4o。再叠加 New Bing、Perplexity 和 Dia 等挑战者,“大象不能转身、英雄迟暮、大公司病”的叙事遂压在 Google 身上。

  • 本届 I/O 后,嘉宾并未断言 Google 已全面反超,但共识非常明确:“反超另说”,它已经不可能再被排除在全球第一梯队之外。自研 TPU、Gemini 2.5 Pro、Veo 3、搜索、Chrome 和眼镜形成了全栈展示。

2. Veo 3 已把“真假难辨”从营销口号变成现实风险

  • 朋克周印象最深的是一段女士带袋鼠登机的视频:袋鼠嘴里还叼着机票,他转给女友时以为是外国人的搞笑整活;女友提醒“你看它的手”,他才意识到可能是 AI。“我一下就愣住了。”

  • 这个误判的信号不只在画面质量,而在整段视频的原生感:场景声音、人声、眼神和动作都能连起来,AI 味已经很少。朋克周判断,不论老人、小孩还是专业人士,都可能难以稳定分辨,足以“造成一定程度的混乱”。

  • 成本仍是硬约束:按他们的试算,经 API 生成约人民币 100 元一条,离大规模低成本生产尚远。挨踢牛魔王因此认为,Veo 3 目前可能领先可灵“半步”,而非竞争已经结束。

3. 音画同生重置了所有视频模型的及格线

  • 庄明浩认为,Veo 3 解决了此前最核心的断裂:视频模型只出画面,声音还要另行生成、配音和对齐。它让“视频是视频、语音是语音”变成同时生成,往后所有竞品都要接受新的标准尺。

  • 挨踢牛魔王把技术路径概括为 DeepMind 长期研究的 V2A:先提取视频中的场景信息,再通过 diffusion 生成匹配的声音。森林、雨声、对白与动作不再完全依赖后期分别制作,而可能在生成时就彼此匹配。

  • 对制作端,这意味着节省的不只是配音费。过去一个镜头可能要“抽卡”几百次,再从中挑选、剪辑和配音;原生音画让小公司或独立导演有机会交付过去必须依赖昂贵设备和团队的专业片段。

4. Gemini 2.5 Pro 才是整套发布的基础资产

  • 挨踢牛魔王把 Gemini 2.5 Pro 选为最强发布:写作、编码、推理三个维度都很强,6 月 5 日发布的版本打榜已冲到最高分。Veo 3 更惊艳,但 Gemini 才是搜索、Agent 和各类应用共同依赖的底座。

  • 朋克周给出的体验证据比榜单更直观:用当天更新的 2.5 编程,两分钟生成一款 UI 不错、确实能玩的小游戏,团队甚至连续玩了近半小时。这让 I/O 不再只是研究能力展示,而开始触及可用产品的生产速度。

  • 庄明浩同时提醒,Google 的模型成绩其实从 2024 年起便逐步追上头部;此前市场不买账,是因为技术进展尚未转化成主产品体验。本届 I/O 的变化,是模型分数与产品落地终于同时出现。

5. Gemini Diffusion 押注的是“等待时间消失”的交互范式

  • 挨踢牛魔王认为 Gemini Diffusion 是技术上最有新意、但当前实用性未必最强的尝试。它把常用于图片的去噪思路带入语言生成,像先铺草稿、再整体细化,而非传统自回归模型逐 token 往后写。

  • 节目给出的速度约为每秒 1,400—2,000 token,接近“秒出”。真正的产品价值不在跑分,而在搜索、编程和实时互动不必再像打字一样缓慢展开,用户点击后即可获得接近即时的完整响应。

  • 这也被视为 Google 创新能力回归的信号:即使产品化还早,它至少重新愿意探索不同于主流自回归路线的模型形态,而非只把旧技术拼凑成仓促应战的 Bard。

6. Google 选择用生态打单品,而不是再造一套孤立产品

  • 朋克周概括得最锋利:“用我的生态去打你的单品,用我的会员去打你的模型。”ChatGPT、Claude 仍主要是独立对话产品,Google 却能把 AI 嵌进 Gmail、Android、Chrome、云、搜索和 YouTube 的既有用户网络。

  • 一个最小工作流已经说明差异:先用 Gemini 生成提示词,再用 Veo 3 出视频,由 Flow 剪辑,最后一键发到 YouTube。用户不必在多个 AI 产品间搬运素材,生态本身就成为体验与分发优势。

  • 这并不意味着每项整合都立即好用。朋克周直言,Gmail 里的 AI 有时“改起来比自己写还慢”;Google 产品又多到令人眩晕,Flow 当时也尚无法正常体验。优势是链路完整,不是每个节点都已打磨完成。

  • 潘乱用“88VIP”形容其商业模式,嘉宾补了一句“量大管饱”。未来用户购买的可能不再是单一模型会员,而是一位覆盖工作、内容、购物与生活的生态助理,只是目前价格仍偏贵。

7. 搜索 AI 化是一次真实的自我侵蚀

  • 潘乱给出的经济尺度是:AI 出现前,Google 在全球搜索市场至少约占八成;微软 Bing 只有约 3% 份额,也能做到约 120 亿美元年收入。对 Google 而言,丢掉一两个点都足以形成巨大生意。

  • 这正是过去两年二级市场的核心疑问:不跟进 AI,Perplexity 等会抢份额;跟进,则回答成本上升、广告点击路径缩短,最肥厚的利润池可能被自己侵蚀。搜索广告甚至被挨踢牛魔王估为 Google 约 80%—90% 业务来源,因而内部既得利益更难绕开。

  • 本届 I/O 的关键信号,是 Google 敢在美国搜索中上线 AI Mode,把 AI 放进最核心的搜索框。挨踢牛魔王的概括是:“我自己革,也不能让别人革。”

8. 搜索正从信息连接器变成结果交付者

  • 潘乱追问的变化不只是界面:传统搜索负责导航、连接和流量分发,如今 AI 直接给出答案,未来还可能完成选品、订酒店、订机票等操作,中间的网站与 App 是否仍能获得同样的访问和商业价值,已成为开放问题。

  • MCP 曾引发类似想象:应用或许要从“给人浏览”变成“给 Agent 调用”,开发者开始面向模型提供结构化服务。对创业公司而言,价值可能从争夺用户页面停留,转向成为答案或行动链路中的可靠执行节点。

  • 对 Google 来说,AI Mode 的意义也不只是防守 Perplexity。它把搜索、模型、广告与购物的关系重新摆上桌面,说明公司愿意用 AI 重做核心业务,而不是像“特价版”那样隔离创新、保护旧峰值。

9. 真正的转折点发生在组织合并,而非某个爆款 demo

  • 庄明浩把拐点放在 2023 年四五月前后:Google Brain、DeepMind 及其他 AI 团队被整合,由 Demis Hassabis 团队主导。Brain 擅长 Transformer、TensorFlow 和论文研究,但在他的评价里是“写论文可以,做产品应用不太行”。

  • DeepMind 长期积累多模态与 diffusion,整合后又得到原 Brain 团队在神经网络优化等方面的支持。本届 I/O 展示的并非临时赶工,而是部门墙打通后,技术、产品和生态逐步汇合的阶段性结果。

  • 挨踢牛魔王还提到,半退休状态的 Sergey Brin 回到公司写代码,并号召团队每周至少工作 60 小时。他认为这对整个团队士气的鼓舞很大。

10. Gemini 2.0 Flash 已提前暴露了反攻迹象

  • 挨踢牛魔王把更早的产品转折点放在 Gemini 2.0 Flash:它已能编辑图片、改变人物风格和服装,并把人物与商品组合。Google 居然能在图像编辑领域抢先发布,说明研发节奏已不同于 Bard 时期。

  • OpenAI 随后以 GPT-4o 图像模型更强的效果盖过风头,Google 看上去又“很丢脸”;但牛魔王认为局势恰恰从这里开始扭转——它第一次重新具备了抢发能力,而不只是等竞品定义方向后跟随。

  • 到这届 I/O,OpenAI 同期主要拿出 Codex,已不像过去那样能完全压住 Google 的发布。节目没有据此判定胜负,却把它视为双方从“单方面截胡”转向同级竞争的信号。

11. DeepSeek 与 Kimi 把推理模型的护城河迅速摊平

  • 挨踢牛魔王用“读书与做题”解释路径:pre-training 像读完大量书,强化学习则像做题,训练模型在具体任务上形成推理。OpenAI 的 O 系列本被认为可能挡住同行一到两年。

  • 他的判断是,Kimi 与 DeepSeek 两个中国团队独立找到了纯强化学习方向,没有落入蒙特卡洛树路线。Kimi 未开源,外界关注较少;DeepSeek 则公开论文和训练细节,因而把影响放大到全球。

  • 牛魔王把 OpenAI 对蒙特卡洛树的公开讨论理解为一种误导,这是他的推断,不是节目提供的内部证据。核心事实链仍是:两个团队从公开蛛丝马迹找到了不同路径,DeepSeek 的开放让其他厂商更快复现和改进。

12. 模型进步已变成 pre-training 与 post-training 的双踏板

  • 庄明浩以 OpenAI 的 L1—L5 框架梳理节奏:L1 是 Chatbot,L2 是推理,L3 是 Agent。自 2024 年 9 月 o1 出现后,到 2025 年 Q1,全球头部模型厂商的主要任务都是复现推理能力。

  • 行业一度接受“pre-training 天花板已到”的判断,转向 post-training 与强化学习;到了 2025 年 Q2,又发现 pre-training 仍有空间。庄明浩称其为“踢运动”:前训练抬一脚,后训练再抬一脚,能力交替上行。

  • 市场对 DeepSeek R2 的乐观也来自这条逻辑:R1-0528 仍基于 V3,若未来 V4 先提升基础模型,再在其上训练 R2,就可能连续跃升两次。庄明浩强调的是推演与期待,并非确定发布时间或结果。

  • 挨踢牛魔王因此认为 DeepSeek 对 Google 本届进展也“有一定贡献”:开放方法令整个业界少走弯路,Google 又拥有搜索、YouTube 等数据资产。但这是基于行业扩散作出的推断,不是双方直接合作。

13. NotebookLM 证明 Google 也能做出带传播力的产品洞察

  • NotebookLM 出圈并非因为知识库问答本身独一无二,而是它把枯燥论文或材料转换成自然的男女对话播客。用户还能中途插话说“这点我听不懂”,让主持角色停下来重新解释,形成被陪伴着学习的感觉。

  • 朋克周指出,如今扣子空间等产品也能把主题或文章做成播客,语音模型的语调、对话感也在快速进步。但 NotebookLM 最先把能力封装成一个可理解、可传播的明确功能,这对历史上“技术强、产品弱”的 Google 尤其难得。

  • 潘乱举了一个知识聚合的例子:朋友把 56 个 AI 编程创业者专访放入 NotebookLM,再开放笔记与问答链接;顺着材料不断追问,像钻进“兔子洞”,迅速获得接近业内人士的上下文。

14. 2025 年的主线已经从模型展示转向 Agent 与产品化

  • 庄明浩的版图是:Agent 为绝对主战场,coding 与多模态是副主线,硬件、社交属于更小的探索。阶段性看,To C 娱乐与社交的成绩“不太理想”。

  • 潘乱给出的商业化分类更直接:代码是目前最明确验证赚钱的赛道,AIGC 是参与者最集中的旧主线,Agent 是当下创业公司最拥挤的方向,商品营销与 Try On 则借模型成熟重新升温。

  • 朋克周观察到,身边不少公司已经放弃训练自己的大语言、语音甚至其他基础模型,转向应用和硬件。模型层越来越像少数大公司的资本密集型战场,产品体验则在 2025 年明显上升为独立变量。

15. AI coding 已成为巨头不敢缺席的底层入口

  • 朋克周认为,大厂没有浏览器入口尚可承受,没有自己的编程能力则更严重,因为代码是互联网与软件的底层。字节推进 Trae 后,阿里也强化通义灵码及 IDE 产品,竞争不再只是卖模型 API。

  • Agent 创业公司的脆弱性可从牛魔王提到的一则传闻看出:在 OpenAI 可能收购某公司的说法背景下,一个依赖 Claude API 的编程工具曾面临被断供的尴尬。节目没有确认这则传闻的全部细节,但它说明单一模型依赖足以改变一家应用公司的命运。

  • 朋克周判断,除非像 Manus 那样已经建立市场认知,或在设计、影视等垂类建立品牌,普通 Agent 能力最终很可能被基础模型覆盖。战略合作与分发因此不亚于功能本身。

  • 另一面是开发门槛断崖式下降:团队用 Gemini 和 YouWare 做小型黑客马拉松,两分钟即可生成能玩的程序。“最好时代”在于人人都能做,“最坏时代”则是所有人都依赖同一批模型,复制与竞争同样加速。

16. 商业化按“算力—模型—应用”逐层下沉,时机比想象力更重要

  • 挨踢牛魔王把赚钱顺序描述为一波一波:先是 NVIDIA 等卖卡者,再是按 token 收费的头部模型公司,随后才轮到 AI coding;当模型行动能力进一步成熟,Agent 才有更稳定的付费基础。

  • 过早进入并不等于领先。早期创业者曾拿 Stable Diffusion 1.5 做电商换衣,投入数百万、数千万甚至上亿元,却发现能力根本达不到客户要求;如今 Google 与可灵的 Try On 逐渐成熟,相同需求才开始具备交付条件。

  • 潘乱从跨境电商朋友处得到的口径是:用现成 C 端模型完成换装,相比某些企业服务方案可节省约 90% 成本。这可能说明能力成熟,也可能意味着早期服务商收费较高、利润会被通用模型压缩。

17. Flow 与 Veo 3 打开的不是更多特效,而是新的制作预算结构

  • 朋克周认为,若 Flow 能把 Veo 3 变得更可控,付费者就会从 AI 视频爱好者扩大到营销、影视和后期团队。可灵已被快手提升为独立一级部门并形成较强盈利,说明生成视频开始从 demo 走向业务。

  • 潘乱提到的短剧团队正在寻找真人难拍、AI 擅长的题材,如《灵蛇》《山海经》、机甲,乃至燕垒生《天行健》中的蛇人、鼠人。但一部约 100 分钟、总预算两三百万元的短剧仍承受不起当前技术条件,技术可行不等于经济可行。

  • 模型特性也会反向决定内容:可灵擅长玄幻和机甲,Veo 3 的优势反而是富人在家做饭等日常场景;朋克周用它做类似《流浪地球 3》的科幻画面时仍会变形。创作者是在根据模型能做什么,重新寻找题材。

18. AI 让 Google Glass 从失败入口变成可重新评估的计算平台

  • 挨踢牛魔王认为,旧 Google Glass 的问题是缺点多、实用性不足;多模态 AI 则补上感知、知识和推理。用户看向一棵树、在空中指一下,眼镜便可能理解所指对象并说明树种,而不必掏出手机扫描。

  • 更实用的场景包括自动整理会议纪要,以及在人际场合提醒“这个人是谁”。牛魔王举例:人脸识别早已可能比人的记忆稳定,眼镜若记录过这个人,就能减少“别人认识你、你却认不出他”的尴尬。

  • 朋克周的判断更宽:AI 不只抢救 Google Glass,也让一批原本痛苦的 VR、AR 厂商“起死回生”。语音识别、视觉理解和自然互动补上后,眼镜、手表、手环、摄像头、智能家居与 AI 玩具都能重新定义用途。

  • 潘乱进一步追问:既然 Gemini 多模态领先,Google 眼镜会不会最好,继而 Pixel 会不会超过 iPhone?嘉宾没有接受这条确定推论,只认为眼镜“有可能”替代手机,电脑则更难;好模型不自动等于最佳整机。

19. 实时翻译展示了多模态硬件最清晰的即时价值

  • 挨踢牛魔王设想四位嘉宾分别说中文、英文、西班牙语和印地语,每个人却都能听见自己的母语;系统还保留原说话者的音色、语气与感情,而不只是提供字幕或机械配音。

  • Google 已展示相近会议场景,但牛魔王承认产品仍需打磨。他的判断是,Transformer 最早从翻译场景发展出来,如今 AI 可能反过来把翻译“逐步全部解决掉”,国际会议与直播会首先受益。

20. 浏览器这个古典产品重新成为 AI 的兵家必争之地

  • 庄明浩列出的参与者包括 Perplexity、传闻中的 OpenAI,以及国内的夸克和重新加码的腾讯浏览器。一个几乎被视为基础设施的古典产品,因为能够承接账户体系、同步、响应速度、安全与隐私,再次获得内部资源和战略话语权。

  • Chrome 同时面临美国反垄断问题,结果仍悬而未决;庄明浩不认为它会突然“一锤子买卖”完成拆分,却承认长期不确定性可能影响 Google 在入口战中的打法。

  • 对插件创业者而言,Chrome 原生集成 AI 会直接压缩空间:账户同步、响应速度、安全和隐私都不是小团队容易复制的能力。但庄明浩保留了一道缝隙:“模型即应用,但应用不仅仅只有模型这一种。”

21. AI 的产品价值在于推断隐藏参数,而非给旧界面加聊天框

  • 潘乱用电商搜索揭示基本功缺口:在淘宝、京东、美团等产品里搜索地址,曾得到地图册商品;搜索“发票”,又出现一堆商品,而不是开发票入口。用户意图明显,传统产品却仍依赖僵硬关键词。

  • 朋克周解释,复杂软件背后可能有 300 个参数;产品只展示 3 个,其余 297 个并未消失,只是被设为平均化的默认值,边缘用户自然会觉得不好用。

  • AI 的潜力是结合搜索词、历史与当前场景,推断那 297 个隐藏参数,在不增加表单负担的前提下处理个体差异。交互因此可能从“用户学习软件”改为“软件理解用户要完成什么”。

  • 潘乱的反讽仍值得保留:未来系统也可能先“深度思考”用户究竟想开发票还是买发票,再终于弹出正确界面。AI 能补技术限制,但基础产品体验与意图设计仍然重要。

22. 创业者最危险的位置,是站在模型即将覆盖的正前方

  • 挨踢牛魔王的警告是:“不要站在大模型前进的前方,一定会被它碾碎。”创业团队可能用复杂 workflow 加班数月完成换装,下一版基础模型却用一个提示词直接实现,设备、房租和研发投入同时归零。

  • 他提出的防线是找到行业 know-how,最好能用代码或明确规律表达。以 E=mc² 作类比,通用模型是逼近规律的万能拟合器,而精确公式既更稳定,也可在 CPU 上运行,成本远低于持续调用 GPU 模型。

  • 潘乱随后追问,这种 know-how 是否也会被知识库和模型吸收。 他以 R1 与 Kimi 为例说,两者并没有拿到完整论文或文献,却从 OpenAI 发布会中的蛛丝马迹发现强化学习可以解决推理模型问题。由此看,知识库、模型与 Agent 结合后,原本的行业经验也可能被进一步聚合。

  • 因而牛魔王最后把判断原则收敛为:“模型越强,你做的东西越强”,而不是模型一升级、产品就消失。若 AGI 真像 AlphaGo 横扫围棋那样覆盖完整领域,他也承认现有防线可能仍会失效。

23. 新应用不会只是旧互联网产品加一层 AI

  • 庄明浩用“独响”展示一种极端产品假设:用户写朋友圈或日记,平台没有真人,只有 Agent 评论和回应;用户既获得被倾听的感觉,也不必承受真人反对与否定。这未被证明,却代表面向未来心理状态的设计。

  • YouWare 则押注另一种变化:YouTube 让人分享视频,AI 编程把制作应用的门槛降到足够低后,人们也可能分享自己的小游戏和程序。内容平台的最小单元,可能从帖子和视频扩展到可运行软件。

  • 潘乱据此认为,很难判断某个方向完全不在智能主线上。知识库、编程和 Agent 结合后,稀缺物或许只剩《银翼杀手》式的“手工面条”和“真实的羊”;但这是趋势想象,不是已经发生的市场结果。

24. 主航道并不排斥创业公司,但退出方式和资本尺度已改变

  • 庄明浩观察到,2024 年 AI 交易多是“掏空式并购”,本质上更接近挖团队;到 2025 年,真正支付高额对价、购买公司与产品的并购开始明显增加。

  • 即使处在大模型厂商必争的主航道,创业公司仍可能凭执行、产品和先发规模被收购。大厂自身有人力与优先级约束,未必会把每一层都从零做到最好;机会窗口可能短,却并非不存在。

  • 资本门槛已经脱离传统早期 VC:庄明浩的市场口径是,垂类公司做到 1 亿美元 ARR 后可能获得 30—50 倍估值;Cursor 更传出约 5 亿美元 ARR、以 99 亿美元估值融资 9 亿美元,而产品版本才到 1.0。

25. 多模态模型会集中,垂直产品仍可凭结果收费

  • 视频模型被潘乱形容为“一将功成万骨枯”:同一时间六七家、七八家竞争,其中一半可能是大厂;可灵、MiniMax 的海螺、PixVerse 等仍在追赶,但训练所需的算力、数据和算法已远非传统互联网创业成本。

  • 声音市场更微妙。庄明浩认为 ElevenLabs 的商业化最强,ARR 约 1 亿美元;打榜表现则以 MiniMax 最突出。但声音可能不足以长期成为独立战场,因为视频模型正把音频能力一并包入。

  • 他的团队会使用各种模型,包括 MiniMax,不向客户卖“哪家的 token”,而是为明确细分场景交付结果、按结果收钱。技术来源可以混合,客户购买的是完成度与稳定交付。

  • 美图是朋克周眼中的典型:图片和视频模型未必最强,却懂电商、美颜、证件照与付费习惯,已经实现不错收入。HeyGen 也收敛到营销视频、数字人、口型与语音组合,故事从“最强模型”变成明确场景、品牌与收入。

26. Agent 时代会重建一套给机器使用的互联网基础设施

  • 庄明浩观察到,美国近期不少早期项目并不再做一个终端 Agent,而是补 Agent 到来后的基础设施。现有网站与数据库是给人使用的,AI 的身份、权限、安全、支付,以及 API、SDK 调用方式都可能重做一遍。

  • 这也让中美过去十余年的优势开始交汇:中国长期在 To C 移动互联网、产品和运营上发展,美国则积累 To B SaaS、云、订阅和企业交付。AI 产品既要理解企业付费,也要学习消费产品体验,双方都不能只靠原有长板。

  • 挨踢牛魔王用蒸汽机解释总需求:蒸汽机出现后,人类并没有减少煤炭使用,反而让更多地方开始烧煤;智能成本下降后,同样会覆盖过去“不值得专门写程序”的细碎长尾市场,为创业公司创造新需求。

27. 最可靠的结论不是预测赢家,而是让自己进入这轮组织变革

  • 朋克周的“诚实非答案”是:“所有人都不知道明天会怎么样。”Google、微软未必知道,奥特曼和 SSI 创始人频繁谈 AGI 也可能带有营销成分;他选择先做媒体、在岸边观察,同时尊重已经下水做应用的人。

  • 潘乱的现实提醒是,国内大量 AI 工具仍免费,“不用真是白不用”。如果短期没有足够新增价值、更多只是重新分配,那么不熟练使用 AI 的人,很可能被更熟练的人取得效率与议价优势。

  • 庄明浩把长期变量落到 OpenAI 框架的 L4“创新”和 L5“组织”:历次工业革命中,技术出现当下并未自动带来生产率跃升,真正变化要等组织和商业模式适配。Google 本届 I/O 本身,就是组织重构先于产品爆发的样本。

  • 他借道格拉斯·亚当斯的三条技术定律收尾:出生时已有的技术是日常秩序,15—35 岁出现的是革命,35 岁后出现的往往被视为违反自然。嘉宾们虽已超过 35 岁,却仍愿意拥抱这次变化;“某种程度上,我们是幸运的。”