AI视频正在吞噬世界——Olivia和Justine Moore,a16z
摘要
AI视频已经从专业圈层的新奇玩意,变成大众消费内容形态;Justine Moore估计,最近刷到的TikTok、Reels或Shorts内容中,“可能有90%”由AI生成。 因此,趋势发现已经从Reddit上的AI论坛转向TikTok和Instagram,如今可能有“数十万”普通创作者会在格式进入X之前,先行发布并二创。
最强的病毒式传播公式,是让熟悉的IP做不可能的事,或让足够古怪的原创内容迫使观众回看一遍。 Stormtroopers、Jesus、Stitch、Yetis和Bigfoot自带认知度;Italian brain rot则靠纯粹的错愕感取胜——“我是在幻觉里吗?”熟悉感让人停下来,出乎意料的行为促成分享。
去中心化的二创网络,能在任何制片厂组织世界观之前,就把AI角色变成有分量的IP。 Italian brain rot从零散图片发展为由社区选出的正典,随后出现互动角色、音乐剧、成人剧情、玩具、T恤和毛绒玩偶;孩子每天能刷到几十条相关视频,而Nickelodeon每周只播一集。Kim the Gorilla则通过与动物园管理员Becky持续不断的冲突,很快积累了约30万粉丝。
今天的病毒式内容格式,部分是对模型限制的适应,尤其是Veo 3无法同时实现图生视频和生成音频。 提供起始画面会让用户切回Veo 2,使原创角色难以保持一致;因此创作者会使用模型已经认识的身份,或选择猩猩这类视觉上更宽容的角色。社区还学会了通过在不同片段中保留可识别角色,跨越8秒时长上限。
创作者经济的难点仍然远大于创作者增长。 一条玻璃水果视频可能需要约8次生成,更复杂的Veo 3叙事会快速消耗昂贵的点数;参与者也无法给出统一的社交平台分成标准,而且创作者首先要符合平台项目的准入条件。“地上没有躺着现金”,所以变现通常要依靠产品、咨询、课程、广告或导流,而不只是播放量。
只要基础模型的分发足够繁琐,界面层就能捕获可观价值。 Google的Flow被形容为难以找到,绑定昂贵套餐——包括被提及的每月125美元方案——默认通过隐蔽控件调用Veo 2,而且无法在移动端使用。这些摩擦把创作者推向Krea、Fal、Replicate等按量付费聚合平台,即便Google仍能通过API获利。
媒体所有者可以自动化长视频切片,但品牌信任限制了他们为追求病毒传播而优化的力度。 OpusClip能识别30至140秒的片段、评分、加字幕和重构画面、删除填充内容,并发布适配不同平台的帖子;但几位主持人仍认为,二次加工的内容可能跑不赢为短视频原生创作的内容。Justine举出的反例是Vitrupo的病毒式访谈切片,而更深层的矛盾仍是“YouTube缩略图经济”与真实准确的叙事之间的冲突。
AI角色可能扩大成为网红的群体范围,同时创造一类可控的新型商业资产。 Olivia的挑衅式判断是,有创造力、会搞笑的人不再需要符合Instagram的审美标准:他们可以把自己的头脑放进合成角色背后,而一些图像类运营者已经能赚到“数万美元”。她预计视频会把这一机会扩大“10倍”,但持久价值可能取决于能否把受众转化为订阅、IP、服务或商品。
精读
1. AI视频已经成为消费者原生媒介
Justine把自己接触Stable Diffusion的时间追溯到2022年9月左右。起初,做创意的朋友认为生成式媒体根本不可用;今年早些时候,他们开始询问是否应该学习这项技术,如今甚至有人周末专程去找姐妹俩学工具。
Justine对信息流的粗略估算颇为惊人:最近刷到的TikTok、Reels或YouTube Shorts内容中,“可能有90%”由AI生成。两个月前,分发还主要围绕animated orange cat和Italian brain rot等少数辨识度较高的格式展开。
随着工具变得更易用,发现路径也随之迁移。早期AI视频出现在
r/aivideo、r/ChatGPT和r/singularity等Reddit社区,经由X上的策展人传播,偶尔才会进入消费者平台;Veo 3和MiniMax 2出现后,病毒式格式越来越多地发源于TikTok和Instagram。Olivia亲自制作ASMR视频,测试这波机会究竟有多容易摘取。原创的龙蛋创意表现不如已经成型的水果切片趋势,而熔岩则反复成为赢家:观众喜欢“吃熔岩、挤熔岩”,以及剥开它的外壳。
2. 模型限制正在塑造主流内容格式
Olivia发现,只要提示词对应YouTube上已经常见的类型,Veo 3的能力就相当惊人。一句话的请求就能生成类似专业ASMR的内容,因为模型理解这种格式;叙事性、角色驱动的vlog则复杂得多,需要更多试错。
Veo 3最关键的限制在于控制能力:文生视频可以包含音频,但从图片开始会把工作流切换到Veo 2。由于图生视频不带音频,创作者无法可靠地在多次生成中固定同一个原创角色。
Olivia曾为一套使用Star Wars角色的奥运跳水格式改用MiniMax,并用ElevenLabs手动生成音效。让每个声音都对齐“花了非常长的时间”,说明一条打磨完善的短视频很快就会变成多模型协同的编辑项目。
使用现成身份可以同时解决多个问题。Veo 3已经理解Stormtroopers、Jesus、Stitch、Yetis和Bigfoot;创作者则通过在不同片段中延续这些身份,跨越8秒时长上限。猩猩加粉色蝴蝶结,也提供了类似的宽容一致性方案。
3. 二创网络正在没有中心制片厂的情况下创造IP
Italian brain rot最初是一个去中心化的角色宇宙:一名创作者提供几张图片,其他人继续添加角色,最受欢迎的角色最终成为正典。动画出现后,内容进一步扩展为合集、角色互动、故事线、音乐剧、出轨剧情、玩具、T恤和毛绒玩偶。
主持人用儿童观众举例,说明这种分发模式的优势。一个孩子每天刷几十甚至几百条TikTok,就能“把这些角色背得滚瓜烂熟”;传统电视网络可能每周只播一集,角色依恋因此可以通过去中心化的二创生态形成。
Kim the Gorilla说明,原创、原生于AI的IP不需要借助既有粉丝基础也能成立。她与动物园管理员Becky的冲突很快带来数十万点赞和约30万粉丝,但Moore姐妹并不认为创造力已经过时:“我们需要优秀的创作者,只是他们现在拥有的是另一套工具。”
4. 受众增长成本足够低,足以诱惑创作者,但制作并不便宜
变现已经覆盖平台分成、广告、导流至外部业务、订阅、商品、课程和咨询。Nick St. Pierre这类熟练创作者,会把病毒式内容作为获客渠道,服务于希望获得底层提示词专业能力的品牌和公司。
姐妹俩制作玻璃水果视频时,需要反复生成:Olivia估计,即使是简单的水果切割视频,也可能需要8次生成;Justine则提到多次失败的切割,因为模型会横向切割,或生成形状畸形的分层。叙事视频中,付费点数消耗得更快;除非创作者清楚受众如何变现,否则单位经济并不划算。
讨论暴露出的不是一个清晰的分成基准,而是对收入的不确定性。Olivia曾提出每100万次播放约20美元,随后几位嘉宾又重新核对了这一数字及其单位;费率取决于平台和互动水平,而且账号首先要达到足够的病毒传播规模,才能进入创作者项目。
财务回报并不是唯一的供给驱动力。过去很难做大受众的人,也能通过猩猩vlog获得数万点赞,从而得到强烈的“多巴胺刺激”;即便收入尚未出现,抢先进入一种新媒介本身就具有奖励感。
5. 合成网红扩大参与面,也提升可控性
Olivia的“热辣且有争议的观点”是,传统网红经济 disproportionately 奖励外貌出众的人。AI让一个有趣、有创意的人可以创造一个符合主流审美的角色,同时把“自己的大脑放在内容背后”。
基于图像的虚拟网红业务已经能赚到数万美元,有时收入来自为额外内容提供的付费订阅。Olivia的条件式预测是,AI视频会让这一市场“爆发式扩大10倍”。
Olivia也给出了冷酷的推论:一个受控的虚拟网红“永远会服从你”,可以被摆放在任何地方,也不会自行卷入政治争议。这种控制力具有商业价值,但节目把它当作一个刻意令人不适的特征来讨论,而不是毫无保留的优点。
6. 模型分发不佳,为工作流聚合平台留下空间
Moore姐妹将技术栈分为基础模型,以及界面或应用公司。比如Kling把强大的图生视频模型与易用控件结合在一起;在其他场景,创作者往往会转向第三方,以获得更容易使用的模型访问和工作流。
Veo 3则是反面案例:Flow需要单独找到这个产品,选择两个昂贵的Google套餐之一,使用多个Google账号中正确的那个,并找到隐藏控件,因为默认仍然是Veo 2。该网站在移动端也无法使用。
这些障碍把创作者推向Krea、Fal、Replicate及其他类似服务,它们提供多个模型和按量付费生成。由于Veo 3提供API,Google和赋能层都能获利,价值并非只能归属于模型所有者。
对于需要风格转换、角色替换、一致性、放大或其他精细控制的专业用户,ComfyUI仍然有价值。基础模型正在吸收部分工作流,但Justine认为,ComfyUI维护者是在“替要求苛刻、使用互联开源节点的社区做上帝的工作”。
7. 播客分发正变得平台专属且由智能代理驱动
对于Latent Space,Moore姐妹建议用Gemini 2.5把文字稿改写成刻意追求娱乐性的教育脚本,再通过Hedra让节目由ElevenLabs生成的声音“Charlie”动起来,并配上图表,或自动选择、生成B-roll。
OpusClip提供了更直接的工作流:监测一个YouTube频道,识别30至140秒的片段,加字幕,删除填充词、口吃或脏话,把16:9画面重新构图为竖屏,应用智能缩放,撰写社交媒体文案,并自动发布。
主持人反驳称,长视频再加工内容通常跑不赢为短视频原生设计的内容。Justine说自己“过去同意这一点”,随后举出Vitrupo反复成功的案例:它把观众熟悉的访谈对象剪成短片,并发布到X上,而视频当时获得了异常强的算法分发。
病毒传播仍然带来编辑约束。主持人不能虚假暗示“Sam Altman说世界将在2年内终结”,Justine也否定了Olivia提出的垃圾式推文开场,称那“不是我们”。两人都认为,长篇知识内容仍然可以与病毒式格式并存。
8. 提示词文化正外溢至哲学和实体商业
“Prompt theory”起源于Veo 3中的角色意识到——或拒绝相信——自己是被生成、被控制的。随后命题发生反转:也许人类同样是被提示出来的角色。这一概念如今已经出现在普通青少年制作的混乱AI反击视频中。
Justine把问题延伸到Reddit:匿名账号未来可能越来越多地由LLM运营。她坦承自己也不确定,如果这些机器人始终在线、分享自己的兴趣,而且确实能说出有趣的内容,那会不会反而令人悲伤。
Brett Climo展示了从像素走向商品的路径:受众提出需求后,Olivia为朋友、家人和AI视频社区的人印制了约30件卫衣。AI家具走得更远,据称一把想象中的猩猩椅已经被制造并上市销售。
剩下的机会在于运营。趋势在不同平台之间通常只有1至2天的套利窗口;PJ Ace等专业人士已经展示了商业级工作流。主持人对创业公司的“需求”是:开发一款软件,把每条病毒视频中的图片和金句自动转化为商品。