Baseten CEO Tuhin Srivastava谈定制模型与构建推理云
摘要
Baseten 30倍的增长反映了AI原生应用的爆发,但更大的企业推理市场仍基本缺席。 Sarah Guo表示,Baseten预计今年营收将超过10亿美元,Tuhin Srivastava对此予以确认;他估算,应用公司仍占推理调用量的99%,因此“市场的大多数还没有上线”。
应用层真正持久的护城河是专有工作流反馈,而不只是模型权重的获取权限。 Abridge的临床医生修改记录和后续EMR操作形成了前沿模型公司可能无法获得的奖励信号;基于这一信号进行后训练,有望打造专用的长时程智能体。“只有他们自己能收集到的用户信号”,才是保护应用层的关键。
生产推理如今已高度定制化,模型部署也因此与日益持续的后训练闭环相连。 Baseten超过95%的token通过专用推理运行,几乎每个客户都会为质量、性能或两者同时改造模型:“没人只是直接运行原版开源权重。” 顺序很重要——“在产品市场匹配之前不要做后训练”——因为公司应先用最好的模型验证价值,再将其专门化,做到“更好、更快、更便宜”。
中国开源模型具有经济战略意义,但Guo指出,定义绝对能力前沿的仍是美国闭源实验室。 Srivastava称自己“可能会判断错”,但表示如果这些模型被网络边界隔离,就不会“神奇地”跨越网络边界;他认为DeepSeek的生产成本可能只有Anthropic的20%,延迟相当甚至更低,可靠性可能还更好。他的立场是:美国开源模型既有必要,也不可避免,但忽视今天已经可用的智能,就会“只见树木、不见森林”。
算力稀缺如今已直接传导至合同期限、营运资金以及可能的上市时点。 Baseten在18朵云上运行90个集群,利用率高得令人不适——接近但通常还没到95%区间——并每天下午4点开会分配供给。要从一家可信云厂商获得1,024块B200,可能需要签下3至5年承诺,并预付TCV的约20%;当被问及这是否意味着公司应更早上市时,Srivastava回答:“早点上市。”
Baseten的护城河逻辑是软件叠加稀缺算力,而不是单纯出租GPU。 Srivastava称GPU即服务是商品化业务,而推理软件让Baseten前30大客户实现零流失,年度NDR约为400%:“如果算力全在我们手里,祝你推理跑得起来。” 他预计专用芯片会出现,但NVIDIA的供应链、CUDA和生态意味着基础设施运营商“今天用NVIDIA能跑得最快”。
推理效率呈现出类似杰文斯悖论的特征:单位成本下降带来更长的智能体和更多总认知,而不是需求饱和。 成本下降后,开发者会加入“多得多的智能”,因为更好的答案能改善体验并带来更多收入。因此,Srivastava称推理是“最后一个市场”——即使实现AGI,推理仍然存在;他认为消费者将迎来“万物皆管家”,而那些不加入智能的工作流公司则会遭遇“灭绝时刻”。
精读
上游暂未提供,后续同步将继续补齐。