先锋 趋势 方法 投研 作者
将 AI 成本削减60%的20亿美元公司|Tuhin Srivastava
返回节目精读

将 AI 成本削减60%的20亿美元公司|Tuhin Srivastava

摘要

  • Baseten 看似一夜爆发,实则走过了15年的创业历程:公司成立于2019年,在2023年末完成B轮时仍只有18人。 Srivastava说,他每天面对的“输入”几乎没变:仍然查看支持渠道、调查产品反馈、销售产品。“唯一的变化是,市场出现了,而我们没有放弃”;充足资本和刻意保持轻量的组织结构,让它保留了抓住这波机会的选择权。

  • Baseten的爆发不是从零开始的转向,而是一次重新聚焦:公司此前已经搭建了模型服务基础设施,随后3个市场变量同时翻转。 小模型变大,内部使用场景进入有真实SLA要求的生产环境,数据科学家则让位于有权改造基础设施的工程师。Stable Diffusion提供了验证点:Riffusion的需求出乎意料地从Baseten估计的5块A10G,攀升至约100–150块,促使Baseten在6周内重做产品形态。

  • Srivastava预计,面向原生开源模型的共享端点会商品化,但专属算力——约占Baseten业务的99%——仍然可以形成差异化。 工作负载的异质性很强:输入、输出、流量、SLA、云区域、合规、硬件和运行时配置都会因客户而异。Baseten依靠容错基础设施、“A+”速度,以及帮助通常管理3至20个模型的客户使用的软件来竞争。

  • 推理性能是一个分为两层的问题:先让工作负载在5至100,000块GPU之间扩展,再优化模型在单块GPU上的运行速度。 基础设施必须保留KV cache复用、减少地理跳转,并帮助整合稀缺算力——例如一家云厂商只能提供500块B200时,找到2,000块B200。运行时工作则要平衡首个token耗时、每个输出token耗时、吞吐量和单token成本,有时会把“不到1周前完成的研究”投入生产环境。

  • NVIDIA的优势不只是芯片原始速度:CUDA把可靠性、通用性和开发者生态结合起来,而挑战者必须同时解决芯片、制造和软件问题。 硬件周转周期需要6至9个月,但Srivastava说:“在这个业务里,我无法预测超过60天的事情。” 在极高的吞吐量下——1个客户每分钟处理数亿个token——如果能让B200跑起来,它们在许多视频工作负载上可以带来据称40–50%的提速。

  • 企业用户从封闭模型转向开放或定制模型,出发点是控制权,而非意识形态。 Srivastava提到,客户看重专门设计的行为、更低成本、对可靠性更强的控制、专属基础设施、隐私和企业SLA要求。客户也在意数据不会被简单“管道式”送给一家会拿它训练模型的供应商。他预计企业会采用混合模型,并给出一个刻意不确定的判断:“40/60——不知道哪一边。”

  • 推理业务的成立并不需要AGI很快到来:Srivastava认为,模型已经足够好,可以释放“1,000倍”更多经济价值,而下一次能力跃升可能还很远。 他的判断很直接——“我认为我们已经没有数据了”,因此下一次跃升可能需要架构突破。与此同时,工具、沙盒、代码执行、强化学习和应用层都会持续创造额外的推理需求。

  • Baseten的资本配置准则,把坚持到底与激进放弃沉没工作结合起来。 2022年,公司砍掉了4个产品中的3个,包括1个开发了2.5年的应用构建器,以及在6个人——约占公司1/3——投入6个月后打造的Blueprint。核心区分是“不要放弃”与“不要在情感上依恋”:风险投资支持意味着避开局部最优,继续冲击最大的机会。

精读

上游暂未提供,后续同步将继续补齐。