
陈天奇
前沿洞察
陈天奇的系统演进揭示了AI基础设施的底层法则:小团队凭算法与工程的极致协同能击穿巨头壁垒铸就长期资产;而纯性能优势若脱离用户体验与社区动量,终难逃生态退场命运。当前TVM与MLC LLM的前沿攻坚,本质是对抗异构硬件与模型落地间的巨大摩擦。唯有将系统深度普惠化,跨越部署鸿沟,方能在算力变革中立于不败。
观点集合
陈天奇:机器学习系统,长期主义,初心,XGBoost,MXNet,TVM,MLC LLM,OctoML,CMU,UW,ACM班
- 🗓️ 日期:
2025-09-12| 🎙️ 节目:WhynotTV
XGBoost以极致速度、缺失值内置处理和社区协作建立长期资产,说明小团队可在单一算法与系统协同上形成持久优势。MXNet的退场则显示性能和大公司支持仍不足以替代用户体验与社区动量,TVM、MLC LLM及OctoML的演进将继续受模型、硬件和部署摩擦驱动。
查看访谈对话精读提要
XGBoost、MXNet、TVM、MLC LLM并非四次追风口,而是陈天奇持续拆除机器学习规模化瓶颈的一条技术主线。 他属于“问题驱动”而非“方法驱动”的研究者:树模型、深度学习框架、编译器乃至硬件指令集都只是手段,目标始终是“让更少的人用更少的 engineering resource”构建和部署 AI。对基础设施观察者而言,这意味着价值未必沉淀在某一代模型,而可能落在跨模型、跨硬件反复出现的 bring-up、优化与部署摩擦上。
XGBoost说明,小团队的持久护城河可以来自极致的单点产品、算法与系统协同,以及持续扩张的社区信任。 发布时它追求世界上最快的 Gradient Boosting,并把 missing value 的处理直接内置到模型中;何泰然录制前看到论文引用已接近 7 万。陈天奇把成功归结为“把一件事情做到极致”、专注一个算法和社区共建,而非事先预判了市场规模。
MXNet的退场则表明,领先性能和大公司支持都无法替代用户体验与社区动量。 MXNet长期拥有优秀的多卡性能,Amazon、NVIDIA也曾深度推动,但团队早期试图同时最大化性能和体验;陈天奇事后认为“其实应该先选择用户体验”,PyTorch由此取得更强的开发者心智。更深的教训是,靠人力追赶每代 GPU 的工程成本不可持续,这直接催生了TVM。
模型趋同不会自动消灭机器学习编译,硬件专用化反而让模型—芯片协同更紧、更频繁。 陈天奇承认少数模型占据多数推理量可能压缩通用编译空间,但每代芯片的编程方式、新模型变种及专用算子仍需重新适配;“没有同一个 recipe 可以拿到 next 2x”。MLC LLM据此押注跨云与端侧的统一推理,而端侧能否起量,最终取决于本地模型是否在专用场景达到“够用”,再由成本、隐私和实时性放大需求。
高校与frontier lab的万卡、十万卡差距不可避免,但百卡级资源、最新GPU和开源协作仍足以攻克高杠杆的垂直瓶颈。 陈天奇不主张按论文投入产出比选题,而是寻找系统真正卡住的模块;结构化JSON生成项目XGrammar成为开源生态的事实标准之一,就是“小模块做到最好”的样本。“Resource constraint is also an opportunity to make people more creative。”
OctoML展示了开源技术到商业收入并非直线转化:开源是起点,最终产品与最初设想几乎必然不同。 公司起初销售跨硬件的模型优化与部署能力,约两年前转向直接提供Llama等模型的endpoint/API;何泰然提到公司最终于2024年底被NVIDIA收购。陈天奇的创业复盘并不回避PMF、领导力和协调的重要性,但仍坚持:“如果继续优化ResNet,最后我们会输得很惨”,技术栈必须敢于reinvent itself。
这期最重要的长期主义不是“坚持原路线”,而是接受失败后仍敢于重选问题、重写系统和重新出发。 从在正确的ImageNet问题上坚持错误方法两年,到为TVM在博士后期投入11个月搭出首个可运行版本,陈天奇的风险承受力来自“失败也没那么可怕”。资源、声誉和团队责任越大,初心反而越难保持;他的自我提醒是:“勇气可能是你过去的自己给你自己的约定。”
🔗 原始收听与视频来源: 陈天奇:机器学习系统,长期主义,初心,XGBoost,MXNet,TVM,MLC LLM,OctoML,CMU,UW,ACM班