先锋 趋势 方法 投研 作者
E244|机器人走错路了?与苏度韩铮聊聊具身智能的3D数据、路径分野与硅谷竞赛
返回节目精读

E244|机器人走错路了?与苏度韩铮聊聊具身智能的3D数据、路径分野与硅谷竞赛

摘要

  • 核心暴论:分层结构将在今年下半年重回主流。 苏度科技CEO韩铮认为,硅谷以Physical Intelligence为代表的端到端VLA路线面临数据不足——“可能从今年的下半年开始,上下分层的这种结构,会重新再回到主流里边来,而且可能……是最终的一个方法”。上层推理与底层操作解耦,底层操作不能只靠人类遥操作数据,Sim2Real是躲不过去的。
  • 数据冷启动是端到端路线的关键障碍。 特斯拉靠十几年前卖出几百万台车积累FSD数据,但机器人"很难在没有任何功能之前卖500万台到各个办公室",且没人愿意在家穿动捕服教机器人做西红柿炒鸡蛋——冷启动需要百万甚至千万级开放环境数据,所以"Sim2Real是躲不过去的"。
  • 可验证的证据:苏度R1的零样本demo。 60分钟连续拍摄、100多个训练集外物体、240次抓放、单次成功率近98%,闭环调整后达100%;随后在ICRA维也纳和CVPR现场让可能近千名参会者用证件、手机、玩偶随机测试——对比某公司提前一个月租Airbnb采数据练咖啡demo,“几乎没有给你时间去做准备"的公开测试此前无人做到。
  • 操作比运动控制难两到三个数量级——这是估值判断的关键分界。 宇树、波士顿动力的locomotion已被Sim2Real充分验证,但物体操作需要结构化3D数据、几何亚毫米级理解和对环境的预测推理;Figure最近的产线分拣demo只有两类形状几乎一样的物体、始终在自建测试线内,“物体泛化性其实不高”,洗碗机demo据泓君听说花了很长时间才拍出一条。
  • 竞争格局的反共识判断:最大对手是DeepMind+电动版Atlas,而非PI或Skild。 Skild估值7个月从45亿冲到140-150亿美元,但两位创始人"以前是坚决不信仿真的”;而DeepMind有MuJoCo、Genie 3、“几乎无限的卡”,把波士顿动力硬件核心人才挖到伦敦与模型团队同址——“他们对于物理世界AI的下注,可能是在所有的大厂里边最坚决的一家”。
  • 硬件量产答卷看宇树:2025年出货5000多台,对比特斯拉、Figure约150台;但宇树的物体操作才刚起步。 苏度的商业模式对标iPhone+iOS而非安卓:软硬一体卖本体+底层模型+SDK,让1000个开发者中跑出100个部署场景、5-10个部署上万台的超级应用——“Sim2Real这条路是对的,是副产物”。

精读

1. 苏度的定位:全栈,但赌注押在"操作"这一最难环节

  • 韩铮的定位:大脑和本体都做——团队近10年用机器学习驱动机器人,2022年下半年半商业化启动时才决定自造硬件,因为"如果自己不碰本体的话,也很难把大脑的能力展现"。对标硅谷:Optimus、波士顿动力、Figure、1X是本体+模型但模型侧不如PI、Skild专注。
  • 泓君开场抛出的行业痛点是本期的试金石:能否通过demo判断机器人公司好坏——多数公司会提前对特定环境做适配,而苏度敢在完全没有训练过的新环境做demo。

2. 灵巧手不是性价比之选:90%的操作任务不需要

  • 韩铮的拆解:做操作模型的团队(包括PI)都先把二指夹爪的能力拉到边界,“机器人里边要做的物体操作的任务,可能90%不一定需要灵巧手”,剩下5%-10%才需要多指。人形风潮是2022年Optimus唤起的公众想象,而非技术必然。
  • 现阶段策略是把操作任务与下肢灵巧度解耦——双足还不稳定、经常跌倒;但未来会回归同一条线:通用机器人的构型"可能是轮足式",平地高效移动、特殊地形切换足式。
  • 灵巧手本身:手内转魔方、盘核桃确实需要多指,但穿针引线未必——稳定性、可靠性、成本(早期Shadow Hand几十万美金一只)都没控制好,“是一个选项,但不是一个性价比最高的方法”。

3. 从ImageNet到ShapeNet:3D数据集的谱系与残酷落差

  • 泓君介绍,联创苏昊是ImageNet核心作者之一,后在斯坦福Leo Guibas实验室把"大数据集+结构化描述"思想搬到3D,2013-2014年起做ShapeNet,PointNet也是他的核心工作。落差在于:ShapeNet据韩铮说应该有几十万个3D模型,ImageNet有1400万图文对——互联网上开源可用的3D模型极度稀缺。
  • 层层递减的标注深度:ShapeNet只有基础几何和表面贴图;标到部件级的PartNet只剩几万物体;再加动力学约束(瓶盖往左拧还是往右拧、能不能拧下来)的PartNet-Mobility不到3000个物体——据韩铮记忆,它至今仍是开源界最大的带部件、带动力学约束数据集。这对合成数据训练和带物理一致性的视频生成"都有很大的约束"。

4. 为什么不直接看视频学:10公分够开车,操作要亚毫米

  • 韩铮对"对着海量开放世界视频训练"的回应:2D图片视频里"三维的信息有,但是不太全,也不太准"——连Sora训练管线之一都是用Unreal/Unity从3D模型反向渲染2D数据。
  • 精度论是硬约束:自动驾驶导航10公分左右的精度是够用的,“但是对机器人的操作,10厘米的误差是绝对不能忍受的”——把线缆插进录音机孔位"必须是在亚毫米级以内",只有3D建模的数据集做得到。

5. 开山派的家底:仿真器渊源与"波音造飞机"式的系统工程

  • 团队的行业坐标:“具身智能”(Embodied AI)这一提法应该是2019年苏昊与北美多位教授联合提出的带测评标准的研究领域;市面核心仿真器"不管是像Isaac、MuJoCo,甚至说新创的一些公司,都跟我们有千丝万缕的联系",Isaac部分强化学习引擎也有团队成员早期贡献。
  • 韩铮对核心资产的回答值得记:Sim2Real"有点像波音造飞机",很难说发动机、航电还是材料更重要——能搭这个复杂系统工程的团队本身才是积累,核心大组负责人已共事七八年。
  • 历史教训:Andy Rubin加入谷歌并负责Google X项目后,2012-2016年间谷歌收购了波士顿动力等一批机器人公司,那波"要素还不是特别全"。2022年韩铮与苏昊决定创业的触发点是DALL·E的出现——它让他们意识到2D升维到3D有机会,“在仿真器里边重建整个世界的物体和环境……理论上是开始可行了”。

6. 仿真器哲学:牺牲观赏性,换取百万并行与物理一致

  • 新一代机器人仿真器的设计思路与传统有限元仿真不同:不是在大型机器上无限逼近真实,而是在一张GPU上开出成百上千甚至上百万个并行环境——分辨率"非常非常低",但物理一致性尽可能接近,“一定是要在真实和效率之间做大量的取舍设计”。
  • 终极野心的原话:“把人类和整个生物对于环境的理解、交互、物体的操作,几百万年进化的过程,放在仿真器里边来,让机器人再经历完整进化的过程。“仿真器起名Sapien正是映射《人类简史》——从猿到人的进化。

7. 数据:结构化是护城河,质量与规模没有标准答案

  • 结构化vs非结构化的分野:Allen Institute的ObjectVerse挖GitHub所有3D文件攒了上千万条数据,但大量是游戏盔甲武器,“对于机器人做物体操作的话,其实用处不一定很大”。苏度自建结构化数据集,规模"暂时没有办法正式对外透露”。
  • 韩铮的坦诚权衡:“我们也没有标准答案,永远是在质量和规模之间要取得平衡”——单个饮料瓶不需要100%还原材质和标签文字,但结构化覆盖必须达到量级。自评:结构化理解"应该是在所有的团队里面可能做得最好的”,但动力学约束仍是"整个行业里边最欠缺的数据"。

8. 苏度R1:Sim2Real第一次填平开放世界的差距

  • 4月发布的demo(内部去年11-12月已跑通):连续一小时、100多个训练数据里从未出现过的物体、240次抓放,“单次对于这个物体做抓放的成功率是将近98%",失败后闭环控制迅速调整策略"就可以做到100%"。韩铮的定性:“这可能是整个的机器人里边,尝试用Sim2Real路线里边,能够做到Zero-Shot……把Sim2Real差距当中给填平的第一次。”
  • 泓君直问研究社区的质疑——有没有控制变量、训练集里见过?韩铮的回答是斩钉截铁的:“没有,其实完全没有。”

9. 公开随机测试 vs 提前一个月租Airbnb

  • 回应质疑的方式是公开随机测试:6月初ICRA维也纳大会上,可能近1000人用参会证件、手机、耳机、小玩偶随机测试,随后CVPR再来一轮——“以前类似的学术会议上,从来没有人能够做到这样的展示,原因之一就在于它几乎没有给你时间去做准备”。
  • 行业对照组的操作方式,韩铮如实描述:某公司会在学术会议前"在旁边租一个Airbnb,把自己的机器人放在那边收集大量的数据,可能要提前一个月进场”,重复展示做咖啡任务——换个咖啡机或换个环境,成功率"肯定会要往下掉不少"。
  • 短vs长程任务的判断:真正做操作的社区认为开放世界Zero-Shot的短技能成功率更核心——“如果你的短技能足够稳定可靠、泛化性足够高,你其实是可以把短技能拼成各种各样的长程操作的”,这正是ManiSkill框架的思想;2023年团队还有与思维链同期的CoTPC工作专门处理短技能串联。

10. 白盒还是黑盒:预训练分层理解,端侧端到端部署

  • 与PI主推的狭义VLA(模仿人类动作的端到端黑盒)的根本区别:苏度的模型"要对于物理世界物体和环境,以及它未来的变化,要有强理解和强预测",且可解释——拧瓶盖拧不动时,模型知道是该加大力,还是这个国家的瓶盖旋向设计不同。结构上是预训练分层、端侧部署仍是端到端。
  • 模仿学习路线的病灶,韩铮说得很直白:它不需要知道物体在环境里的准确位置和几何信息,“它之所以这么做……都是因为在那个环境之下,曾经有人是遥控这个机器人做了那样的动作,它只是在纯粹机械地去模仿”。
  • 最生动的类比:小朋友第一次拧瓶子会左拧一下右拧一下随机尝试,同时观察父母;有些运动能力"刻在了人遗传的基因里边"——“机器人,我们实际上是要把整个进化的过程,在仿真器里边再去复现一次。”

11. 冷启动死结与"下半年分层回归主流"的暴论

  • 端到端堆数据路线的致命前提缺失:特斯拉十几年前没有FSD就卖出几百万台车,“有几百万的司机在101的公路上面天天开”,后面还有司机天天帮它标数据;机器人做不到——“我们很难想象买了一台机器人,需要穿着一个动捕服才能够去做西红柿炒鸡蛋”。国内公司可能已到百台、甚至千台以上规模,离500万台差太远,所以冷启动数据"需要百万甚至千万级别……Sim2Real是躲不过去的"。
  • 小八卦带出的行业史:PI、Generalist的核心人员出自Google Robotics,“再往前当时大家有一个默契”——底层稳定操作+上层任务理解的分层结构,但2023、2024年创业时"大家就选择了自己擅长和熟悉的套路",不再提分层。韩铮的暴论:“可能从今年的下半年开始,上下分层的这种结构,会重新再回到主流里边来”,且可能是商业化的最终方案(他标注:仅代表个人)。
  • 泓君的追问逼出更尖锐的判断:硅谷公司更擅长上层推理,“靠几十万小时——我觉得可能已经是现在操作的极限——人类真实操作数据,远远没有办法达到开放环境、开放物体稳定可靠的操作能力”;底层操作必须软硬件强结合,但这家公司"是不是只有中国公司能做到,我觉得未必"。

12. 软硬强绑定,以及"高两到三个数量级"的操作难题

  • Sim2Real差距怎么解?硬件和软件必须一起设计:仿真器不万能,硬件选型要用仿真支持好的构型;每台机器每次上电表现都不一样,仿真里要对这些噪音做仿真。开源方法(URDF格式导入)“极度地简化了”,不考虑电机噪声、响应曲线迟滞——所以底层操作模型与本体是强绑定,很难买软件装到别的机器人上。
  • 本期最硬核的量化判断:仿真强化学习在宇树、波士顿动力的locomotion上已充分验证,“但机器人如果是要对于物体去做操作,它这个难度要高两到三个数量级”——姿态控制只需关注机器本身,操作则要求结构化数据、环境理解与预测,这正是World Model里最重要的一支。泓君的呼应:她此前问英伟达科学家"控制灵巧手是不是还没解决",“我今天跟你的这个聊天,好像正在找到这个问题的答案”。

13. 商业模式:不是安卓,是iPhone+iOS

  • 硬件形态像汽车(电池、电机、计算单元),但商业模式像智能手机:卖本体+底层模型+SDK,开发者在上面搭应用——“有人去做Uber,有人去做DoorDash……有人做美团,有人做滴滴”。泓君的修正被采纳:这比安卓"还说小了",因为机器人硬软件是操作整体,无法只卖软件适配他人本体——所以更像iPhone+iOS。
  • 开发者漏斗的具体数字:“我们服务的1000个开发者里边,有100个能够找到小批量部署的应用场景……这100个人里边可能会有5个、10个,会做一个超级应用,可能会需要部署1万台甚至更多。“苏度自己不赌任何单一垂类场景,只做底层短技能基础模型、API和组合工具;上层应用的通用逻辑,内部称为Adapt。

14. 竞赛点评:Skild、PI、Figure、Optimus、宇树

  • Skild以140-150亿美元投后估值融资14亿(7个月前才45亿),但韩铮的爆料:创始人Deepak和Abhinav"以前是坚决不信仿真的,但是在一开始募资的时候,他们是拿机器人仿真作为主要募资的方向”,实际业务"可能偏敏感一些”。PI最新估值据他所知也在120-140亿美金之间、在做新募资;美国第一梯队还有Generalist及华人创业的Sunday、Dyna。
  • Figure的翻红要打折:产线分拣demo"的确是比以前有一些进步",但只有盒子和软包装两类物体、颜色重量几乎一样,且始终在自建测试线里——遥操作VLA"对于光照和环境的变化都极其的敏感";洗碗机demo据泓君听说花了很长时间才拍出一条。
  • Optimus与宇树:2025年前苏度曾与特斯拉自动化团队合作,当时Optimus还满足不了产线条件,应该只在自己团队里做固定位置拿电池的动作;但"Optimus肯定是未来美国机器人行业里边最大的推手"——硬件制造力强,模型按马斯克风格"等行业有较为好的方案出现之后再去补,可能也来得及"。宇树则是"率先给市场交出硬件量产最好答卷的公司"——2025年出货5000多台(对比特斯拉、Figure约150台)且真实发到用户手里,但物体操作才刚刚开始。

15. 最大对手是DeepMind+电动版Atlas;十年后想被记住的是iOS,不是路线正确

  • 反共识的竞对判断:“接下来两到三年,从机器人的操作能力和综合能力上,我们认为的最大竞争对手可能是DeepMind加波士顿动力。“论据链:韩铮认为Demis对物理世界AI的下注"在所有的大厂里边最坚决”;他提到把波士顿动力硬件核心人才挖到DeepMind;泓君补充DeepMind几年前收购MuJoCo团队、持续改进仿真器并有Genie 3世界模型,韩铮称其有"几乎无限的卡”——且现代应该是波士顿动力控股股东(如果韩铮没记错,软银留10%-20%),谷歌可能"重复Android的方法再做一次"。亚马逊是投入最多的公司之一(Kiva、Agility、Covariant),提供场景但"最终要不然收购、要不然自己做"。
  • 为什么中国公司总退回垂直赛道?韩铮的诊断与自我要求:像AI四小龙一样"对于基础模型如何构建没有特别清晰的想法,只是想边做边试的话……都会因为商业上的压力去做妥协";苏度的信心来自12-24个月可验证的判断——"‘说不定’这三个字,在我们团队里边几乎不太会出现"。他也承认垂类现在"账是算不过来的":部署一台机器人替代人工,“实际上你也可能要花三到五个PhD的成本去维护”。
  • 收尾的十年之问,韩铮的选择:“Sim2Real这条路是对的,是副产物”——他希望十年后回看,这是一个类似iPhone加iOS的时间节点,“会有新的Uber、有滴滴、有美团、有新的DoorDash长出来,我们希望大家用的硬件加底层的系统和软件,至少有一部分是我们提供的”。