先锋 趋势 方法 投研 作者
返回先锋
Danfei Xu
创新者 1 场深度对话收录

Danfei Xu

观点集合

Danfei Xu:人类数据,行为克隆,机器人的GPT-3,斯坦福,全栈机器人,EgoMimic,遥操作,UMI

  • 🗓️ 日期2026-05-01 | 🎙️ 节目:WhynotTV

徐丹飞认为人类数据可能成为机器人最重要的底层燃料,目标是让机器人behavior clone a human,而不只是完成单项操作。一亿小时是规模目标,当前仍差约百倍;UMI提升数据保真度,但控制、传感器标准和human-to-robot transfer仍是关键瓶颈。

查看访谈对话精读提要
  • 人类数据是机器人最可能的底层燃料:徐丹飞的核心判断不是拿 human data 补一点遥操数据,而是把人直接视为另一种机器人,用第一人称视频、hand pose、VIO 等信息,尽可能恢复 embodied agent 的输入、目标与交互方式。 但他也明确指出,单靠人类视频很难学到机器人产生关节动作和力的最底层控制。其终极愿景是“I want to behavior clone a human”——让机器人不仅会操作物体,还能像人一样行动、交流和互动。

  • Behavior cloning 曾被系统性低估。 徐丹飞 2019 年在 DeepMind“亲眼看到 behavior cloning just works”,但当时 RL 是旗舰研究议程,做 BC “not politically correct”;他回到 Stanford 后用三个月从 C++ 控制栈搭到 ResNet-18、spatial softmax 和 RNN,让 Franka 完成约 30 秒的烤箱操作。模型并不 generalize,却给出了关键的“sign of life”:机器人学习的瓶颈往往不是新算法,而是遥操、控制、延迟、相机与数据分布构成的完整系统。

  • 规模目标是一亿小时,现状仍差约百倍。 徐丹飞估计 human-level physical intelligence 可能需要 100 million hours;他听说过最大的一天大概有 10 万—20 万小时的数据,即使把市场上的高质量数据集中起来,也可能只有 100 万—200 万小时。机会与风险同时存在:“有几个 lab 在前面疯狂搭铁轨”,资本已经给高速前进的列车加柴,但数据格式、传感器组合和有效分布尚未收敛。

  • UMI 是当下甜点位,人形上半身是长期受益者。 UMI 让人拿着会装到机器人上的 gripper 直接操作,牺牲五指灵巧性,换取更高 fidelity、可扩展性和更小的末端 gap;长期看,它会与纯 human data 越来越难区分。徐丹飞不确定双腿是否必要,却明确认为至少需要类人上半身,包括双臂和五指;human data 给 humanoid 以用途,类人硬件又降低 human-to-robot transfer,二者是 hardware lottery 与 data lottery 的共同结果。

  • 真正的壁垒更可能在集成闭环,而非某个采集设备。 Project Aria 级别的 VIO/SLAM、快速灵巧手、机械臂 controller、同步和标定都需要工程打磨;数据设备本身则可能 commodity 化,因为 frontier lab 也需要反复教 vendor 什么数据有效。最重要的是“数据—训练—部署—evaluation”闭环,以及团队理解每一段数据如何改变行为的能力。

  • 视频可能吞噬多数模态,但无法自动解决控制。 徐丹飞暂时把 video、hand pose、language 排在前列,whole-body pose 与 tactile 居中,audio 和 smell 靠后;腕部 RGB camera 甚至可能替代一部分触觉与遮挡下的状态估计。不过机器人仍必须自己学会怎样产生关节动作与力;在当前把 human data 当作 teleoperation data 的范式下,精细 state estimation 仍然重要。

  • 机器人的 GPT-3 moment 不是满分,而是泛化的可用性拐点:徐丹飞给出的定义是,在任何场景下,对任何人能做的事情,机器人能以约 40%—50% 成功率完成。 最大反证包括 simulation 的 scalability 与预期不同、human-to-robot 的第二或第三层 gap 无法 zero-shot 或 few-shot transfer,或非类人本体率先百花齐放;建模上则需要 long context 和一种“new language”,因为自然语言 planning 与精细操作之间仍“离得太远”。

  • 🔗 原始收听与视频来源: Danfei Xu:人类数据,行为克隆,机器人的GPT-3,斯坦福,全栈机器人,EgoMimic,遥操作,UMI

收听完整访谈 →