家用人形机器人真的要来了?| Nikolaus, Rerun
摘要
West 看到机器人操作能力开始规模化的迹象,过去1年里,叠衣服已经“从不可能变得无聊”。 大约2到3年前,通过远程操控演示,模仿学习开始以更严肃的方式奏效;最近,模仿学习与强化学习结合,带来了明显更稳健的操作能力。Transformer很重要,但同样重要的是ChatGPT之后市场形成的共识:可扩展的学习能力能够吸引更多资本、数据采集、算力和更便宜的硬件。
可投资的现实比演示视频更窄,但比消费市场呈现出来的情况更强。 Biewald追问了流畅视频与不尽如人意的客户系统之间的落差;West的回答是,实用型供应商已经在制造业部署数十到100台机器人,执行基于学习的抓取和放置任务,但部署规模还远未达到大规模水平。短期产品路径可能更偏向灵活务实、专注具体应用的运营商,而不是那些“孤注一掷”的公司。
消费机器人仍是可靠性和产品化问题,而不只是任务完成能力问题。 机器人可以在受控环境下叠好衣服,却可能因为家庭场景存在“巨大的长尾”变化而商业化失败;安装、上手、维修和异常处理同样关键。West预计,市场会先出现渐进式产品,例如最终还能捡起玩具的吸尘器,因为一连串小故障足以让用户弃用机器。
Physical AI需要一套不同的数据架构,因为其数据“多模态、多速率,而且往往是分段发生的”。 图像、运动、关节状态、LiDAR、文本和模型输出以不同速率到达,因此West认为,不能把它们生硬地塞进传统表格。如今,要回答“夜间运行中,左夹爪未能打开且出现B类故障”的问题,往往还需要定制并行代码;理想状态应该更像执行一条SQL查询。
Rerun的商业判断是,可视化必须无处不在,因此不能成为主要收费关卡。 工程师需要在notebook、机器人旁边、训练数据管线内以及运营过程中使用同一个查看器;当偶尔需要访问的支持人员也必须使用时,按席位收费就会失效。因此,Rerun将客户端查看器和日志栈开源,同时通过可扩展的云后端,以及“记录—整理—训练”数据链路实现商业化。
这套策略建立在深层基础设施之上,而不是一层单薄的可视化。 Rerun构建了内存数据库、Rust和Arrow技术栈,以及类似稀疏Parquet的物理数据格式;其数据模型也大约重做了4次。核心API原则是“倾倒后忘记”(dump and forget),同时配合足够灵活的实体—组件模型,让用户无需预先声明所有schema,就能附加任意置信度、点云或神经网络输出。
机器人行业仍缺乏共享评测基础设施,仿真也仍是不完美的替代方案。 West表示,目前“没有真正好的基准测试”:有用的系统往往与硬件共同训练、共同设计,而基于仿真的比较会继承模拟器在接触和操作方面的缺陷。尽管广泛不满,ROS仍然存在,因为它“证明网络效应确实有效”:标准消息和可复用模块的价值,压过了人们对其架构的不满。
泡沫与否取决于通用平台能否把资本转化为硬件、数据和算力规模。 West不会直接否定尚未产生收入公司的高估值,因为同一套硬件执行多种任务,可能降低硬件成本;但这需要海量数据和算力。他对近期的预测是可靠性提升——任务变长、能够自我纠错,并在运行中进行一些学习;更强的高层推理能力可能要等到下一年。
精读
上游暂未提供,后续同步将继续补齐。