音频

收听《机器人还远未解决:具身智能的硬核突破与商业化路径》(22 分 24 秒,Opus,约 7.85 MB)

提示:播放器不会自动播放,也不会预加载完整音频。

为什么机器人问题至今仍未解决

过去十年,机器人领域几乎每隔一段时间就会迎来一次“拐点”:AlphaGo 展示了强化学习的潜力,MuJoCo 等模拟器降低了训练成本,ALOHA 一类低成本遥操作系统又让真实世界数据采集变得更容易。但从实验室演示走向持续、可靠、可规模化的产品,机器人依然隔着几堵硬墙。

第一堵墙是仿真与现实之间的物理鸿沟。模拟器擅长刚体与规则环境,却很难完整描述水、拉链、易拉罐、布料等可变形或复杂铰接物体。策略在仿真里表现完美,并不意味着它能处理现实中的摩擦、遮挡、材料差异和随机碰撞。

第二堵墙是感知不足。人类皮肤可以同时感知压力、摩擦、温度和湿度,闭着眼也能在背包里找到充电器;多数机器人却主要依赖摄像头和少量力矩传感器。视觉一旦被手臂或物体遮挡,姿态追踪就可能失效,而机器人又缺少足够细腻的触觉来补偿。

第三堵墙是具身漂移。电机磨损、传动结构积灰、电池输出下降,都会让同一条动作指令在不同时间产生不同结果。过去收集的遥操作数据因此会逐渐“变质”,模型面对的不是静态机器,而是一副持续变化的身体。

第四堵墙是长时任务中的记忆与推理。很多视觉—语言—动作策略只依据当前观察做决定,能完成几秒钟的抓取,却容易在打扫房间、准备食物等几十分钟任务中忘记进度,重复已经做过的步骤,甚至把一次失败无限循环下去。

五条正在出现的硬核突破

1. 多尺度记忆:让机器人知道自己做到哪一步

多尺度具身记忆把短期、密集的视觉信息与长期、压缩的语义记忆结合起来。底层策略保留抓取和接触所需的细节,高层策略则用更紧凑的表示追踪几分钟前发生了什么。这样做的价值不只是“记住历史”,更是获得上下文中的适应能力:没有抓住筷子、冰箱门没有打开时,机器人可以识别失败并改变下一步,而不是机械重放原动作。

目前文本记忆仍是一种折中。物理世界里许多信息很难自然地写成句子,下一阶段更可能转向可学习的潜在向量记忆,让强化学习决定什么值得保留、何时读取,以及如何把记忆直接作用到动作上。

2. 自监督推理:只保留真正帮助动作的思考

具身智能需要推理,但推理并非越长越好。穷举式规划会增加延迟,围绕无关物体展开的“思考”还可能制造幻觉。新的自监督方法同时训练推理生成器和验证器,按照简洁性、泛化能力及其对动作预测的贡献,为候选推理打分。

更关键的方向是“训练时思考、执行时直达动作”:推理文本在训练阶段充当监督信号,部署阶段则通过动作强制等方法省略显式思维链,从而尽量同时保留决策质量与实时性。这比要求机器人在每一个动作前都输出一段语言规划更适合真实控制。

3. 把灵巧操作统一成目标到达

螺丝刀、夹具和厨房工具形态各异,如果每个工具都重新采集遥操作数据并训练独立策略,成本无法规模化。一条更有前景的路线,是把操作统一成“让目标物体到达指定姿态”:先在大规模并行仿真中,用圆柱体、立方体等基础几何形状训练通用策略;部署时,再从人类演示视频中提取目标姿态轨迹作为提示。

这种抽象让同一个策略有机会零样本迁移到未见过的工具,并以高频控制快速纠正偏差。训练时加入随机推力和掉落等扰动,还能让机器人学会意外发生后的重新抓取,而不是把一次失误直接变成任务终止。

4. 世界动作模型:从生成视频转向隐空间控制

世界动作模型通过预测未来状态来学习物理规律,但完整生成未来视频通常依赖昂贵的扩散模型,延迟和显存成本都不适合边缘设备。优化方向包括拆分 Transformer 结构、把流匹配采样从数十步蒸馏到一两步,以及放弃解码完整画面,直接在隐空间保留对世界的表征。

当模型能在约半秒内给出一段动作块时,世界模型才真正从研究演示接近实时控制。这里的关键转变是:机器人并不需要“看见”一段像素级未来电影,它需要的是足以支持下一组动作的紧凑状态预测。

5. 从遥操作收入开始,而不是从通用机器人梦想开始

商业落地最务实的路线,是聚焦数据中心、仓储、建筑或小型制造中的具体问题,优先采用现成硬件,用人工遥操作先把服务交付给客户。遥操作既能验证客户是否愿意付费,也会自然沉淀真实任务数据和失败案例。

随后在办公室复刻客户现场,围绕最常见、最有价值的环节逐步训练自动化策略;模型处理高置信度场景,人类接管长尾例外。自动化比例随着数据与可靠性提升而上升,而不是在第一天就要求机器人完全无人值守。这种“渐进式自动化”比先造昂贵硬件、再寻找使用场景更接近可持续生意。

仍然没有被解决的问题

  • 可变形物体与复杂接触:布料、液体、拉链和精密装配仍远超简单刚体操作,仿真精度与计算成本之间没有免费午餐。
  • 触觉数据与传感器标准:视觉数据可以复用互联网规模的预训练成果,机器人触觉却缺少统一硬件、统一表示和足够大的公开数据集。
  • 硬件老化后的持续适应:领域随机化可以增强鲁棒性,却不能彻底消除真实机器长期磨损带来的分布变化。
  • 长周期可靠性:单次演示成功不等于一万次任务可靠。现实产品会遭遇大量低概率、难复现、彼此叠加的边缘故障。
  • 算力、延迟与安全:更强的模型往往更慢、更贵;机器人一旦进入物理世界,错误也不再只是生成一段坏文本,而可能损坏设备或伤害人员。

我的判断:当前最值得看的方向

第一,记忆将从文本摘要走向可学习的潜在状态。机器人需要的不是更长的聊天记录,而是一套能跨分钟、小时甚至设备生命周期更新的内部状态。谁能让这套状态既保留物理细节、又能低成本读取,谁就更接近真正的长时自主。

第二,纯视觉不会独自解决具身智能,视觉与触觉的融合会重新成为核心。端到端图像策略可以绕开脆弱的姿态追踪,但在遮挡、滑动和精密接触中,触觉仍然不可替代。真正的突破可能来自低成本触觉硬件、跨设备标定和多模态基础模型的共同成熟。

第三,Sim-to-Real 的价值会从“复刻现实”转向“学习可迁移先验”。模拟器不必完美还原每一种工具,只要能大规模训练抓取、恢复、目标到达等通用能力,再由少量现实数据完成校准,就可能产生更高的投入产出比。

第四,商业赢家大概率先是垂直场景的运营公司,再逐步成为机器人公司。它们最初卖的是一个可交付的结果,人类遥操作藏在系统背后;随着数据积累,软件逐步吃掉人工比例。这个过程不够科幻,却能同时解决收入、数据和产品定义三个最难的问题。

总结评价

这场讨论最有价值的地方,是没有把机器人进展简化成“模型再大一点就会解决”。现实世界的难题同时存在于算法、传感器、执行器、数据基础设施和商业运营之中。多尺度记忆、自监督推理、目标到达式强化学习和隐空间世界模型,正在分别削弱这些瓶颈,但它们还没有合并成一个低成本、高可靠、能长期运行的完整系统。

因此,“机器人仍未解决”并不是悲观判断。恰恰相反,它说明机会正在从单点演示转向系统工程:谁能把不完美的模型、会磨损的硬件、昂贵的数据和真实客户流程组织成一个持续学习的闭环,谁才可能把具身智能真正带出实验室。

一句话结论

具身智能的下一次跃迁,不会只来自更大的模型,而会来自记忆、触觉、仿真迁移、实时推理与遥操作商业闭环的协同成熟。