智能化发展的初步迹象开始显现。实验中,一台机器人手握爆米花,准备用它放入微波炉,然而实验人员却关闭了微波炉的门。由于没有相关数据支持,机器人依然保持着手中的目标物,重新打开微波炉门并完成了最初的任务。在另一个实验里,微波炉门只留有一个狭窄的缝隙,机器人没有按照训练中的操作流程,而是直接用手中的包装物将门推开。这些实验展示了深度跃迁最新发布的 DELE-w0.5 世界动作模型所具备的“目标条件下的行为重组”能力,即使环境发生了变化,机器人依旧能坚持任务目标并适应新情况。
深度跃迁是一家专注于真实任务持续进化的跨本体具身智能公司,其已经完成了由复星创富投资的天使轮融资。其核心团队在生成式策略、强化学习以及具身智能的研究上积累了丰富的经验,并自主研发了 DELE 系列机器人模型。
当前,世界动作模型通常依赖于视频生成,机器人需要在执行动作前预测动作和未来的视觉轨迹,这种方法虽然提供了丰富的时空信息,但也意味着消耗大量计算资源。相较之下,DELE-w0.5 决定放弃这种路径。在训练过程中,模型共同学习机器人的动作与动作完成后未来世界的表征;推理时,则移除未来世界表征,机器人依据语言和当前视觉信息直接生成动作。在640次真实场景实验中,DELE-w0.5 实现了62.5%的任务成功率和81.3%的阶段进度,均远超最强基线。
机器人控制模型主要有两条路径。一条是视觉-语言-动作(VLA)模型,它根据语言指令、当前多视角观测和自身状态生成动作。按照步骤,它首先接受输入,然后通过视觉语言模型(VLM)规划任务,最后由动作专家将规划转化为可执行的控制信号。这一路径较为直接,模型可学习观察与动作之间的关系,这些动作对环境的影响则隐含在模型参数中。
另一条路径是世界动作模型(WAM),其视频式模型同时预测机器人动作和未来视觉轨迹,这样可以通过未来画面学习物体的运动和空间变化。然而,机器人实质上并不需要每个中间时刻的视觉信息,而是应关注在执行动作后达到的效果。因此,它获取的多帧视觉信息不仅占用大量计算资源,也没有直接帮助机器人实现任务。
以开门为例,机器人需稳定抓住把手、旋转行动并推开门,而对每一帧视觉信息的逐一还原并无必要。这种差异在计算成本上显著体现,多帧视频的潜在表示通常远大于对应的动作序列,增加了模型的负担。近年来,针对这一问题部分研究尝试了小型视频骨干等策略来减轻开销。
DELE-w0.5 提出了一个新视角,专注于机器人控制中的关键:即未来世界表征的预测。比如在开门任务中,确定门是否成功打开且保持稳定是重要的;在向杯中加冰的任务中,目标是冰块顺利进入杯中,相关工具也要回到指定位置,这些都可以通过未来世界表征加以描述。因此,对比三种模型,VLA 关注当前条件下的动作,视频式 WAM 关注动作与完整视觉轨迹,DELE-w0.5 则结合动作与未来世界表征,未来信息变得更为简洁且符合控制目标。
DELE-w0.5 采用双流 Transformer 架构,首先接受语言指令、机器人当前的多视角图像和状态信息,确保机器人能够更有效地进行任务操作。
发表评论