📄 2026-08-16 arXiv 论文速递
共收录 2 篇与追踪领域相关的新论文。
1. NestDex:用于灵巧操作的嵌套策略学习与副驾驶辅助远程操作
NestDex: Nested Policy Learning with Copilot Assisted Teleoperation for Dexterous Manipulation
- arXiv: 2608.13362v1 · PDF
- 重要度: 🟨 建议精读
- 作者: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi
- 标签:
roboticsdexterous manipulationpolicy learning - 中文摘要: 灵巧操作承诺了机器人与物理世界更丰富的交互,但学习这些行为仍然受到收集一致、完整的任务演示的困难的限制。与平行爪操纵不同,灵巧任务需要操作员协调手臂运动与精确、接触丰富的指头行为贯穿整个任务。我们介绍了NestDex,这是一个嵌套策略学习框架,通过使用学习的技能来协助演示收集,从而减轻了这一负担。操作员控制手臂并通过单个自由度离合器调节主动手技能,而不是直接指定完整的指头轨迹。内部手策略根据最新的本体感受历史调整其运动,而视觉语言选择器为每个任务阶段激活适当的技能。由此产生的演示训练了一个单独的外部视觉运动策略,该策略在部署时控制手臂和手,而不使用内部策略。手动作变分自编码器提供了紧凑的手动作目标,同时在关节空间保留手臂命令。在现实世界的灵巧操作实验中,NestDex提高了演示的可靠性和效率,结果的实证评估支持有效的自主策略学习。
- 核心创新点:
- 提出了一种嵌套策略学习框架NestDex,用于灵巧操作
- 引入了学习的手部技能来协助演示收集
- 使用视觉语言选择器激活每个任务阶段的适当技能
- 总结: 本文针对灵巧操作学习中演示数据收集困难的问题,提出了一种嵌套策略学习框架NestDex。通过学习的手部技能协助演示收集,并使用视觉语言选择器激活每个任务阶段的适当技能。实验结果表明,NestDex提高了演示的可靠性和效率,支持有效的自主策略学习。该方法在灵巧操作领域具有重要意义,但仍需进一步验证其在复杂任务中的表现。
2. DreamX-Phi 1.0:用于机器人操作的动作条件视频世界模型
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
- arXiv: 2608.13489v1 · PDF
- 重要度: 🟨 建议精读
- 作者: DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li, Qingfeng Shi, Datao Tang, Jing Tang, Jun Wang, Pengfei Zhang
- 标签:
roboticsworld_modelvideo_prediction - 中文摘要: 我们提出了DreamX-Phi 1.0,这是一个用于机器人操作的动作条件视频世界模型,给定一个观察到的帧、语言指令和规定的包含末端执行器姿势和抓手状态的动作序列,预测由此产生的未来观察结果。然而,仅仅是现实感并不能保证忠实度:令人信服的展开仍然可能移动错误的臂或丢失被操纵的物体。为了确保预测尊重每个臂的命令路径,我们通过PRoPE-style几何编码将每个臂的SE(3)变换注入注意力中,保留臂的身份和刚体运动结构。仅凭动作控制无法完全约束场景几何或小型被操纵物体的演变。因此,我们添加了一个轻量级的深度分支用于场景级几何,并使用SAM3掩码和冻结的V-JEPA教师来在抓取过程中保持物体的一致性。我们进一步通过分布匹配蒸馏将多步生成器蒸馏成几步学生模型,以便高效部署。在撰写本文时,DreamX-Phi 1.0在WorldArena 2.0挑战赛的Track 1上获得第一名,在Track 2上获得第二名。我们的模型和代码将公开可用。
- 核心创新点:
- 提出了DreamX-Phi 1.0,第一个结合动作条件预测和几何编码的世界模型
- 引入PRoPE-style几何编码以确保预测的准确性和物体一致性
- 使用分布匹配蒸馏实现高效部署
- 总结: 本文提出了一个用于机器人操作的动作条件视频世界模型DreamX-Phi 1.0,通过结合观察到的帧、语言指令和动作序列来预测未来观察结果。该模型通过PRoPE-style几何编码确保预测的准确性和物体一致性,并在WorldArena 2.0挑战赛中取得了优异成绩。DreamX-Phi 1.0的提出为机器人操作任务提供了一种新的解决方案。