PointZero:把三维点轨迹补全当作预训练目标,学习可迁移的三维动力学
世界模型让感知系统能够预测场景在交互下如何演化,而这类模型最受益于大规模多样化数据。既有方法通常需要机器人动作标注才能学习「以动作为条件」的三维动力学,于是把网络视频排除在训练池之外。本文研究把三维点轨迹补全(3D point track completion)作为预训练目标,从而在没有机器人数据的情况下学习可迁移的三维动力学:给定一次 RGB-D 观测与稀疏的部分三维轨迹,模型需要预测所有已观测点未来的三维轨迹。作者贡献了一个覆盖可变形、铰接与刚性物体的 290 万帧合成数据集,并在其上训练了 Transformer 模型 PointZero。在下游的「以末端执行器位姿为条件的三维动力学预测」与「模仿学习」两项任务上,PointZero 在 PGND 三维动力学基准上优于基线,在 6/7 项仿真与真实机器人操作任务上优于或持平基线;作者还从零训练以分离架构、预训练目标与数据集各自的贡献,并公开数据集、检查点与完整训练配方。
原文 · arXiv:2609.19142世界模型的价值在于让机器人能预判「我这么动,场景会怎么变」。而这类模型要真正好用,必须见过足够多样的数据——多样性决定了先验的厚度。问题出在训练目标上:现有方法学「以动作为条件」的三维动力学时,通常需要机器人动作标注,而带动作标注的数据恰恰是最难获取的。结果就是,规模最大、覆盖最广的那部分数据——网络视频——被挡在了训练池之外。
核心创新
PointZero 的做法是换一个不需要动作标注的预训练目标:三维点轨迹补全。
任务定义很干净:给定一次 RGB-D 观测,以及一组稀疏的部分三维轨迹(tracks),模型要预测所有已观测点未来时刻的三维轨迹。这里没有动作输入,只有「点接下来会怎么动」——但恰恰是这件事,逼迫模型去学习物体如何在三维空间中运动、交互与形变,也就是三维动力学先验。
围绕这个目标,作者做了三件事:
- 数据集:贡献了一个 290 万帧的合成数据集,覆盖可变形、铰接与刚性三类物体。这个覆盖面是刻意的——如果只有刚体,学到的先验在接触丰富的柔性操作上会失效。
- 模型:PointZero,一个灵活且表达能力强的 Transformer,在相同数据上优于此前方法。
- 迁移验证:把预训练好的模型分别后训练(post-training)到两项下游任务——(1) 以动作为条件的三维动力学预测,(2) 模仿学习。
值得一提的是消融设计:作者额外从零训练了 PointZero,用来分离「架构本身的贡献」与「预训练目标加数据集的贡献」。这类控制实验在具身智能论文里并不多见,它回答的是审稿人最关心的问题——收益到底来自哪里。
实验结果
- 同数据下的架构优势:PointZero 在相同训练数据上优于此前方法。
- 三维动力学预测:当微调为以末端执行器位姿为条件时,PointZero 在近期发布的 PGND 三维动力学基准上优于基线。
- 操作任务:当微调为同时预测机器人动作与三维轨迹时,PointZero 在 7 项仿真与真实机器人操作任务中的 6 项优于或持平基线。
- 可复现性:数据集、检查点与完整训练配方全部公开。
局限性
数据集是纯合成的 290 万帧,而预训练目标想要覆盖的正是网络视频这类真实数据——摘要没有报告这一先验从合成迁移到真实无标注视频的效果,合成与真实的域差对动力学先验本身的影响未被量化。摘要只给出了「6/7 项任务优于或持平」这类计数式结论,没有具体的成功率数值,也没有说明那一项未达标的任务是什么、差多少。训练算力与数据生成成本未提及。此外,PGND 是较新的基准,可对比的文献有限。摘要也没有说明模型规模、推理开销,以及预训练权重迁移到新本体时需要的微调数据量。
行业影响
机器人数据的稀缺性是个结构性事实:带动作标注的演示数据昂贵且难以规模化,而视频数据到处都是。PointZero 的意义在于把这两者之间的桥修得更窄了一点——它证明「预测点会怎么动」这样一个不需要任何动作标签的目标,足以学出对下游操作有用的三维动力学先验,而且这个先验可以从廉价的合成数据里获得。对工程团队而言,这条路径的实际含义是:一次预训练,之后用有限的真实数据为每个任务做适配,而不必为每个任务从头积累演示。数据集与训练配方的开源进一步降低了复用门槛。如果这一目标后续能扩展到无标注的真实视频,可用数据池将不再受采集能力限制——这正是当前具身智能最需要看到的那类扩展路径。