Flex-π:具备计算弹性的多流世界-动作模型

· 编辑团队 estimated
世界-动作模型 VLA 双臂操作 3D点图 高效推理

Flex-π是一个60亿参数的世界-动作模型,在共享潜空间中联合去噪3D几何、物体中心语义、RGB与动作信号;利用冻结的视频VAE几乎无损地编码点图,在灵巧的真实世界双臂操作任务上相较最强基线取得2-7倍提升,且推理速度快于π0.5。

原文 · arXiv:2608.10860

世界-动作模型(WAM)通过预测未来来做出更好的动作,但几乎所有现有模型都只预测RGB潜变量,且仅以像素重建为目标进行训练——这恰恰遗漏了操作任务真正需要的显式信号:3D几何与物体语义。Flex-π表明,这一缺口几乎可以零成本补齐。

核心创新

核心发现是一个”免费的午餐”:同一个冻结的视频生成VAE在编码RGB的同时,几乎无损地编码3D点图,且完全不需要针对点图的专门训练。Flex-π利用这一点,在不增加新传感器、新预训练或推理延迟的前提下,让一个60亿参数的WAM同时以3D几何和物体中心的DINO语义作为监督信号。

在架构上,所有视觉信号都被投影到这一共享潜空间,并在混合Transformer骨干内与动作信号联合去噪。通过逐流随机丢弃与跨模态强制,单一训练完成的检查点可以运行在任意流子集上——从快速的动作专用模式到完整的联合生成,相当于一个可调节的算力/性能旋钮,而非固定的部署形态。

实验结果

  • 在灵巧、精细的真实世界双臂操作任务上(分布内与分布外),较最强基线取得最高2-7倍的提升
  • 同时推理速度快于π0.5
  • 得益于几何与语义接地,策略在演示效率与泛化性上表现突出

局限性

摘要报告了任务级增益,但未列出完整任务集,除双臂操作之外的广度尚无法验证。模型规模为60亿参数,对端侧部署仍然偏大(纯动作模式可在一定程度上缓解)。点图编码的结论依赖于所使用的特定冻结VAE,对其他VAE家族的适用性尚未展示。

行业影响

Flex-π给出了一条构建通用机器人策略的实用路线:复用现成的冻结表征注入3D与语义监督,而无需新建数据管线。具备计算弹性的单一检查点与人形机器人、双臂自动化直接相关——同一模型既可以在设备端以纯动作模式快速运行,也可以在算力允许时生成完整的多模态未来。若点图”免费午餐”能在不同架构间迁移,有望全面降低构建数据高效操作策略的成本。