8 GB 预算内的双臂操作:零拷贝感知与量化 ACT 登上入门级 Jetson

· Editorial Team estimated
边缘机器人 动作分块Transformer TensorRT量化 双臂操作 嵌入式AI

本文在入门级 Jetson Orin Nano Super(8 GB)上完整运行了一套双臂 SO-101 抓取-放置系统——感知、策略与控制全部在边缘完成,桌面 GPU 仅用于离线训练。基于 GStreamer/NVMM 的零拷贝流水线将最坏延迟从 117.31 ms 降至 101.52 ms,单核 CPU 峰值占用从 98.0% 降至 77.0%;TensorRT 转换使 ACT 推理延迟由 114.02 ms 降至 FP16 的 17.93 ms(6.4 倍)与 INT8 的 12.65 ms(9.0 倍),任务成功率保持不变(19/20、18/20、19/20)。论文还报告了两项 ACT 此前未被记录的发现:INT8 校准只量化 ResNet18 主干、对 145 个 transformer 层全部拒收;以及量化的必要性取决于动作分块配置。

原文 · arXiv:2608.03938

背景

用模仿学习训练的双臂操作策略几乎总是在工作站或数据中心级 GPU 上评测,一个实际问题因此悬而未决:把它们部署到嵌入式硬件上到底要付出多少代价?对必须在工厂、诊所或家庭中交付的产品而言,答案直接决定学习式操作在入门级硬件上是否具备商业可行性。本文精确测量了这一成本:整套双臂 SO-101 系统完全运行在 NVIDIA Jetson Orin Nano Super(8 GB)上——这是 NVIDIA 嵌入式产品线的入门档——RTX 3070 仅用于离线训练。

核心创新

这是一项全栈部署研究,包含三个部分。其一,基于 GStreamer 并由 NVMM 缓冲区支撑的采集流水线,消除了三相机链路中冗余的主机-设备数据拷贝。其二,ACT 与 Diffusion Policy 在完全相同的示教数据上、按各自参考预算(ACT 10 万步梯度、Diffusion Policy 20 万步)训练,比较两者在嵌入式约束下的收敛表现。其三,将 ACT 转换为 TensorRT 的 FP16 与 INT8 精度。论文还记录了两项此前未见于 ACT 的发现:TensorRT 通用 INT8 校准会量化 ResNet18 主干,但对 145 个 transformer 层全部拒收——这解释了为何 INT8 相比 FP16 模型体积仅缩小 0.9%,延迟却进一步降低 28%;以及量化的必要性取决于 ACT 的动作分块配置——在 n_action_steps = 100 时可以全精度运行,而时间集成(temporal ensembling)所需的逐帧重新预测配置则必须量化。

实验结果

传统采集路径完全适配内存预算且零丢帧;零拷贝感知的收益体现在 CPU 余量(单核峰值占用从 98.0% 降至 77.0%)与最坏延迟(117.31 ms 降至 101.52 ms)。训练方面,ACT 收敛到可完成任务策略(19/20),而 Diffusion Policy 即使在双倍步数下也未收敛到可用策略(0/10)——作者将其归因于收敛成本的差异而非精度上限。TensorRT 转换使 ACT 平均推理延迟从 114.02 ms 降至 FP16 的 17.93 ms(6.4 倍)与 INT8 的 12.65 ms(9.0 倍),三种精度下任务成功率均保持不变(19/20、18/20、19/20)。

局限性

评测局限于单一任务与单一机型:在一台 SO-101 系统上完成变形豆袋的抓取-放置。Diffusion Policy 在参考预算下未能收敛虽具有参考价值,但并非普适结论——收敛还取决于示教质量与超参数。量化结论针对 ACT 的架构与 TensorRT 的校准流程,其他 VLA 架构或校准策略的表现可能不同。

行业影响

本文实际上重画了学习式操作部署的成本下限:此前默认需要桌面 GPU 的策略栈,如今可以在百美元级的嵌入式模组上端到端运行且保持任务成功率。INT8 校准的发现不只对 ACT 有意义——量化基于 transformer 的策略时,团队应逐层核实覆盖情况,而不能只信模型体积的汇总数字。动作分块的结果则给部署者一条具体经验法则:大分块窗口可以全精度运行,真正需要量化的是时间集成类配置。对机器人创业公司与系统集成商而言,这是可直接落地的工程知识。