穿透机器人产业链
数据驱动的深度研究
以审计级严谨度,系统拆解人形机器人、工业臂、AMR 等核心赛道。
为投资人、创业者与一线工程师提供可验证的产业情报。
行业研究
Due Diligence Hub
行业深度报告、硬件 BOM 拆解、供应链成本矩阵、竞争格局分析。所有数据标注来源与置信度。
Research Feed
前沿研究动态
最新论文解读 · AI & 机器人领域前沿进展
PASSAGE:用 100 小时场景对齐人体动作,训练能在杂乱环境中穿行的人形机器人
PASSAGE 是一个感知条件化的规划器—跟踪器框架,用于人形机器人在杂乱场景中的穿越。作者用虚拟现实与惯性动捕采集了 1500 个杂乱场景中 100 小时场景对齐的人体动作;条件流匹配规划器依据运动历史、局部目标点与机器人中心多层高程图生成短时域参考,具备感知能力的全身跟踪器再以 50 Hz 带几何反馈执行。实时分块保证块间一致性,规划器在冻结的跟踪器之上做强化学习后训练以提升闭环性能。整套系统不需要技能标注,也不用为每种障碍单独训练策略:同一对规划器—跟踪器即可在下台阶、侧身挤过、低头钻过之间自主选择与组合。把采集数据从 6 小时扩到 100 小时,held-out 场景的平均无接触成功率由 48.1% 提升到 68.9%,加入经校验的场景增强后达到 70.3%;全机载版本集成第一视角三维激光雷达、在线占据栅格建图、6.25 Hz 规划与 50 Hz 控制,在 Jetson AGX Orin 上于 50 个未见真实布局中完成穿越。
DexTacWAM:把接触动力学写进世界模型的视触觉灵巧操作框架
灵巧操作的成败由接触决定,而接触恰恰是相机看不全的部分:指尖压力、起滑瞬间、手指间的载荷转移,视觉几乎无法直接观测。当前的世界动作模型(World-Action Model)把预测式视频生成与动作生成耦合在一起,思路本来对路,但整体仍是「视觉中心」的,于是「预测出来的未来」里根本没有决定任务成败的接触动力学。DexTacWAM 让每个指尖独立编码,再用一个感知手指身份与手部姿态的触觉压缩器做聚合,最后把触觉 latent 注入视频扩散世界模型,使接触演化本身成为被预测的世界状态。在一个 22 自由度的双臂平台上,它在六个强接触任务上每一项都取得最高分,平均 70.6,对最强基线为 38.0;一个消融实验把「触觉世界建模」去掉而保留同样的触觉特征与动作专家,四项任务均值从 74.7 掉到 26.6,说明收益来自「预测接触」而非「用触觉做条件」。适配触觉只需约四小时、每任务约 100 条演示。
LIMBO:把安全证书学进策略本身,让 29 自由度人形机器人贴着可恢复边界运动
安全全身控制要在高维非线性动力学下同时管住碰撞与平衡,而安全证书(控制屏障函数)通常是为某一类行为手工设计的,换任务就得重新设计、重新验证。LIMBO 把证书的合成从「设计」改成「学习」:在一个冻结的底层控制器周围学习状态-动作控制屏障函数,把安全判据写成基于状态的失败规范,从而在完整的残余动作维度上完成合成;合成阶段学到的安全价值函数还会引导风险采样,主动把样本撒向估计的可恢复边界附近。随后它充当教师,在任务学习阶段给出动作级的安全反馈,安全结构因此被内化进任务策略,部署时不再需要在线安全滤波器。作者在 29 自由度人形机器人上演示了躲闪球与低障碍下穿行两个任务,两者都迁移到真机且不带在线滤波;一个额外的发现是,在同一个安全规范下仅改变采样集中度,就能得到从下蹲到一种新的后仰钻越动作的策略谱。
ε4P:把不完美数据「升级再造」为高精度操作能力
高精度操作是视觉语言动作(VLA)策略最容易失手的地方,而它依赖的任务专用高质量数据通常来自遥操作,采集既慢又贵。ε4P 选择从数据侧而非模型侧解题:它把两类通常被直接丢弃的数据「升级再造」——目标任务上的低精度数据,以及任务不匹配的高精度数据——并且不是把它们均匀混进联合训练,而是控制每种数据在流匹配轨迹上的作用区间。低精度的目标任务数据用在高噪声段,保留任务层面的上下文;高精度但任务不匹配的数据用在低噪声段,迁移底层的动作精度。在真实机器人的亚毫米级高精度任务与粗粒度任务上,该方法把策略表现最多提升 31.7 个百分点,并且可以用不完美数据替换等量的任务专用高质量数据,平均仅损失 4.2 个百分点。
MATE:面向人形机器人协作数据采集的多操作者虚拟遥操作平台
人形机器人需要关于协作的具身经验,但真机多机器人数据采集无法规模化:它需要多台机器人、专用场地,还要反复重置。MATE 用共享物理仿真替代硬件,让多位地理位置分散的操作者同时遥操作全身人形机器人,同时保留了人形机器人、物体与环境之间真实物理耦合的交互——而这恰恰是协作数据价值的来源。借助 MATE,作者构建了包含 24.1 小时、2500 个联合回合、五类长时序任务的多机协作数据集,覆盖物体交接、接力配送、环境交互与协同搬运;并提出 EAIS(执行对齐的交互采样)策略,优先采样推进任务进度与交互关键的行为。基于该数据训练的模仿学习与视觉语言动作策略学习效果良好,并能零样本迁移到实体人形机器人,无需真机微调。
Skytopia:用动作条件隐世界模型实现单目无人机导航
机器人导航中的世界模型通常被设计成「要被执行」的:部署时先产生预测,再在每一个控制步把预测反馈给动作生成。Skytopia 认为这个契约本身是错的——策略真正需要的不是预测结果,而是产生该预测所必需的表示;因为在飞行中,已执行的动作几乎解释了相邻观测之间的全部变化,预测退化为「在已知位移下重投影一个静态场景」。于是策略建立在一个动作条件的隐世界模型之上,并用专门搭建的三维高斯泼溅平台训练:前向目标从意图运动预测下一观测的表示,逆向目标则从预测出的状态转移中恢复该运动。由于预测从不进入动作生成,预测器在部署时被直接丢弃,一个策略同时覆盖点目标、图像目标与无目标导航,成功率分别为 57.8%、66.0% 与 49.0%,同时把推理开销降低 59.4%。同一策略无需微调即可在实体无人机上飞行,覆盖室内、开阔室外与林地环境。
研究方法论
供应商直接访谈、工程师匿名问卷、产线实地调研。拒绝二手信息堆砌。
供应商报价 × 公开招标数据 × 上市公司财报。每个数据点标注置信度等级。
一线工程师持续纠错与补充。数据不是静态快照,而是动态演进的产业知识图谱。