一张纸劫持机器人:VLM 控制机器人物理提示注入的系统性研究

· Editorial Team estimated
VLM安全 提示注入 机器人操控 对抗攻击 物理世界

该研究证明,放置在机器人视野内的对抗性文字可作为针对 VLM 操控的间接提示注入。在 GPT-4o、Gemini 2.5 Flash 与 Qwen3-VL-32B 上进行的 5,670 次试验中,物理标识攻击分别以 27.0%、29.4% 与 5.0% 的成功率得手,其中权威冒充与否定类攻击可跨三种模型迁移。简单的防御手段——提示加固、两阶段验证与文本掩码——可将风险大幅降低(最高达 100%),但各有取舍。

原文 · arXiv:2608.05715

背景

视觉-语言模型正越来越多地被部署为机器人系统中的规划器,将自然语言指令转化为基于视觉场景理解的可执行动作。感知与指令执行的紧密耦合带来了新的攻击面:出现在机器人相机视野中的文字——指示牌、标签、贴纸——会与用户指令一起被同一套系统处理。若攻击者能将文字放入机器人视野,就可能注入被 VLM 视为合法指令的内容,且无需任何数字层面的入侵。这一物理世界攻击向量在聊天机器人上已有研究,但针对具身、VLM 控制机器人的系统性研究尚属空白。

核心创新

该论文对 VLM 控制机器人面临的物理提示注入进行了首次系统性研究。它提出四类攻击分类学——间接标识、任务重定义、权威冒充与冲突注入——并将其实例化为 20 条攻击提示的基准,在三种物理场景布局与三种指令表述(目的地具体度与规则明确度各异)下评估。论文还评测了三种实用缓解手段:基于提示的防御、两阶段验证与预处理文本掩码,并分析了各自的权衡。

结果

在三个前沿 VLM(GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32B)上进行的 5,670 次试验中,物理标识攻击的成功率分别为 27.0%、29.4% 与 5.0%,其中权威冒充与否定类攻击可跨三种模型迁移。推理轨迹分析表明,成功入侵几乎总是“有意识”的(99.9% 的确认率),且不同模型的防御机制在结构上各不相同:Gemini 表现为显式拒绝,GPT-4o 表现为感知性忽视。简单缓解手段可大幅降低风险——提示防御有效率为 75–100%(依模型而定),两阶段验证为 85–100%,预处理文本掩码为 100%——但防御选择存在权衡,掩码可能损害需要读取场景内标签的任务。

局限

基准聚焦于分拣任务族与三种指令表述,更广的任务多样性将增强结论的普适性。防御评估主要关注攻击阻断率,并在测试场景中保持任务能力,但作者指出防御可能损害标签读取类任务。研究未覆盖多步攻击、针对已知防御进行提示调优的适应性攻击者,以及嵌入非文字视觉内容中的攻击。

产业启示

VLM 操控正在走向真实部署——仓库、厨房与服务环境恰恰都是人类可读标识无处不在的场所。该论文为这一转型提供了务实的安全基线:它证明一张纸就能劫持机器人,同时证明廉价防御在不大幅牺牲任务性能的前提下即可生效。对机器人厂商而言,结果表明默认应为 VLM 规划器配备文本掩码或验证层;对安全团队而言,它为现场部署前的审计提供了一个具体、可复现的评测基准。