Research Report · 2026-07-30

拟采取的研究方案及可行性分析

提出“任务解析与双端检索—路径子图知识化—图感知 VLA 联合推理—反馈驱动分级重规划”的总体方案,并从理论基础、数据基础、模型与系统条件方面分析可行性。

项目申报技术方案 · 研究内容2 · 8 篇核心参考文献
Executive synthesis

核心结论

  1. 采用分层而非纯端到端方案:VLA负责语义密集的低频高层决策,图搜索保证拓扑可达,内容3负责高频安全运动。
  2. 路径知识 Prompt 同时包含节点视觉证据和显式边结构,并通过检索压缩控制上下文规模。
  3. 模型采用节点轨迹、相对航点、进度状态与推理依据的多头受约束联合生成,避免自由文本直接控制机器人。
  4. 闭环按局部修正、路径分支切换、子图重检索三级处理偏航,以置信度与事件触发控制大模型调用频率。
01
Overall Scheme

总体研究方案

总体采用“检索增强的图感知 VLA”架构。内容1提供视觉拓扑记忆 G=(V,E):节点包含关键帧、多尺度视觉特征、语义地标和历史访问统计,边包含可通行关系、相对方向、经验距离与可靠度。内容2接收任务 q、当前 RGB 观测 o_t 和执行反馈 f_t,输出高层节点路径 P_t、相对中间航点 W_t、推理依据 R_t 与置信度 C_t。

系统分为四级:首先把语言或目标图像归一化为任务条件;其次从视觉拓扑记忆检索当前位置候选和目标候选并扩展路径子图;再次将子图转换为图文交错路径知识 Prompt,送入图感知 VLA 生成路径、航点和依据;最后根据后续视觉与执行反馈更新任务进度和节点信念,触发局部修正或重规划。

该分层结构明确使用拓扑而非度量全局定位进行高层决策。允许内容3在局部范围使用深度、可通行性和本体状态完成避障与运动控制,但内容2不读取全局 SLAM 位姿,不把度量地图作为任务成功的必要条件。

02
Task-Conditioned Retrieval

任务条件解析与双端路径子图检索

语言任务采用槽位化解析,将指令表示为目标实体、视觉属性、空间关系、顺序地标、方向动作、停止条件和负约束。例如“穿过玻璃门,经过前台后在红色沙发旁停下”被分解为门—前台—红色沙发的有序语义约束。目标图像任务通过视觉编码器提取全局场景、局部对象和视角不变特征,并生成可选语义描述,使其与语言任务进入统一查询空间。

当前位置端使用当前 RGB 与节点关键帧进行粗到细检索:先以跨场景视觉表征召回 Top-k 节点,再结合相邻节点时序一致性、历史路径和局部匹配验证形成起点信念分布,而非强制选择单一节点。目标端分别使用语言—节点相似度、图像—关键帧相似度和地标关系匹配召回候选目标。

在起终点候选之间执行受任务约束的 k 条路径搜索,代价同时考虑经验距离、边可靠性、语义地标覆盖、历史重复和目标置信度;对候选路径的节点邻域进行有限跳数扩展,加入可用于偏航恢复的备选分支。最终子图保持主路径、关键岔路和回退节点,同时剔除与任务无关的大量历史,降低 VLA 上下文负担。

训练上使用内容1记录的真实轨迹自动构造正路径、近邻混淆路径、缺失关键地标路径和错误顺序路径,训练双编码器检索与跨编码器重排序;通过困难负样本提升重复走廊、相似门区和跨时间外观变化下的区分能力。

03
Path Knowledge Prompt

拓扑保持的结构化路径知识 Prompt

每个节点被编码为路径知识单元:唯一节点标识、关键帧或局部裁剪、语义地标列表、相对主方向、访问状态、与任务片段的匹配分数;每条边编码源/目标标识、可通行类型、相对转向、经验行程和可靠度。路径级信息包含主路径顺序、备选分支、已完成节点、当前候选位置和未满足约束。

Prompt 采用图文交错形式:先给出任务规范和输出模式,再按路径顺序插入节点图像及其结构化属性,在节点之间显式插入边 token;对岔路节点额外列出候选邻居及差异地标。相较将全部信息写成自然语言,该设计保留视觉细节;相较只输入关键帧序列,显式保留邻接和方向。

模型内部探索两种增强。轻量方案在不改动主干的情况下增加节点/边专用 token、路径位置编码和 LoRA 适配;深入方案参考图 Transformer 与 TagaVLM,将邻接掩码或边偏置注入选定层的注意力,使视觉节点只沿真实拓扑和任务相关跨边聚合。两者通过消融比较,确定性能与部署代价的平衡。

上下文预算采用分层压缩:高相关主路径保留原始关键帧,远端或低相关分支仅保留缩略视觉 token 与语义摘要;任务进行后滚动移除已确认且不再用于回退的节点。

04
Graph-Aware VLA

VLA 导航推理与轨迹—航点—依据联合生成

VLA 输入由当前 RGB、任务条件、路径知识 Prompt 和进度状态组成。视觉编码器对当前观察和节点关键帧使用共享或对齐表征;语言主干负责跨模态 grounding 与任务推理;图结构适配器注入节点顺序和边关系;输出端采用结构化解码而非自由文本直接控制。

节点轨迹头在检索子图上进行指针式选择,节点只能从当前可达候选或允许回退集合中产生,从解码层面保证拓扑合法。航点头以当前观测坐标系输出短时相对航向、距离区间或归一化二维 waypoint 序列,作为内容3的高层参考,不生成足步和关节命令。进度头判断当前指令片段、预期下一地标和停止条件。Reasoning 头引用具体节点、边、图像区域或指令片段说明决策,并输出不确定性。

损失函数由任务目标 grounding、路径节点交叉熵、路径排序、航点回归/扩散、到达与停止判断、拓扑一致性和依据—动作一致性组成。训练数据包括历史真实路径的专家决策、图搜索生成的候选路径、偏航恢复轨迹和人为/自动构造的反事实子图。可先冻结大部分视觉语言主干训练图适配器和输出头,再进行参数高效联合微调。

Reasoning 采用过程监督与证据约束。训练标注不追求冗长思维链,而要求模型给出可验证的决策摘要,如“当前与节点 N12 的门区匹配;指令要求经过前台;N12→N18 为包含前台地标的可通行边,因此选择 N18”。执行时依据可被规则检查器验证:引用节点是否存在、边是否相连、地标是否可观测、动作是否与方向一致。

05
Closed-Loop Reasoning

连续反馈下的进度跟踪、偏航判断与分级重规划

系统维护节点级信念 B_t,包括当前节点概率、当前边推进状态、已满足指令片段、最近可信节点、计划路径置信度和环境变化标记。每次接收新 RGB 与内容3反馈后,比较当前观察与预期节点关键帧的视觉一致性、地标出现顺序、相对方向和航点执行结果。

偏航诊断分为四类:局部几何偏差指机器人仍位于计划边附近但航向或位置偏离;拓扑转移失败指未到达预期节点或误入相邻分支;边失效指历史可通行边因临时障碍不可执行;语义计划错误指路径虽可达但未满足指令地标、属性或顺序。

对应采用三级恢复。一级保持主路径,仅更新下一相对航点;二级在当前子图内切换备选边或回退最近可信节点;三级重新估计当前位置和目标候选,重检索子图并调用 VLA 重推理。采用滞回阈值和最小计划保持时间避免瞬时遮挡造成频繁重规划。

为控制在线开销,局部视觉匹配和到达检测持续运行,VLA仅在关键节点、低置信度或错误事件时触发。大模型推理与内容3局部控制异步执行;超时或输出非法时沿最近验证路径安全等待/回退。

06
Feasibility

可行性分析

理论与方法可行。SPTM、ViNG 和 Topological Planning 已验证无度量视觉拓扑图能够完成检索、图规划和逐节点执行;DUET 和 TagaVLM 证明显式图结构有利于全局动作推理;Mobility VLA 证明多模态任务、长上下文 VLM 和拓扑导航可以在真实环境组合。因此,本方案是在已有成熟模块上研究新的路径知识接口和闭环机制,而非从零验证基本假设。

数据可行。内容1形成的多次行走轨迹天然包含节点顺序、可通行边、关键帧与执行结果,可自动生成路径监督、正负子图和偏航样本;语言指令可由人工模板、真实用户描述和大模型改写扩充,目标图像可从轨迹不同视角抽取。仿真数据用于覆盖组合任务和故障类型,真实数据用于外观差异与执行闭环。

模型可行。主流开源 VLM/VLA 支持多图、视频和参数高效微调,图结构适配器和指针式解码头参数量相对有限;检索先压缩路径子图,避免将完整地图放入上下文。系统可采用本地中小模型运行高频节点判断,较大模型仅处理事件触发的重推理。

系统集成可行。内容2输出平台无关节点路径和相对航点,内容3负责局部可行性、足步与全身运动;内容3返回航点完成、阻塞和本体状态摘要,形成清晰双向接口。即使 VLA暂时不可用,系统仍可退化为图最短路和视觉目标导航基线,保障分阶段开发与可测试性。

风险可控。针对检索混淆,采用多候选信念与时序验证;针对 VLA 幻觉,采用受约束解码和图规则检查;针对推理延迟,采用事件触发和异步缓存;针对环境变化,保留备选分支并向内容1发送边失效反馈;针对 sim-to-real,优先冻结语义主干并用真实路径轻量适配。

附表
Comparative Matrix

技术模块、输入输出与关键实现

模块输入关键方法输出主要风险与对策
任务解析语言或目标图像槽位解析、多尺度视觉语义编码统一任务条件歧义目标→保留候选与澄清式探索
双端检索当前 RGB、任务条件、拓扑记忆双编码粗召回+跨编码重排+k路径搜索起终点信念与相关子图重复场景→时序/邻接一致性验证
路径知识 Prompt子图节点、边、历史与进度图文交错、节点边 token、分层压缩VLA上下文上下文过长→任务相关剪枝与滚动记忆
图感知 VLA当前 RGB+Prompt图注意力适配、指针路径、航点与依据多头轨迹、航点、Reasoning、置信度幻觉→拓扑约束解码与证据规则检查
闭环更新连续 RGB+执行反馈节点信念、事件检测、分级重规划更新路径或恢复动作计划抖动→滞回阈值与最小保持时间
Actionable Research Agenda

建议研究路线

阶段一

可运行基线

完成任务解析、双端检索、图搜索和规则化 Prompt,接入现成 VLM 做节点选择。

离线回放闭环和基准结果
阶段二

模型创新

训练图结构适配器和结构化多头,完成路径、航点和依据联合学习。

图感知 VLA 原型
阶段三

系统闭环

接入内容3执行反馈,完成事件触发重推理与真实场景验证。

人形机器人高层导航决策模块
Primary Sources

核心参考文献

  1. [1]Semi-parametric Topological Memory for NavigationICLR 2018
  2. [2]ViNG: Learning Open-World Navigation with Visual GoalsICRA 2021
  3. [3]Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationCVPR 2022
  4. [4]ViNT: A Foundation Model for Visual NavigationCoRL 2023
  5. [5]NoMaD: Goal Masked Diffusion Policies for Navigation and ExplorationICRA 2024
  6. [6]Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological GraphsCoRL 2024
  7. [7]TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language NavigationarXiv 2026
  8. [8]SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object NavigationRA-L 2026

报告依据论文正文、附录和作者公开项目材料整理;数字应结合各论文任务定义、数据划分和成功判据理解,不宜跨基准直接排名。