Grant Proposal · 最终方案版 · 离线交互拓扑 + 拓扑感知VLA · 2026年8月

基于离线交互拓扑先验的拓扑感知VLA导航决策与推理

项目申报书专项文稿(最终方案版,仅对应主要研究内容2)。重点阐述研究内容、研究目标、关键科学问题、技术路线与特色创新。

下载 Word 文档 ↓ 查看最终方案完整版 → 专项调研系列 →

1.项目的立项依据

1.1 研究意义

人形机器人在办公楼、医院、园区等复杂建筑环境中执行长程任务,既需要理解语言指令、目标图像及情境化任务所表达的语义目标,又需要依据空间连通关系完成跨区域、跨楼层路径决策。关闭门、电梯等设施构成了具有前置条件、操作过程和状态转移的交互操作性连接。传统度量导航依赖完备的几何地图与精确定位,普通视觉拓扑导航则通常将边简化为直接通行关系,难以统一表征场景语义、路径结构与交互状态。

本研究以第一人称视频离线构建的交互操作性视觉拓扑图为环境先验,研究多模态任务的拓扑知识检索、结构化表达与视觉—语言—动作模型(VLA)决策机制,生成拓扑可达、语义一致且包含必要交互环节的导航轨迹与推理依据;利用连续观测和执行反馈更新任务期工作图,实现偏航识别、路径调整与闭环重推理。该研究将推动导航决策由反应式预测向空间记忆支撑的结构化推演转变,为弱定位条件下的长程自主导航提供理论与方法基础。

1.2 国内外研究现状及发展动态

视觉拓扑导航已形成以关键视觉观测表征位置、以经验可达关系连接节点、通过图搜索完成长程规划的基本范式[1-3],并逐步由目标图像拓展至语言指令和多模态目标驱动的导航任务。拓扑化视觉语言导航通过维护历史、当前及候选节点,增强了全局规划、分支选择与错误回退能力[6-8];多模态大模型导航进一步利用长上下文视觉理解和动作推理能力,实现语言、图像及情境化目标的统一处理[4-5,9]。将视觉证据与拓扑关系共同纳入模型推理,已成为提升长程导航全局一致性的重要趋势。

现有研究仍存在三方面不足:离线拓扑先验与在线大模型推理缺乏紧密耦合;拓扑边难以系统描述门、电梯等连接的类型、前置条件、可用状态、交互代价与执行结果;面对环境变化、临时阻塞和交互失败,缺少任务期地图更新和分级重推理机制。因此,构建“离线拓扑先验初始化—交互关系感知推理—在线工作图更新”的统一方法,是多模态大模型导航走向真实环境闭环决策的重要方向。

1.3 主要参考文献

[1] Savinov N, Dosovitskiy A, Koltun V. Semi-parametric Topological Memory for Navigation. ICLR, 2018.

[2] Eysenbach B, Shah D, Kahn G, et al. ViNG: Learning Open-World Navigation with Visual Goals. ICRA, 2021.

[3] Shah D, Osiński B, Levine S. ViNT: A Foundation Model for Visual Navigation. CoRL, 2023.

[4] Xu Z, Chiang H T L, Fu Z, et al. Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs. CoRL, 2024 / PMLR, 2025.

[5] Liu J, Zhang Z, Li X, et al. TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation. arXiv:2603.02972, 2026.

[6] Chen K, Chen J K, Chuang J, et al. Topological Planning with Transformers for Vision-and-Language Navigation. CVPR, 2021.

[7] Chen S, Guhur P L, Tapaswi M, et al. Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language Navigation. CVPR, 2022.

[8] An D, Wang H, Wang W, et al. ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments. IEEE TPAMI, 2024.

[9] Zhang J, Wang K, Xu R, et al. NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation. RSS, 2024.

2.项目的研究内容、研究目标,以及拟解决的关键科学问题

2.1 主要研究内容

本研究以离线预建的交互操作性视觉拓扑图作为初始环境记忆。节点包含第一人称关键帧与场景语义,普通边描述直接通行关系,交互边描述门、电梯等设施的边类型、前置状态、交互过程、预期结果、经验代价及可靠度。围绕该拓扑空间中的知识检索、结构推理和闭环更新,开展以下三方面研究。

离线交互拓扑先验驱动的VLA导航决策总体框架
图1 离线交互拓扑先验驱动的VLA导航决策总体框架

(1)多模态任务驱动的拓扑知识检索与任务期工作图构建

研究语言指令、目标图像及图文混合任务在视觉拓扑空间中的统一定位方法。针对语言任务提取目标属性、语义地标、空间关系、楼层信息、访问顺序和交互需求,针对目标图像提取场景外观与对象语义;结合当前第一视角RGB图像完成当前位置候选与目标候选的双端检索,并利用视觉相似性、节点语义、拓扑连通性及交互边前置条件进行图一致性重排序。在候选起终点之间生成满足任务约束的可达路径,保留主路径、关键分支、回退节点和高辨识度地标,形成面向当前任务的紧凑工作子图,降低长期拓扑记忆直接输入模型所产生的上下文冗余。

研究任务期工作图的增量更新方法。依据连续视觉更新节点表征与定位置信度;依据航点到达、通路阻塞、交互成功或失败等反馈,更新边的可用状态、通行代价与可靠度;对预建图未覆盖的任务相关分支建立临时候选节点和连接。采用多帧一致性确认与置信度滞回抑制错误更新,使工作图反映有效环境状态。

含普通通行边与交互操作性边的视觉拓扑示意
图2 含普通通行边与交互操作性边的视觉拓扑示意

(2)交互关系增强的路径知识表达与拓扑感知VLA推理

研究保持节点实体对齐的图文交错路径知识表达方法。按照拓扑邻接与候选路径顺序,将节点编号、关键帧、语义地标、访问状态和任务相关说明进行近邻组织,并在节点之间显式插入普通通行边或交互边信息;其中,交互边重点表征动作类型、前置条件、当前状态、预期结果、经验代价和失败替代路径。将当前RGB图像、任务条件、导航进度、候选动作集合与工作子图共同编码为结构化路径知识提示,使视觉证据、语义实体和图结构关系在统一上下文中保持对应。

研究多关系拓扑结构注入机制。将邻接、距离、方向、边类型、可用状态、交互代价及可靠度编码为关系向量,通过注意力残差或图结构适配模块注入VLA,形成面向交互环境的结构归纳偏置。模型据此判断当前位置、任务进度、未满足的语义约束与下一关键场景,区分直接通行、条件性交互通行和当前不可用等连接关系,完成全局路径比较与推演。

交互拓扑感知VLA的输入、结构注入与闭环输出
图3 交互拓扑感知VLA的输入、结构注入与闭环输出

(3)节点—交互边联合决策与反馈驱动的闭环重推理

研究面向拓扑节点与交互边的联合决策方法。将候选节点、可用交互边、回退节点和停止动作统一纳入高层动作空间,生成目标节点序列、下一通行关系、平台无关相对航点、停止条件、决策置信度及证据引用式推理依据。采用图约束解码与规则一致性校验,将非相邻目标节点展开为可验证的边序列,对不存在的连接、前置条件不满足的交互以及与任务地标或访问顺序冲突的结果进行抑制,保证语义解释、拓扑路径与导航动作之间的一致性。

研究执行反馈驱动的分级闭环重推理机制。融合连续视觉、节点匹配置信度、地标顺序、边推进状态以及到达、偏航、阻塞和交互结果,识别局部偏差、边状态变化和高层路径错误。轻微偏差时修正相对航点;当前边失效时更新状态并切换备选路径;当前位置持续不一致或关键路径失效时,重新定位、扩展任务子图并触发全局重推理,实现环境先验、在线观测与导航状态的动态一致。

2.2 研究目标

建立离线交互操作性视觉拓扑先验驱动的拓扑感知VLA导航决策与推理方法,在不以高精度全局定位和稠密地图作为高层决策必要输入的条件下,实现语言、目标图像等多模态任务在预建拓扑图中的统一检索,生成语义正确、拓扑可达且包含必要交互环节的节点轨迹、相对航点和可核验推理依据;利用连续视觉与执行反馈更新任务期工作图,实现偏航判断、路径调整和全局重推理,支撑“重推理导航成功率不低于90%”和“实际执行轨迹与指令语义轨迹匹配度不低于90%”的总体指标。

2.3 拟解决的关键科学问题

(1)异构交互拓扑知识如何转化为VLA可推演的结构先验

语言描述对象、关系、顺序与交互约束,目标图像提供外观特征及隐含场景位置,视觉拓扑图则以离散节点和异构边表达空间。如何将多模态任务统一映射到任务相关节点、地标与路径约束,在保留关键帧视觉证据的同时,把邻接、方向、边类型、前置状态和交互代价转化为能够参与VLA推演的结构归纳偏置,是实现交互拓扑知识有效利用的首要科学问题。

(2)部分可观测和环境动态变化下如何保持拓扑记忆与导航决策的一致性

环境外观、门状态和电梯可用性具有动态变化特征,执行异常亦可能由局部偏差、临时阻塞或高层路径错误引起。如何从连续视觉与执行反馈中辨识变化来源,形成节点、边及任务进度的可信状态估计,并在航点修正、边状态更新、子图切换与全局重推理之间选择适当尺度,是保障长期闭环导航可靠性的关键科学问题。

3.拟采取的研究方案及可行性分析

3.1 研究方法与技术路线

采用“离线先验初始化—任务子图检索—拓扑关系注入—全局动作推理—反馈增量更新”的技术路线。根据当前视觉和任务目标完成起终点检索,构建包含关键节点、普通边、交互边和备选分支的工作图;形成节点关键帧、语义属性与异构边关系相互对齐的路径知识提示,以多关系拓扑注意力或图结构适配模块增强VLA;在图约束动作空间中生成节点轨迹、交互边、相对航点及推理依据,并校验拓扑合法性与交互前置条件;根据连续观测和执行反馈更新工作图,实施航点修正、路径切换和全局重推理。训练采用预训练多模态模型与参数高效适配相结合的方式,利用离线轨迹构造监督样本,并补充状态变化、通路阻塞和失败恢复样本。

3.2 实验手段与评价方法

采用离线轨迹回放、仿真故障注入和真实环境在线测试。任务覆盖语言指令、常识推断、目标图像和图文混合导航,并设置电梯通行、关闭门通行、交互失败改道、临时阻塞及外观变化等场景。设置无拓扑知识、固定拓扑规划、纯文本路径表达及在线增量推理等对照,开展任务子图检索、图文交错表达、多关系拓扑注入、交互边建模和工作图更新的消融实验。评价目标节点召回率、节点及交互边选择正确率、路径拓扑合法率、交互前置条件满足率、语义轨迹匹配度、地图更新准确率、偏航恢复率、推理证据一致性及决策时延。

3.3 可行性分析

现有研究已验证视觉节点、经验可达关系和图搜索用于长程规划的可行性[1-3],并表明显式空间记忆、图结构约束和多图上下文能够支撑语义目标定位与全局动作推理[4-9]。关键帧节点、普通边、交互边和历史轨迹可形成结构化训练与验证样本,预训练多模态模型具备多图理解和参数高效适配基础。任务子图检索、图约束解码和工作图更新可独立训练与评价,并可退化为目标检索与确定性图搜索,具备分阶段实现和安全验证条件。

4.本项目的特色与创新之处

4.1 离线交互拓扑先验与在线拓扑感知推理协同的闭环导航

本研究以包含门、电梯等交互操作性边的离线视觉拓扑图作为VLA全局推理的结构先验,构建多模态任务检索、异构边关系表达、节点—交互边联合决策与工作图更新的统一机制。通过图文交错路径知识表达和多关系拓扑注入,显式推演连接类型、前置状态、交互代价与替代路径;通过图约束生成和证据一致性校验,实现导航轨迹、相对航点与推理依据的相互验证;通过反馈驱动的增量更新与分级重推理,提高离线先验不完备和环境动态变化条件下的导航适应性。