Research Report · 2026-07-30

视觉拓扑知识与 VLA 导航决策:领域研究现状

围绕研究内容2,分析视觉拓扑路径知识如何从“可规划地图”演进为 VLA 可消费、可推理、可纠错的外部记忆,并据此界定拟开展研究的必要性。

项目申报专项调研 · 研究内容2 · 11 篇核心参考文献
Executive synthesis

核心结论

  1. 视觉拓扑图以关键帧和可通行边表达环境,不依赖连续度量坐标,天然适合本项目“不依赖高精度定位与建图”的前提。
  2. 现有拓扑 VLN 已证明全局图规划、局部视觉 grounding 和回退机制有效,但多数工作使用仿真预定义视点或专用策略,尚未充分利用通用 VLA 的语义与推理能力。
  3. 现有大模型导航方法分别解决了文本推理、视频历史建模、目标帧检索或拓扑结构注入,仍缺少面向语言与目标图像统一任务的结构化路径知识 Prompt 和闭环推理接口。
  4. 研究内容2应聚焦“检索—编码—推演—执行反馈更新”的知识闭环,输出平台无关的参考轨迹、中间航点、置信度和推理依据,与内容1和内容3形成清晰接口。
01
Visual Topological Memory

视觉拓扑记忆:从图检索到长程路径规划

视觉拓扑记忆以关键位置的第一视角图像作为节点,以历史真实行走或学习得到的可达关系作为边,不要求维持全局一致的厘米级坐标。SPTM 建立了“当前观测和目标图像检索节点—图上最短路—选择可达最远航点”的基本范式;ViNG 进一步用离线真实轨迹学习时间距离和局部 waypoint,通过图剪枝与负样本挖掘支持开放世界视觉目标导航。GNM、ViNT 和 NoMaD 则利用多机器人数据与统一动作表征提高跨环境、跨平台的局部导航能力。

该路线的优势在于将长程规划与局部视觉控制解耦:图负责保存历史可通行事实和远距离连通性,局部策略只处理当前观测到下一关键帧的短程运动。它与本项目总体目标高度一致,因为图结构保留的是“走过哪里、哪里相连、沿途看到什么”,而非依赖高精度位姿和稠密地图。

局限也很明确。传统视觉目标导航通常仅给目标图像,缺少语言语义;节点检索主要依据外观相似度,容易在走廊、门区和重复纹理中产生感知混淆;最短路径只利用边权,无法解释“为什么这条路符合指令语义”。因此研究内容2需要在已有拓扑记忆之上加入任务条件检索、路径语义表达和大模型推理。

02
Graph-Structured VLN

图结构视觉语言导航:全局规划与局部理解逐步融合

Topological Planning with Transformers 将语言指令和预探索拓扑图输入跨模态 Transformer,先预测全局节点路径,再由鲁棒控制器逐段执行,展示了可解释路径、主动回退和连续环境中的错误修正。Structured Scene Memory 将过去观察组织为可读写的视觉—几何结构,使决策不再只依赖循环隐状态。DUET 在线建立拓扑图,以粗尺度图 Transformer 进行长程规划,以细尺度局部视觉完成语言 grounding,形成“Think Global, Act Local”的经典结构。

这些工作说明,拓扑结构不是简单的历史缓存,而是扩展动作空间与推理视野的载体:智能体可以选择已访问节点、前沿节点或回退节点,而不仅是当前视野中的一步动作。但传统方法往往针对 R2R、REVERIE 等固定任务训练,节点和边来自仿真导航图或带位姿的在线构图,对自由形式语言、目标图像和真实机器人外观变化的适配不足。

2026 年 TagaVLM 进一步指出,单纯将图转写为文本会迫使 VLM 隐式恢复视觉拓扑关系。其 STAR-Att 将边结构注入自注意力,并通过交错导航 Prompt 对齐节点视觉和文本,在 R2R unseen 上取得 51.09% SR、47.18 SPL。这为本项目提供重要证据:路径知识既需要可读的结构化 Prompt,也需要不丢失邻接约束的图感知编码。

03
VLA Navigation

多模态大模型导航:从观察描述到轨迹与航点输出

NavGPT 将全景观察翻译为文本后交给 GPT-4,展示了子目标分解、地标识别、进度跟踪和异常重规划,但视觉转文本造成的信息损失且推理成本高。NaVid 使用视频 VLM 直接编码连续 RGB 历史并输出离散导航动作,显著提升真实环境的指令泛化;其消融同时表明,直接回归连续位置和方向对 VLM 很困难,合理的动作或航点接口至关重要。

Mobility VLA 与本项目最接近。它用长上下文 VLM 从示范 tour 和多模态指令中找到目标关键帧,再以离线拓扑图和目标条件导航策略执行,在 836 平方米真实环境中处理“把手中物品归还到哪里”等任务。其贡献证明目标图像、语言和历史视频可以统一进入高层导航决策,但系统主要完成目标帧检索,尚未将多节点子图转化为可解释路径知识,也没有让 VLA显式输出路径推演和偏航依据。

NaviLLM、VLMnav、ReasonNavi 等工作分别探索导航通用模型、将动作选择转化为视觉问答、以及让 MLLM 在离散全局候选上先推理后执行。共同趋势是规避大模型不擅长连续度量控制的弱点,将其约束在语义目标、离散节点或相对航点上。本项目拟输出“节点序列+相对航点+Reasoning”,符合这一证据基础。

04
Memory & Closed Loop

记忆增强与闭环推理:从一次性计划走向持续决策

长程导航中的部分可观测性要求智能体区分当前位置、已访问路径、未探索分支和任务进度。MC-GPT 使用记忆地图和推理链增强 VLN,Mem4Nav 将短时视觉认知与长时空间记忆分层,TARIC 在室外长距离导航中维护带不确定性的世界坐标语义线索,均表明只堆叠历史帧并不能稳定解决长期记忆。

闭环决策至少包含三类判断:当前观测是否仍与计划中的预期节点相符;机器人是否沿正确边到达下一航点;如果不符,应继续局部搜索、回退到最近可信节点,还是从当前节点重新检索子图。现有 VLA 常直接输出下一动作,缺少可核验的计划状态和偏航原因,导致错误难以定位。

最新图感知和真实系统工作显示,结构化状态比自由文本历史更利于纠错。对本项目而言,应将计划节点、已通过地标、未满足语义约束、候选分支和置信度显式写入路径知识 Prompt,使每轮 VLA 推理都能基于执行反馈更新,而不是重新从原始长视频中隐式恢复状态。

05
Research Gap

现有研究不足与本项目切入点

综合来看,视觉拓扑导航解决了无度量地图的长程连通性,图结构 VLN 解决了全局规划与局部 grounding,大模型导航提升了开放语义和多模态任务理解,但三者尚未形成面向真实人形机器人的统一闭环。

本项目的研究空位具体表现为:缺少任务条件的拓扑子图检索机制;缺少同时保留图结构、节点视觉和路径语义的 Prompt 表达;缺少将语言目标与目标图像统一映射为节点序列和相对航点的 VLA 输出空间;缺少基于视觉执行反馈的计划一致性检查、偏航分类和有依据重规划;缺少“导航成功”和“指令语义轨迹匹配”同时约束的评价体系。

因此,研究内容2不是重复构建地图,也不是研究足步控制,而是把内容1形成的视觉拓扑记忆转化为可被 VLA 检索、理解和推演的路径知识,并将VLA结果封装为内容3可以进行可行性检查和运动转换的高层决策接口。

附表
Comparative Matrix

相关技术路线对比

路线/代表工作记忆形式任务输入决策输出主要贡献对本项目的启示
SPTM / ViNG关键帧拓扑图目标图像图路径、局部航点无度量图上的检索与长程规划沿用图规划接口,补充语义与推理
Topological Planning预探索拓扑图语言指令全局节点路径规划—控制解耦、可回退路径应显式输出并逐节点消费
DUET在线双尺度拓扑图语言+局部视觉全局/局部节点动作全局规划与细粒度 grounding 融合子图应同时含全局连接与局部关键帧
NavGPT文本历史语言+文本化观察离散视点+推理链显式进度与异常推理Reasoning 必须与可核验状态绑定
NaVid视频 token 历史语言+连续 RGB离散导航动作端到端视频 VLM 与 sim-to-real避免直接无约束回归连续坐标
Mobility VLA示范视频+拓扑图语言/图像+当前视觉目标帧+低层动作真实多模态任务、分层 VLA从单目标帧扩展为路径子图知识
TagaVLM嵌入式拓扑结构语言+节点视觉+边全局节点动作显式边注入与路径纠正Prompt 与图注意力协同保留拓扑
本项目拟研究视觉拓扑路径知识语言/目标图像+当前 RGB+反馈轨迹+相对航点+Reasoning统一任务、结构化知识、闭环纠偏形成内容1到内容3之间的智能决策层
Actionable Research Agenda

建议研究路线

基础阶段

拓扑路径知识基线

以内容1输出的节点和边为输入,建立目标图像检索、语言地标检索和图最短路基线。

可复现检索与路径规划基线
核心阶段

图感知 VLA 推理

比较文本化 Prompt、交错图文 Prompt 和图结构注意力三类编码,联合生成节点路径、相对航点和依据。

多任务 VLA 决策模型
闭环阶段

偏航与重推理

引入连续视觉反馈、节点到达置信度和错误类型,验证局部修正、回退和全局重规划。

闭环导航推理系统
Primary Sources

核心参考文献

  1. [1]Semi-parametric Topological Memory for NavigationICLR 2018
  2. [2]ViNG: Learning Open-World Navigation with Visual GoalsICRA 2021
  3. [3]Topological Planning With Transformers for Vision-and-Language NavigationCVPR 2021
  4. [4]Structured Scene Memory for Vision-Language NavigationCVPR 2021
  5. [5]Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationCVPR 2022
  6. [6]GNM: A General Navigation Model to Drive Any RobotICRA 2023
  7. [7]ViNT: A Foundation Model for Visual NavigationCoRL 2023
  8. [8]NoMaD: Goal Masked Diffusion Policies for Navigation and ExplorationICRA 2024
  9. [9]NaVid: Video-based VLM Plans the Next Step for Vision-and-Language NavigationRSS 2024
  10. [10]Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological GraphsCoRL 2024
  11. [11]TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language NavigationarXiv 2026

报告依据论文正文、附录和作者公开项目材料整理;数字应结合各论文任务定义、数据划分和成功判据理解,不宜跨基准直接排名。