Research Report · 2026-07-30

研究内容、研究目标与拟解决的关键科学问题

面向语言指令和目标图像等异构导航任务,研究视觉拓扑路径知识驱动的 VLA 导航决策与推理方法,建立从外部记忆检索到轨迹生成、依据解释和闭环纠偏的统一技术体系。

项目申报核心文稿 · 研究内容2 · 8 篇核心参考文献
Executive synthesis

核心结论

  1. 研究内容2的核心对象是“路径知识到高层导航决策”的映射,输入承接内容1的视觉拓扑记忆,输出对接内容3的参考轨迹和中间航点。
  2. 拟构建统一任务条件、结构化路径知识 Prompt、图感知 VLA 推理和反馈驱动重规划四个相互闭合的研究模块。
  3. 关键科学问题集中在异构目标的统一 grounding、图结构知识的多模态表达、推理依据与动作决策的一致性,以及部分可观测条件下的闭环状态更新。
  4. 内容2应直接支撑“不依赖定位建图的重推理导航成功率不低于90%”和“语义轨迹匹配度不低于90%”两项总体指标。
01
Research Content

主要研究内容

针对语言指令、目标图像等不同形式的导航任务,研究任务条件驱动的视觉拓扑路径知识检索方法。将自然语言中的目标对象、属性、空间关系、路径约束和动作顺序,以及目标图像中的场景外观与语义特征,统一编码为任务查询;结合机器人当前第一视角 RGB 观测,在视觉拓扑记忆中完成当前位置候选节点检索、目标相关节点召回、路径候选生成和局部子图扩展,获得与当前状态和任务目标共同相关的紧凑路径知识。

研究视觉拓扑路径知识的结构化多模态表达方法。针对 VLA 难以从长序列图像或纯文本邻接表中稳定恢复空间连接关系的问题,将子图中的节点关键帧、语义地标、相对方向、历史访问次序、边可通行性、分支关系和路径代价编码为图文交错的路径知识 Prompt;设计节点标识、边关系 token、路径位置编码和任务相关性标记,使 VLA 在保留预训练视觉语言知识的同时显式感知拓扑结构。

研究路径知识引导的 VLA 导航推理与联合生成方法。将结构化路径知识 Prompt、当前第一视角 RGB 图像和任务描述输入 VLA,对当前位置、已完成指令片段、候选路径语义一致性和沿途关键场景进行联合理解;在受约束输出空间内生成拓扑节点轨迹、平台无关的相对中间航点、到达/转向/分支选择等导航决策,以及与节点证据和指令片段对齐的推理依据。通过路径级监督、航点级监督和依据—决策一致性约束,降低语言上合理但拓扑不可行的幻觉。

研究基于连续视觉观测和执行反馈的闭环导航决策。维护可更新的任务进度状态和路径置信度,将当前观测与计划节点关键帧、预期语义地标和边到达事件进行匹配,判别正常推进、局部偏航、节点误定位、边不可通行和任务目标误解等状态;依据偏航类型分别触发局部航点修正、备选边切换、最近可信节点回退或目标条件子图重检索,实现导航轨迹持续更新与重推理。

02
Research Objectives

研究目标

总体目标是建立视觉拓扑路径知识引导的多任务 VLA 导航决策与推理方法,在不使用全局高精度位姿和稠密地图作为高层决策输入的条件下,实现语言指令、目标图像等任务的统一理解、长程路径推演、平台无关航点生成和执行反馈闭环更新,为人形机器人运动规划与控制提供语义正确、拓扑可达且可解释的高层导航参考。

目标一:建立异构导航任务的统一目标表达和任务条件子图检索模型。语言指令能够解析目标、属性、关系、路径顺序与禁止条件;目标图像能够检索语义/外观相符的目标节点;当前 RGB 能够召回当前位置候选。形成包含主路径、备选分支和关键语义证据的紧凑子图。

目标二:建立拓扑结构保持的路径知识 Prompt 与图感知 VLA。模型能够理解节点关键帧、邻接和方向关系、已访问历史与任务进度,联合输出有序节点轨迹、相对中间航点、停止条件、决策置信度和与输入证据对齐的 Reasoning。

目标三:建立反馈驱动的偏航诊断与重推理机制。利用连续视觉和内容3返回的执行状态检验计划—观测一致性,及时区分局部控制扰动、节点跳转失败、路径阻塞和语义误判,在无需全局重建地图的情况下更新轨迹。

目标四:建立覆盖多任务、多场景、多难度和多故障类型的评价体系。重点验证任务成功、指令语义轨迹匹配、拓扑路径有效性、航点可执行率、偏航检出与恢复、推理依据忠实度及在线延迟。

  • 项目总体指标承接:在项目定义的测试环境与重推理触发条件下,导航成功率不低于90%。
  • 项目总体指标承接:实际执行轨迹与语言/目标图像所表达的语义轨迹匹配度不低于90%。
  • 建议内部指标:任务相关目标节点 Top-k 召回率不低于95%,主路径拓扑有效率不低于98%。
  • 建议内部指标:VLA 输出中间航点经内容3可行性检查后的首次通过率不低于90%。
  • 建议内部指标:典型偏航事件检出率不低于95%,检出后重规划恢复成功率不低于90%。
  • 建议内部指标:关键路径决策的证据引用正确率和依据—动作一致率不低于90%。
03
Key Scientific Questions

拟解决的关键科学问题

科学问题一:语言、目标图像与当前视觉如何在视觉拓扑记忆中形成统一、任务相关的空间 grounding?语言目标包含对象类别、属性、相对关系和动作顺序,目标图像侧重外观和场景上下文,当前观测又具有视角、光照和动态遮挡差异。需要研究跨模态目标表示与图检索机理,使不同输入最终落到同一组可验证的候选节点、地标和路径约束上,同时抑制重复场景造成的错误定位。

科学问题二:如何在不依赖度量坐标的条件下,使 VLA准确理解视觉拓扑图的连接、方向、顺序和可达性?通用 VLA 的预训练主要来自独立图像—文本对或短轨迹,缺少图结构归纳偏置。把邻接表写成文本会损失节点视觉和边约束,只堆叠关键帧又难以恢复全局拓扑。需要揭示图结构 token、图文交错 Prompt、拓扑位置编码与 VLA 注意力之间的作用机制。

科学问题三:如何建立语义推理、拓扑轨迹和连续航点之间的一致性,使 Reasoning 成为可核验决策依据而非事后语言解释?模型既要说明选择某节点是因为哪段指令和哪个地标证据,又要保证节点序列沿图可达、航点方向与边一致、停止条件与任务目标相符。需研究受约束联合生成和过程级一致性学习,使推理依据能够用于错误检测与重规划。

科学问题四:部分可观测和执行扰动下,如何利用连续观测维持导航进度信念并选择合适的重推理尺度?一次视觉不匹配可能来自视角变化、行人遮挡、尚未到达、走错边或地图环境变化。若频繁全局重规划将产生高延迟和计划抖动,若仅局部修正又可能累积错误。需要研究多源一致性度量、不确定性演化和分级重推理触发机制。

04
Expected Innovations

预期创新点与研究边界

创新点一是面向语言与目标图像统一任务的双端检索:同时考虑当前所在位置和任务目标,从大规模视觉拓扑记忆中召回路径相关子图,而非只检索单个目标帧或将全部历史输入长上下文模型。

创新点二是结构保持的路径知识 Prompt:将关键帧视觉、语义地标、邻接关系、方向、历史路径与任务进度组织为可被 VLA 显式引用的图文知识单元,并探索 Prompt 级表达与模型内部图注意力的协同。

创新点三是轨迹—航点—Reasoning 受约束联合生成:用拓扑有效性、任务语义对齐、航点方向一致和证据引用一致共同约束输出,增强模型决策的可执行性和可诊断性。

创新点四是基于错误类型和置信度的分级闭环重推理:将简单局部偏差、路径边失效和高层目标误判区分处理,按需调用局部修正、子图更新或全局重检索,兼顾成功率、稳定性和在线效率。

研究边界方面,内容2使用内容1提供的节点、边、语义与拓扑重定位结果,不研究关键帧抽取和多轨迹地图融合;其输出是参考节点轨迹、相对航点和高层决策,不研究碰撞几何、足步序列及全身控制,这些由内容3完成。

附表
Comparative Matrix

科学问题—研究任务—评价证据对应关系

关键科学问题核心研究任务主要输出关键评价证据
异构任务统一空间 grounding语言/图像目标编码、当前位置检索、目标节点召回任务条件、候选起终点、相关子图Recall@K、重复场景鲁棒性、目标 grounding 准确率
VLA 的视觉拓扑结构理解图文 Prompt、节点/边 token、拓扑位置编码结构化路径知识表示边关系问答、路径可达率、全局规划准确率
Reasoning 与轨迹航点一致受约束解码、多任务监督、证据对齐节点轨迹、相对航点、理由与置信度语义轨迹匹配、航点通过率、依据忠实度
连续闭环状态更新与重推理进度信念、偏航分类、分级重规划更新轨迹、错误类型、恢复决策偏航检出率、恢复率、延迟和计划抖动
Actionable Research Agenda

建议研究路线

目标1

统一任务与路径知识

形成语言/目标图像共同的任务约束模式与双端子图检索。

任务条件检索模型和路径知识数据集
目标2

VLA 联合推理生成

形成图感知编码与轨迹—航点—依据联合解码。

路径知识引导 VLA 模型
目标3

闭环重推理

形成进度跟踪、偏航分类和分级轨迹更新。

实时闭环导航决策模块
Primary Sources

核心参考文献

  1. [1]Topological Planning With Transformers for Vision-and-Language NavigationCVPR 2021
  2. [2]Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationCVPR 2022
  3. [3]NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language ModelsAAAI 2024
  4. [4]NaVid: Video-based VLM Plans the Next Step for Vision-and-Language NavigationRSS 2024
  5. [5]Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological GraphsCoRL 2024
  6. [6]MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning ChainsarXiv 2024
  7. [7]TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language NavigationarXiv 2026
  8. [8]ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied NavigationarXiv 2026

报告依据论文正文、附录和作者公开项目材料整理;数字应结合各论文任务定义、数据划分和成功判据理解,不宜跨基准直接排名。