Research Report · 2026-07-30

实验手段、评价体系与关键技术验证设计

围绕检索质量、拓扑推理、轨迹语义一致性、航点可执行性、偏航恢复和在线效率建立分层实验体系,为“成功率≥90%、语义轨迹匹配度≥90%”提供可审计证据。

项目申报实验设计 · 研究内容2 · 6 篇核心参考文献
Executive synthesis

核心结论

  1. 评价必须区分检索、规划、航点、Reasoning 与闭环恢复,避免用最终成功率掩盖中间模块错误。
  2. 语义轨迹匹配度应由地标覆盖、顺序一致、空间关系满足、终止语义和路径偏离共同构成,而非只看终点距离。
  3. 实验采用仿真规模化、真实回放可重复、机器人在线闭环三层证据,并设置地图变化和执行扰动故障注入。
  4. 所有 VLA 对比在相同拓扑记忆、局部控制和计算预算下进行,才能证明路径知识与推理机制本身的贡献。
01
Experimental Setup

实验平台与数据组织

构建三层实验平台。第一层使用 Habitat/VLN-CE、R2R、REVERIE 或 HM3D 等环境,将连续轨迹转换为与内容1一致的关键帧拓扑记忆,用于大规模任务组合、路径扰动和消融。第二层使用真实人形机器人历史行走数据离线回放,固定观察序列与执行反馈,支持不同模型的可重复比较。第三层在人形机器人室内外场景进行在线闭环实验。

真实场景应覆盖办公室/实验室、长走廊与重复门区、大厅与多分支、室内外过渡、坡道/楼梯/门区等典型区域。内容2仅评价高层路径知识和参考航点;内容3保证安全执行,并把航点完成、阻塞、局部轨迹调整和超时等事件回传。

任务集分为语言路线指令、语言目标搜索、目标图像导航和混合多模态任务。每类按长度、岔路数、地标密度、目标歧义和环境变化分级。语言指令包含经过/避开/先后/左右/相邻等约束,目标图像包含视角、光照、季节或人员遮挡变化。

构造闭环故障集:初始节点混淆、错过关键转向、误入相邻走廊、边临时阻塞、关键地标遮挡、目标外观变化、执行航点未完成以及历史边失效。故障发生位置和强度可控,便于测量检测时间与恢复成功率。

02
Metrics

分层评价指标

任务层报告导航成功率 SR、路径效率 SPL/加权成功、重推理条件下成功率、平均完成时间和干预次数。总体指标“重推理导航成功率不低于90%”应明确触发场景、成功判据和试验次数,并给出置信区间;建议至少覆盖各类典型偏航和每类足够重复次数。

检索层报告当前位置 Recall@K、目标节点 Recall@K、相关子图覆盖率、主路径召回率和困难负样本误检率。拓扑规划层报告节点序列合法率、任务约束路径命中率、相对最优路径代价及备选分支有效率。

航点层报告相对方向误差、距离区间准确率、航点首次可行性检查通过率和内容3实际执行完成率。Reasoning 层报告证据引用正确率、拓扑事实正确率、依据—动作一致率和错误归因准确率;不评价不可审计的自由思维过程。

闭环层报告偏航检出率、误报率、平均检出步数、错误类型分类 F1、一级/二级/三级恢复次数、恢复成功率、重新到达计划路径的时间与额外路程。效率层报告端到端决策延迟、VLA 调用频率、峰值显存/功耗和超时安全退化比例。

语义轨迹匹配度建议定义为五项加权:指令关键地标覆盖、地标访问顺序一致、转向/空间关系满足、禁止区域/动作约束满足、终止位置语义正确。目标图像任务以目标场景视觉—语义相似、目标邻域到达和停止判断替换指令顺序项。各子项使用人工标注与自动节点语义共同核验,总分达到90%才计为满足项目指标。

03
Baselines & Ablations

对比方法与消融设计

基础对比包括图最短路+视觉目标局部策略、ViNG/ViNT/NoMaD 类目标图像导航、Topological Planning/DUET 类图规划、NavGPT 类文本推理、NaVid 类视频历史动作生成、Mobility VLA 类目标帧检索+拓扑执行。所有方法尽量共享相同节点、边和内容3控制器。

核心对比沿路径知识注入强度递进:无外部记忆的当前 RGB+任务;输入检索关键帧但无边;自然语言邻接表;结构化图文 Prompt;图文 Prompt+拓扑注意力。由此测量视觉证据、显式边和模型结构改造分别带来的收益。

输出空间消融比较自由文本动作、离散节点选择、连续航点回归、节点+航点联合输出;Reasoning 消融比较无依据、自由依据、证据引用式依据和带一致性损失的依据。闭环消融比较固定计划、每步全局重规划、仅局部修正和拟提出的分级事件触发重推理。

检索消融包括单端目标检索、当前/目标双端检索、无路径候选重排、无困难负样本、无邻域分支扩展;记忆消融包括仅当前节点、固定长度历史、完整历史和任务相关滚动子图。

统计上按场景而非单条轨迹随机划分训练和测试,真实环境保留未见楼层/区域;每个在线条件进行多次随机起点复测,报告均值、标准差和 bootstrap 置信区间。

04
Validation Protocol

关键技术验证实验

实验一验证异构任务统一 grounding。在相同视觉拓扑图上构造语义等价的语言、目标图像和语言+图像任务,对比候选目标与路径的一致性;考察同一地点跨视角、跨光照和跨时间检索,以及相似走廊/门区的误匹配。

实验二验证拓扑知识理解。自动生成节点邻接、路径可达、方向顺序、必经地标和反事实断边问题,评估 VLA 能否回答并生成合法路径;再在真实指令上测量结构化 Prompt 和拓扑注意力对路径有效率与 SPL 的影响。

实验三验证轨迹—航点—依据联合生成。将输出交给独立图规则检查器和内容3可行性检查器,分别测量拓扑合法、语义正确和局部可执行;通过遮蔽模型引用的关键节点图像或更换边关系,检查 Reasoning 与决策是否随证据变化,从而评估忠实度。

实验四验证闭环偏航恢复。按预设时刻注入转向误差、阻塞或定位混淆,比较固定计划、周期重规划和事件触发方案的检测、恢复、额外路程与模型调用次数。特别考察短暂遮挡不应触发全局重规划、持续不一致必须升级处理的滞回效果。

实验五验证无高精度定位依赖。高层模块仅接收 RGB、任务、视觉拓扑知识和离散执行事件,屏蔽全局真值位姿;位置评测真值只由外部系统记录,不输入模型。与使用真值节点/位姿的上界比较,量化视觉拓扑重定位不确定性对内容2的影响。

实验六验证跨平台接口。保持内容2模型、任务和节点路径不变,在人形机器人与另一种移动平台或仿真代理上更换内容3执行器,比较高层路径与语义匹配,验证平台无关相对航点接口。

05
Milestones

阶段成果与验收证据

第一阶段形成多任务视觉拓扑路径知识数据集、统一任务模式、检索基线和语义轨迹匹配评价工具。验收以目标节点召回、路径子图覆盖和跨模态任务一致性为主。

第二阶段形成图文路径知识 Prompt、图感知 VLA 适配器与轨迹—航点—依据联合解码器。验收以拓扑路径合法、语义轨迹匹配、航点可行性和依据忠实度为主。

第三阶段形成执行反馈闭环、偏航故障库和事件触发重推理系统。验收以重推理导航成功率、偏航恢复、模型调用频率和真实机器人长程任务为主。

最终交付包括模型与训练代码、路径知识与故障数据、离线回放评测平台、内容1/内容3接口规范、真实机器人演示和可复核实验记录。

附表
Comparative Matrix

指标分解与建议目标值

层级指标建议目标说明
任务重推理导航成功率≥90%对项目定义的典型偏航和重推理任务统计
任务语义轨迹匹配度 STM≥90%地标、顺序、关系、约束、停止五项固定权重
检索目标节点 Recall@K≥95%语言和目标图像分别报告,并包含困难负样本
规划输出路径拓扑合法率≥98%所有相邻节点必须存在有效边
航点首次可行性检查通过率≥90%由内容3统一检查
闭环偏航检出率 / 恢复率≥95% / ≥90%同时报告误报和检测延迟
推理证据引用与动作一致率≥90%引用节点、边、地标可机器核验
效率关键节点决策延迟按硬件实测给出均值、P95和超时退化比例
Actionable Research Agenda

建议研究路线

仿真与离线

规模化验证

完成任务组合、结构问答、消融和故障注入,冻结评价协议。

评测基准与统计报告
真实回放

可重复验证

在相同真实观察序列上比较不同模型与 Prompt,定位模块误差。

真实路径离线排行榜
机器人在线

系统验收

完成无全局位姿输入的多场景闭环和偏航恢复试验。

指标报告与完整运行日志
Primary Sources

核心参考文献

  1. [1]Topological Planning With Transformers for Vision-and-Language NavigationCVPR 2021
  2. [2]Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationCVPR 2022
  3. [3]NaVid: Video-based VLM Plans the Next Step for Vision-and-Language NavigationRSS 2024
  4. [4]Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological GraphsCoRL 2024
  5. [5]TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language NavigationarXiv 2026
  6. [6]TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic CuesRA-L 2026

报告依据论文正文、附录和作者公开项目材料整理;数字应结合各论文任务定义、数据划分和成功判据理解,不宜跨基准直接排名。