Temporary Research Topic · 更新于 2026-07-24

VLA × VLN × 世界模型导航:研究阅读清单

面向近期准备进入该方向的研究者:从通用 VLA 的动作生成范式出发,过渡到 VLN 的语言 grounding、历史记忆与跨场景泛化,最后聚焦用视频生成或显式世界模型“想象未来”并辅助导航决策。

26 篇精选 VLAVLNWorld Model

阅读深度研究报告 → 研究内容2专项文稿 →

Reading Route建议阅读顺序

  1. 建立共同语言RT-2 → OpenVLA → π₀

    理解动作 token、跨具身数据、离散自回归与连续 flow matching 三种核心设计。

  2. 进入导航问题NavGPT → NaVid → Mobility VLA

    比较模块化推理、视频 VLM 端到端决策和长上下文拓扑记忆。

  3. 聚焦世界模型ImagineNav → NavDreamer

    研究未来视图生成、候选轨迹评分以及生成视频到可执行 waypoint 的接口。

From RoboPaper近期与往期重点

来自 RoboPaper 已归档的机器人顶刊论文;优先保留与导航、跨具身泛化、记忆和世界模型直接相关的工作。

2026RoboPaper · 07-24

NavDreamer: Video Models as Zero-Shot 3D Navigators

本清单最贴题的一篇:把生成视频作为语言到导航轨迹的通用接口,用 VLM 选择候选视频计划,再由逆动力学解码 waypoint。建议作为近期主读。

世界模型视频生成零样本导航

2023—2025 Foundations近三年经典与必读

用原始论文或官方项目页串起 VLA、VLN 与想象式导航的关键演进。

2024RSS

Octo: An Open-Source Generalist Robot Policy

基于 Open X-Embodiment 约 80 万条轨迹的 Transformer 扩散策略,强调不同传感器与动作空间的快速适配;是非纯自回归 VLA 路线的重要参照。

通用策略扩散动作头Open X-Embodiment
2019ICCV

Habitat: A Platform for Embodied AI Research

高性能具身智能仿真与任务平台,支撑 PointNav、ObjectNav、VLN 等大量工作,也是当前导航实验最常见的基础设施之一。

Habitat仿真平台Embodied AI
2022CoRL / ICRA

VLMaps: Visual Language Maps for Robot Navigation

把预训练视觉语言特征融合进三维地图,使自然语言可以直接索引空间位置,是开放词汇语义地图路线的代表作。

开放词汇语义地图CLIP
2025CVPR

Navigation World Models

学习可由动作控制的未来视觉预测模型,并利用想象轨迹进行导航,是生成式世界模型进入导航规划的直接代表。

世界模型未来预测导航规划

Research Graph方向知识图谱

从基准与基础模型出发,观察开放词汇导航、通用 VLA 和生成式世界模型如何在近期导航系统中汇合。

基准与基础语言与语义导航通用 VLA世界模型近期前沿
VLA、VLN 与世界模型导航研究脉络 从数据集和仿真平台,经开放词汇语义导航与通用视觉语言动作模型,发展到使用视频世界模型进行未来想象的导航系统。 基准与基础Tasks · Data · Simulation语言与语义导航VLN · ObjectNav · Memory通用 VLAVision · Language · Action世界模型Video · Imagination · Planning近期前沿Real World · Cross Embodiment 2018
R2R / VLN
2019
Habitat
2019
DD-PPO
2020
REVERIE
2023
Open X-Embodiment
2022
LM-Nav
2022
VLMaps
2023
NavGPT
2024
NaVid
2024
SpatialVLM
2025
Mobility VLA
2023
RT-2
2024
Octo
2024
OpenVLA
2024
π₀
2024
Video as New Language
2025
ImagineNav
2025
Navigation World Models
2026
VLN-Game
2026
SysNav
2026
TARIC
2026
NavDreamer

箭头表示主要的方法继承、数据依赖或直接研究脉络,并不声称覆盖论文的全部引用关系。点击节点打开原始论文或官方项目页。

Research Opportunities值得切入的问题

建议先建立 NavGPT / NaVid / ImagineNav 三类范式的统一评测,再选择“显式记忆”或“生成式世界模型”作为主变量,避免一开始同时更换感知、规划与控制全部模块。