NavDreamer: Video Models as Zero-Shot 3D Navigators
本清单最贴题的一篇:把生成视频作为语言到导航轨迹的通用接口,用 VLM 选择候选视频计划,再由逆动力学解码 waypoint。建议作为近期主读。
面向近期准备进入该方向的研究者:从通用 VLA 的动作生成范式出发,过渡到 VLN 的语言 grounding、历史记忆与跨场景泛化,最后聚焦用视频生成或显式世界模型“想象未来”并辅助导航决策。
理解动作 token、跨具身数据、离散自回归与连续 flow matching 三种核心设计。
比较模块化推理、视频 VLM 端到端决策和长上下文拓扑记忆。
研究未来视图生成、候选轨迹评分以及生成视频到可执行 waypoint 的接口。
来自 RoboPaper 已归档的机器人顶刊论文;优先保留与导航、跨具身泛化、记忆和世界模型直接相关的工作。
本清单最贴题的一篇:把生成视频作为语言到导航轨迹的通用接口,用 VLM 选择候选视频计划,再由逆动力学解码 waypoint。建议作为近期主读。
关注真实世界、跨具身 ObjectNav 和多层系统协作,适合用来检查一个方法是否真正跨越仿真到现实与平台差异。
把长期记忆、可通行性和室外语义线索中断放在一起,直指现有 VLN 在持续遮挡、线索缺失和复杂地形中的脆弱性。
以增量语义记忆图支撑跨任务 VLN。可与纯 token 历史或视频上下文方法对照,研究结构化记忆究竟带来什么。
将开放词汇特征、3D 对象中心地图与博弈式视觉语言匹配结合,兼顾 ObjectNav 和描述性语言目标,并提供真实机器人验证。
研究如何用基础模型特征提升端到端文本指令导航的泛化,适合作为轻量策略基线,与大 VLM 在线推理路线比较。
把大范围地理空间检索与最后一公里视觉导航衔接起来,适合关注室外长程任务、RAG 和分层规划的人。
针对 VLA 实时部署的 token 压缩方案。若最终目标是把导航 VLA 放到机载算力上,这类无训练压缩值得提前纳入系统设计。
用原始论文或官方项目页串起 VLA、VLN 与想象式导航的关键演进。
VLA 命名与范式奠基作:把机器人动作表示成文本 token,与互联网视觉语言任务共同训练,展示 web knowledge 向机器人控制迁移。
LLM 进入 VLN 的标志性工作:用文本化观察与导航历史进行零样本逐步决策,显式展示子目标分解、进度跟踪和异常重规划。
用视频 VLM 直接吸收连续历史并预测下一步导航动作,是从“把视觉转文字给 LLM”转向原生时序视觉推理的重要节点。
7B 开源 VLA,基于约 97 万条真实机器人轨迹;代码、权重和微调路径完整,是最适合动手建立 VLA 实验能力的起点。
基于 Open X-Embodiment 约 80 万条轨迹的 Transformer 扩散策略,强调不同传感器与动作空间的快速适配;是非纯自回归 VLA 路线的重要参照。
在预训练 VLM 上加入 flow matching 动作专家,以连续、高频 action chunk 处理灵巧操作;理解当前连续动作生成式 VLA 的必读工作。
生成候选未来视图,把复杂规划转成 VLM 的最佳视图选择;它是世界模型/场景想象如何进入开放词汇 ObjectNav 的清晰范例。
将长上下文 VLM 与拓扑图记忆用于多模态指令导航,是“通用 VLA 能否真正覆盖移动机器人长时程任务”的代表性系统。
提出 Matterport3D Simulator 与 Room-to-Room(R2R)数据集,奠定真实室内场景中按自然语言指令导航的标准任务定义。
高性能具身智能仿真与任务平台,支撑 PointNav、ObjectNav、VLN 等大量工作,也是当前导航实验最常见的基础设施之一。
以大规模分布式强化学习训练高性能 PointGoal 策略;近期 VLM 导航系统常将此类成熟策略作为低层执行器。
要求智能体按照语言描述导航并定位远处的具体对象,将 VLN 与指代表达 grounding 连接起来。
组合 GPT-3、CLIP 与视觉导航模型,在不微调且无需语言标注机器人数据的条件下完成真实室外长程指令导航。
把预训练视觉语言特征融合进三维地图,使自然语言可以直接索引空间位置,是开放词汇语义地图路线的代表作。
汇集跨实验室、跨平台的机器人轨迹,建立跨具身训练与评测基础,直接支撑 OpenVLA、Octo 等通用策略。
针对通用 VLM 几何与空间推理薄弱的问题构建数据和模型,成为近期真实 ObjectNav 系统常引用的空间认知基础。
提出以视频统一表达状态、动作与未来结果,为使用互联网规模视频训练决策模型和世界模型提供核心论点。
学习可由动作控制的未来视觉预测模型,并利用想象轨迹进行导航,是生成式世界模型进入导航规划的直接代表。
从基准与基础模型出发,观察开放词汇导航、通用 VLA 和生成式世界模型如何在近期导航系统中汇合。
箭头表示主要的方法继承、数据依赖或直接研究脉络,并不声称覆盖论文的全部引用关系。点击节点打开原始论文或官方项目页。
建议先建立 NavGPT / NaVid / ImagineNav 三类范式的统一评测,再选择“显式记忆”或“生成式世界模型”作为主变量,避免一开始同时更换感知、规划与控制全部模块。