具身导航周报(2026-09-02 ~ 2026-09-10)

一、本期结论

  • 本期 46 篇新增条目中仅 1 篇报 R2R-CE/RxR-CE(O2C-Nav),另有 1 篇报 VLN-CE(MobileVLA-R1 2.0)。指令跟随式连续环境导航的论文数量处于低位,而新建导航评测/基准的工作有 3 篇(NavArena、OVMAN,以及面向操作的 MEMOBench)。本报告判断:本期地面语言导航的增量更多来自「怎么评」而非「怎么做」。
  • 零样本 VLN-CE 的推理成本被正面处理。 O2C-Nav 将每决策步的大模型调用压缩到一次,路径是免训练的结构化路点生成,加上把候选路点作为视觉标记直接绘制在 RGB 图像上,由 MLLM 选点、FMM 规划器执行。论文称在 R2R-CE 与 RxR-CE 上超过现有零样本方法,但摘要未给出可核验数值。对真机部署而言,调用次数而非单纯成功率是当前的实际约束。
  • 导航评测正从「静态场景 + 最终成功率」转向「场景会变、记忆会过期」。 OVMAN 构造「去那把被移走的椅子」「去花瓶原来的位置」这类由变化本身定义的目标,报告零样本物体目标导航器仅 11.4% 成功,在物体已离开的位置上接近失效(former 0.000、removed 0.025);OmniNav 则用可增量更新的 3D 物体场景记忆加贝叶斯信念修正处理同一问题。本报告判断:静态语义地图是当前地面导航系统最脆弱的环节,这两项工作从评测与方法两端同时指向它。
  • LIBERO 的区分度被公开质疑。 LIBERO-RECOVER 指出 SOTA 方法在 LIBERO 上已接近 100% 成功率,而理想条件下的成功不等于真实鲁棒性。本期 46 篇中有 10 篇以 LIBERO 为主要基准。本报告判断:后续筛选中,仅报 LIBERO 数字的工作其边际信息量已显著下降,应优先看是否附带失败恢复或真机证据。
  • 人形整机导航以全身 VLA 的形式出现。 TANGO 直接预测 29 自由度关节空间动作,将导航从 2D 路径规划改写为需要手臂摆放、躯干调整与步态调节的连续几何适配,纯仿真训练后在 Unitree G1 上零样本部署。这改变了「可通行」的定义边界,对轮式平台不直接适用,但对狭窄杂乱场景的可通行性建模有参考价值。

本期公众号源(we-mp-rss)新增 0 条,原因是微信公众平台频控:两个订阅号(视觉语言导航、具身智能导航)均完整进入采集流程,日志报 频率限制 重试后 frequencey control, stop at 0,共更新 0 条。非关键词过滤所致。本期全部 46 条来自 arXiv,均为独立工作,无跨源重复。

二、优先阅读清单

优先级 工作 任务/场景 核心贡献 关键证据 阅读理由
A1 O2C-Nav 零样本 VLN-CE(连续环境) 每步仅调用一次 MLLM,免训练路点生成 + 路点作为图像视觉标记 R2R-CE、RxR-CE 上称超过现有零样本方法;摘要未提供可核验数字 本期唯一报 R2R-CE/RxR-CE 的工作,且直指推理延迟这一部署瓶颈;已给出代码地址
A2 OmniNav 动态环境长时程目标导航 场景有效性、目标信念、交互可达性三者联合的持续推断 语义 ObjectNav 与细粒度实例导航上称成功率最高(未给数值);真机 pick-and-place 由 53.3% 提升至 71.7%(对照为改造后的开环基线) 少见的把「记忆会过期」「搜索失败也是证据」写进方法的导航工作,且有真机数字
A3 OVMAN 两次访问、变化定义目标的开放词表导航 新任务与基准:目标由场景变化本身指定,含「物体已离开」的空位查询 219 个两访情节,全部经预言机三次验证可解;零样本物体目标导航器 11.4%,former 0.000、removed 0.025;两访参考智能体 45.2%,具身预言机 99.5% 把当前方法的失效模式量化到近乎为零,误差分解指向开放词表实例落地而非几何
A4 TANGO 杂乱室内人形全身视觉语言导航 由语言指令与第一人称 RGB 直接预测 29-DoF 关节动作 仿真中称达到视觉语言导航最优并优于模块化基线(未给数值);Unitree G1 零样本真机,未使用任何真机导航数据训练 将可通行性从 2D 占据栅格扩展到全身几何;仿真到真机的合成数据管线值得拆解
A5 MobileVLA-R1 2.0 语言引导导航 + 四足/人形移动操作 监督思维链对齐加强化学习,配推理条件化动作解码器 VLN-CE 上 SR 平均提升 1.6 点(对照 MobileVLA-R1);真机 G1 移动操作整任务成功率提升 10.0 点 本期第二个触及 VLN-CE 的工作,且同时给出仿真与真机对照
A6 NavArena 由 3DGS 重建自动构造目标导向导航基准 冻结 3DGS 渲染 + 高斯密度/高度导出的占据代价图 + 多视角开放词表掩码提升的语义目标 覆盖 2000 余个场景,生成 2220 万条专家轨迹;工具、评测协议与衍生资产称将公开 解决「有重建但没有可通行性与闭环协议」的问题,可能成为自建场景评测的基础设施
B1 LIBERO-RECOVER 操作模型的失败恢复评测 指出 LIBERO 近满分的误导性,转向失败恢复 摘要称 SOTA 在 LIBERO 上接近 100% 成功率 影响本资料库后续对「仅报 LIBERO」类工作的取舍标准
B2 No Free Checker 机器人策略验证器综述 按可得性与可信度两轴组织约 150 个验证器 综述结论:四类验证器中可信度随可得性上升而下降 为导航系统选择成功判定/运行时监控提供选型框架

三、重点工作分析

1. O2C-Nav:把零样本 VLN-CE 的每步大模型调用压到一次

维度 分析
问题 摘要称现有零样本 VLN-CE 方法要么依赖预训练路点预测器,要么每步需多次查询大模型,带来难以承受的推理延迟与计算开销
方法 三段式:免训练的结构化路点生成器产生稀疏且带历史信息的候选路点;将候选路点作为视觉标记直接投影到 RGB 图像上作为抽象表示;MLLM 单次调用选择一个路点或输出兜底的目标边界框,再由快速行进法(FMM)规划器转成无碰撞可执行路径
证据 在 R2R-CE 与 RxR-CE 上评测,论文称超过当前最优零样本方法。摘要未给出 SR、SPL、NE 等任何数值,也未列出对照方法名,因此无法进入横向对比。代码地址 https://github.com/kkpsq/O2C-Nav-Code
价值 针对地面机器人实时性约束:把「多次查询」降为「一次查询」是可直接换算成控制频率的收益。将候选路点画在图像上作为视觉标记,把空间选择问题转成 MLLM 更擅长的视觉指认问题,同时显式承载历史记忆
局限 无可核验数字;免训练路点生成器在杂乱或狭窄空间的召回率未知;FMM 规划依赖较可靠的深度与占据估计,真机噪声下的表现摘要未涉及;兜底边界框机制的触发频率与失败模式未说明
建议 优先精读并复现。这是本期唯一的 R2R-CE/RxR-CE 工作,且有代码。复现时首先确认论文正文中的 R2R-CE 数值与对照设置(注意区分 R2R-CE 连续环境与离散 R2R,二者不可直接比较),其次实测单步端到端延迟

2. OmniNav:把「记忆会过期」写进导航状态推断

维度 分析
问题 长时程目标导航中三类状态只是条件有效:物体移动或消失后场景表示变陈旧;搜索失败会改变目标位置的信念;几何上方便到达的终点对后续操作未必可行
方法 将长时程导航形式化为对因子化任务状态后验的持续推断,联合场景有效性、目标信念与交互可行性三者。表示上增量构建可更新的 3D 物体场景记忆;探索上引入证据感知的贝叶斯信念修正,从语义上下文导出依赖感知的区域先验,并把失败搜索作为负证据纳入后验,用于引导前沿点选择;交互上把操作可达性与碰撞约束纳入导航终点选择,并通过分层闭环恢复传播执行反馈
证据 语义 ObjectNav 与细粒度实例导航基准上称成功率在对比方法中最高,但摘要未给具体数值与对照方法名;称对目标重定位保持鲁棒;真实世界 pick-and-place 成功率由 53.3% 提升至 71.7%,对照为改造后的开环基线。项目页 https://omni-nav.github.io/
价值 「把不成功的搜索当作负证据」是可直接移植的机制,与当前多数只做正向语义前沿选择的系统形成对比。把操作可达性纳入导航终点选择,对移动操作平台是工程上的实际收益
局限 仿真基准无数值,无法判断提升幅度;真机 53.3%→71.7% 的对照是「改造后的开环基线」而非同类闭环方法,优势可能部分来自闭环本身而非贝叶斯信念修正;3D 物体记忆的更新依赖可靠的物体级检测与关联
建议 精读方法部分,重点看信念修正的具体形式。可考虑将负证据机制单独消融后接入现有前沿探索模块

3. OVMAN:把「场景变化」本身作为导航目标

维度 分析
问题 现有导航基准的目标定义在智能体当前所见的世界中,已有的两次访问基准评的是回忆或重排,而非导航。摘要称没有基准能表达「去那把被移走的椅子」或「去花瓶原来的位置」
方法 定义新任务:智能体先巡视场景,在脚本化的变化发生后返回,需导航到由变化本身指定的目标。六种变化关系中有两种的答案是物体已离开的位置,该处已无可检测对象。发布 219 个两访情节,每个均由预言机智能体三次完成以验证可解
证据 零样本物体目标导航器到达变化定义目标的比例为 11.4%,在空出位置上基本失效(former 0.000、removed 0.025);自维护的开放词表地图回答过去时态查询的比率约为同样地图按两次访问读取时的三分之一,即便提供落地信息亦然;简单的两访参考智能体导航成功率为 45.2%,具身预言机为 99.5%。误差分解将剩余难度归于开放词表实例落地,而非几何或位置已知后的答案选择
价值 给出了一组现有方法接近零分的明确失效场景,且误差已分解到具体环节。对家庭服务类地面机器人,「东西被挪走了」是常态而非边缘情况
局限 变化是脚本化的,与真实家庭中的变化分布未必一致;219 个情节规模有限;参考智能体 45.2% 与预言机 99.5% 之间的差距说明任务本身仍有较大未解空间,短期内不宜作为主指标
建议 加入基准跟踪清单。近期不必投入复现,但在评估自研导航系统的地图老化问题时,可借用其「过去时态查询」的构造方式

4. TANGO:把人形导航从 2D 路径规划改写为全身几何适配

维度 分析
问题 杂乱室内环境中的人形通行不是 2D 路径规划问题,需要连续的、几何感知的全身适配,包括手臂摆放、躯干调整与步态调节,才能在复杂三维空间中无碰撞移动
方法 给定自然语言指令与第一人称 RGB 观测,直接预测 29 自由度关节空间动作供下游全身控制使用。训练完全在仿真中进行,通过全局路径规划、运动学全身运动生成、障碍感知的运动编辑与基于强化学习的跟踪,合成多样的无碰撞通行行为,为语言条件化全身策略提供动力学可行的动作监督
证据 大量仿真实验中称在视觉语言导航上达到最优表现,并在需要绕障的困难场景中优于强模块化基线,摘要未给出数值与具体基准名;在 Unitree G1 上零样本部署,称在真实杂乱场景中稳健完成语言引导通行,未使用任何真机导航数据训练
价值 对轮式地面平台不直接适用,但「可通行性取决于本体构型而非投影占据」这一判断可迁移:对带机械臂的移动平台,导航终点与路径同样受本体姿态约束(与 OmniNav 把操作可达性纳入终点选择形成呼应)。合成动力学可行监督的管线是可复用的数据生成思路
局限 无数值证据,「最优」无法核验;训练完全在仿真中,真机结论为定性描述;29-DoF 关节空间动作的安全性与恢复机制摘要未涉及
建议 跟踪,按其数据合成管线拆解。正文公布后确认其 VLN 评测所用的具体基准(摘要未指明是否为 R2R-CE 系列,不应默认可比)

5. NavArena:把 3DGS 重建变成可闭环评测的导航基准

维度 分析
问题 固定的 3D 高斯泼溅重建能提供真实的新视角,但缺少导航评测所需的可通行性约束、有效目标与闭环协议
方法 三个组件:冻结的 3DGS 模型提供第一人称 RGB-D 渲染;由高斯密度与高度统计导出占据代价图,支持可达性与碰撞查询;由多视角开放词表掩码提升得到语义目标候选。三者共同支持目标导向导航情节的自动生成与统一闭环评测
证据 覆盖 2000 余个场景,生成 2220 万条专家轨迹;通过空间与语义评估检验所导出的导航表示,并用策略回放展示统一评测协议的诊断价值。称全部基准生成工具、评测协议与衍生资产将公开发布
价值 若如期开源,可显著降低「用自采场景做导航评测」的门槛——现有流程通常需要 Habitat/MP3D 一类带语义与可通行标注的数据集。对希望在自有实验场地上做闭环评测的团队意义直接
局限 从高斯密度与高度统计导出的占据图与真实可通行性的一致性,摘要未给出量化验证;2220 万条专家轨迹的质量取决于该占据图,存在误差传播;发布时间与许可摘要未说明
建议 加入跟踪清单,等待代码发布。发布后优先验证占据代价图在低矮障碍与玻璃/镜面区域的可靠性

四、可迁移方法

来源方向 工作 可迁移机制 可接入地面导航的位置 风险/前提
空地协同(含 UGV) AGC-VLN 把无人机全局俯视图与 UGV 上报位姿、VLM 锚定目标一起渲染成带距离标注的 CAR/GOAL 标记共享鸟瞰图,UGV 据此用冻结 VLM 规划循路路径 为第一人称视角的地面平台补充全局空间上下文的接口设计 CARLA 仿真结果(Town10HD 100 个闭环情节,联合成功率 77.0%,较较弱单体的无人机 50.0% 提升 27.0 点,较最强已发表单体基线 Travel UAV 53.0% 高 24.0 点);室内场景无对应俯视源
无人机 VLN AirAnchor 空间锚点桥接局部与全局:查询驱动的锚点落地、持久物体空间记忆、显式整合两种尺度的导航智能体 与 OmniNav 的物体记忆思路同构,可作为「持久物体知识库 + 地标先验检索」的第二个设计参考 在 AerialVLN 上评测,城市室外尺度;摘要未给数值
世界模型 WorldAgen 部署时采样探索动作、收集真实状态转移、对世界模型做轻量测试时训练 导航策略进入新建筑后的在线适配 在 CALVIN 与 LIBERO 上验证,均为操作任务;导航中采样探索动作的安全代价更高
世界模型 ProWAM 以执行进度为显式中间表示,分别在进度间与进度内调制对想象未来的使用 长时程导航中「何时该信任预测、何时该依赖当前观测」的门控 称在强 VLA/WAM 基线上一致提升,摘要未给数值与基准名
失败检测与恢复 VLA-Corrector 阶段感知的失败验证加提示式恢复,对固定策略做闭环纠正 导航中的分段失败诊断,无需重训主策略 LIBERO 上验证;导航的「阶段」划分不如操作明确
失败检测与恢复 Where Success Breaks 把微调重新表述为失败边界学习:发现、定位并利用成功行为失效的边界 导航策略微调时构造负样本的思路 摘要未给数值;需要能自动产生失败轨迹的仿真环境
评测方法论 No Free Checker 可得性与可信度两轴框架,加九项使验证器主张可检验的指标 为导航系统挑选成功判定器与运行时监控器 综述,无实验;结论「可信度随可得性上升而下降」为其总体观察
评测方法论 MEMOBench 过程级记忆评测,区分「遗忘」与「操作失败」,不只看最终成功率 导航记忆模块的评测设计——同样存在把遗忘与规划失败混为一谈的问题 面向操作任务构建,需重新设计导航版本的过程级指标

五、分类速览

5.1 地面 VLN / ObjectNav / 语义导航

工作 主题 一句话贡献 相关度 链接
O2C-Nav 零样本 VLN-CE 见重点分析 A 链接
OmniNav 动态环境目标导航 见重点分析 A 链接
OVMAN 变化感知导航基准 见重点分析 A 链接
TANGO 人形全身 VLN 见重点分析 A 链接
MobileVLA-R1 2.0 移动机器人控制 思维链对齐加强化学习;VLN-CE 上 SR 平均提升 1.6 点,真机 G1 移动操作整任务成功率提升 10.0 点 A 链接

5.2 记忆、地图、规划与评测

工作 主题 一句话贡献 相关度 链接
NavArena 导航基准生成 见重点分析 A 链接
MEMOBench 过程级记忆评测 将遗忘与操作失败分离评测,不依赖最终成功率 B 链接
No Free Checker 验证器综述 约 150 个验证器按可得性与可信度两轴归类,提出九项可检验性指标 B 链接
LIBERO-RECOVER 失败恢复评测 指出 LIBERO 近满分的误导性,转向失败恢复能力评估 B 链接
RoboSPA 空间-过程复杂度评测 评估 VLA 在空间与过程复杂度提升下的推理表现 B 链接
面向长时程 VLA 的神经符号过程推理 任务图与过程记忆 用显式任务图编码动作依赖与有效转移,结合多模态过程记忆 B 链接
类脑分层零样本任务推理框架 分层规划与验证 显式物体状态推理加原子动作组合、代价排序与闭环执行验证;清板 10/10、抓放 10/10、金字塔堆叠 4/5 B 链接
WorldAgen 测试时世界模型训练 见可迁移方法 B 链接
ProWAM 进度条件化想象 见可迁移方法 B 链接
UniMPA 记忆-预测-动作统一 用动作接地的转移接口联合处理转移歧义、预测与执行不匹配、经验与实现不匹配 B 链接
An overview of 3D Vision-Language Models 3D VLM 综述 从 3D 表示编码到跨模态对比对齐与 3D VLLM 的教程式综述,含语言引导 3DGS B 链接

5.3 具身 VLA / 移动操作

工作 主题 一句话贡献 相关度 链接
VLA-Corrector 闭环恢复 见可迁移方法 B 链接
Where Success Breaks 失败边界学习 见可迁移方法 B 链接
FailureSpot 时间戳级失败检测 标注高效的时间戳级失败检测,面向长时程执行 B 链接
ActSafeGuard 硬约束保障 为流匹配策略提供可微且与训练对齐的约束施加 B 链接
Reasoning Without Inference Cost 训练期推理 用潜在语义支架在训练期获得推理收益,部署前丢弃以消除推理开销 B 链接
What Matters, When? 条件视觉落地 将视觉目标随操作阶段与任务状态变化的问题诊断为条件视觉落地 C 链接
RefGuard 指代身份落地 联合目标-锚点-参考系落地,处理同类物体重复与参考系依赖的空间词 C 链接
ICI-VLA 上下文模仿 用时空对齐演示实现少样本测试时适配,无需梯度更新 C 链接
GIFT 目标图像注入微调 以生成的目标图像作为高层视觉引导注入微调 C 链接
LayerRoute 层混合路由 按动作条件路由 VLM 不同层的视觉-语义表示 C 链接
IMLE-VLA 单步动作生成 用 IMLE 替代多步迭代采样,消除流匹配动作头的停-走运动 C 链接
FreqFM 频率条件流匹配 显式建模动作轨迹的频率异质性 C 链接
时频几何交叉注意力 分块动作解码 将动作块视为短多元轨迹,按频率与几何结构解码而非逐时间步线性头 C 链接
Large Discrete Policy 离散行为建模 从大规模物理合理候选词表中选择动作,替代连续去噪 C 链接
HuRo 人类视频预训练 系统检验机器人化的人类视频能否作为可扩展 VLA 预训练监督 C 链接
RoboDrop 后训练数据筛选 用局部梯度兼容性筛选后训练数据 C 链接
ZETA 跨本体零样本迁移 给出统一的零样本迁移定义与隔离本体变化的受控评测设置 C 链接
VLA-Precision 真机在线强化学习 非对称协同自举,缓解价值信号不可靠导致的策略漂移与大模型吞吐瓶颈 C 链接
HINT 长时程意图推断 从概括性指令推断人类意图并随视觉观测演化持续适配 C 链接
CR-VLA-Force 力感知柔顺控制 面向接触丰富操作的控制感知柔顺 VLA C 链接
FWBC-VLA 力感知全身补偿 为接触丰富的移动操作桥接语义动作生成与物理交互控制 C 链接
DeCAL 接触感知灵巧操作 接触感知的潜在共想象,处理严重视觉遮挡与复杂接触动力学 C 链接
GloVLA 全局几何加局部 VLA 拆分末端执行器长程转运与到达后的接触密集交互 C 链接
FolDeX 可变形物体基准 面向长时程可变形物体双臂操作的真机基准 C 链接
机器人策略的语言迁移度量 多语言 VLA 仅用机器翻译改写指令为 Cosmos3 VLA 添加希腊语,重点在度量工具的可靠性 C 链接

5.4 无人机、通信与其他低相关方向

工作 主题 一句话贡献 相关度 链接
AGC-VLN 空地协同 VLN 见可迁移方法 B 链接
AirAnchor 无人机零样本 VLN 见可迁移方法 B 链接
ComVLA 6G 分割推理 通信感知的 VLA 分割推理,适配无线链路带宽约束 C 链接
模态解耦联邦学习 6G 隐私保护 面向 6G 具身智能的模态解耦联邦学习 C 链接
少样本 VLM 软提示 域外目标检测 在航拍、工业、医疗等域外场景用软提示做十图少样本适配 C 链接

5.5 资讯与非论文

本期无资讯类条目。公众号源(we-mp-rss)新增 0 条,两个订阅号采集均因微信公众平台频控返回 0 条。

六、趋势判断与行动建议

趋势

  • 导航评测的假设正在被系统性拆解。 OVMAN 拆的是「场景在两次访问间不变」,NavArena 拆的是「只有 Habitat/MP3D 这类带标注数据集才能做闭环评测」,LIBERO-RECOVER 与 MEMOBench 拆的是「最终成功率足以概括能力」。四者方向不同但共同结果是:单一成功率数字的解释力在下降,报告中需要同时记录评测协议。
  • 「记忆有效性」从隐含假设变成显式建模对象。 OmniNav 的可更新 3D 物体记忆与失败搜索负证据、AirAnchor 的持久物体空间记忆、UniMPA 的视觉-动作记忆库、MEMOBench 的过程级记忆评测,四项工作分别从导航、空中导航、操作与评测四个角度处理同一件事。本报告判断:这是本期最集中的方法论收敛点。
  • 推理成本被当作一等约束而非事后优化。 O2C-Nav 压缩大模型调用次数、Reasoning Without Inference Cost 把推理收益搬到训练期、IMLE-VLA 消除多步采样、ComVLA 处理无线链路带宽限制,四项从不同层面攻同一问题。对真机导航部署,这类工作的实际价值可能高于基准分数的小幅提升。
  • 导航的「可通行性」定义开始与本体构型绑定。 TANGO 的全身适配与 OmniNav 把操作可达性纳入终点选择,都表明把机器人抽象成一个圆盘的做法在移动操作场景中已不够用。

研究空白

  • R2R-CE 上的零样本方法缺少统一的延迟-精度联合报告。 O2C-Nav 把调用次数作为卖点却未在摘要给出精度数值,而多数工作只报 SR/SPL 不报单步耗时,导致「更快但更差多少」无法判断。这是一个可以低成本切入的评测贡献。
  • 场景变化后的导航目前只有基准没有方法。 OVMAN 的参考智能体 45.2% 与预言机 99.5% 之间的差距,主要瓶颈被其误差分解归于开放词表实例落地。地面 VLN 中尚未见到专门处理「目标已不在原位」的方法工作。
  • 仿真到真机的导航迁移缺少量化对照。 TANGO 的真机结论为定性描述,OmniNav 的真机对照是开环基线。本期没有工作给出同一方法在仿真基准与真机上的成对数值。

建议动作

动作 目标 优先级
精读并复现 O2C-Nav:确认正文中的 R2R-CE/RxR-CE 数值与对照设置,实测单步端到端延迟;代码已公开
精读 OmniNav:拆解贝叶斯信念修正与负证据机制的具体形式,评估单独接入现有前沿探索模块的可行性
加入基准跟踪 OVMAN、NavArena:等待数据与工具发布,前者用于评估自研系统的地图老化问题,后者用于自有场地的闭环评测
跟踪 TANGO:正文公布后确认其 VLN 评测所用基准(摘要未指明是否属 R2R-CE 系列,不可默认可比);拆解仿真数据合成管线
作为选型参考阅读 No Free Checker:为导航系统的成功判定与运行时监控选择验证器类型
暂缓 仅报 LIBERO 且无失败恢复或真机证据的 VLA 方法类工作(本期 10 篇中的多数)——LIBERO-RECOVER 已指出该基准接近饱和

反馈