具身导航周报(2026-09-09 ~ 2026-09-17)

一、本期结论

  • VLM 在具身几何约束下的航点决策几乎不可用,而系统级工作流能把成绩拉到 52%。 这是本期最值得注意的一组对照。EgoPathBench 逐项测九个 VLM 的第一人称航点决策,最高 EgoPath Score 仅 28.3;在点代理几何下 Point Path 尚有 35.9% 成功率,一旦加上具身几何约束,Embodied Path 掉到 2.9%、Intent Path 4.0%。而 GPT-6-Astra 在 R2R-CE 上跑出 52.0% SR,靠的是观测—决策—执行的完整工作流加上下文管理。本报告判断:当前零样本导航的成绩主要由系统结构贡献,而非基础模型的空间能力;把 VLM 直接当航点规划器用,是在它最弱的能力上下注。
  • R2R-CE 仍是主战场,但评测协议碎裂到无法横向对比。 5 篇报 R2R-CE 却用了四套评测集:完整 val-unseen(GroundingVLN)、OpenNav 的 100 episode 协议(C2Nav)、该协议的前 50 条(GPT-6-Astra)、自定 550 条子集(LG-VLN)。把 GroundingVLN 的 69.9% SR 与 C2Nav 的 31.0% SR 并排解读会严重误导——前者是训练式方法在全量集上的结果,后者是零样本方法在百条子集上的。做对比前必须先对齐 episode 集合。
  • 「让 VLM 做比较而不是让它报数」正在成为一条可复用的设计原则。 C2Nav 的角色反转消融是本期方法论质量最高的实验:仅把提问形式从比较式换成基数/绝对式,SR 在空间、转移、终止三个决策位分别从 31.0% 掉到 12.0%、28.0%、21.0%。AnchorVLN 用 MCP 工具 schema 强制「VLM 提语义、几何定度量」(无工具接受米/弧度参数),得到同向证据——直接让模型估坐标时 45 题 0 题过阈值,几何锚定后过 10 题。GroundingVLN 的像素目标 + 几何规划器是同一思想在训练式路线上的实现。
  • 具身 Agent 运行时开始出现可部署的完整系统,不再只是框架图。 Harness Robotic OS 把机器人运行时、自主技能、认知 agent 运行时、交互与运维四个平面组织起来,并在住宅社区巡检真机上给出闭环数据:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警投递与结构化报告 99%。配合 Finder(agentic 闭环物体查找,Habitat/HM3D 上 1 m 成功率 +15.75 点)与 AeroWeaver(无人机集群 agent harness),本期首次能看出「agent harness 用于具身」这条线的轮廓。
  • 空间记忆分化出三条路线,且本期三条都有新工作。 ① 保留几何基础模型的注意力 KV 并按相关性裁剪(AdaGeoVLN);② 彻底放弃坐标,用视觉地点拓扑或持久时空图(Navi-Agent、HarnessVLN);③ 在全局时空记忆上训练潜在世界模型来预测未来地图与航点(GLAM),或把记忆压缩成段级计划再执行(Memory as Plans)。三条路线都声称在各自设定下达到 SOTA,彼此之间没有直接比较。
  • 本期覆盖口径已修正,与上期数字不可直接比较。 抓取配置在 2026-09-19 做了两处修复:补齐此前完全漏收的导航表述(robot / social / terrain / legged / egocentric navigation、waypoint),并新增具身 Agent / AgentOS 源。同一时间窗下,本期共入库 162 条,其中主池(导航 + 具身Agent)41 条——而修复前同窗口只抓到 70 条、真正相关的仅 14 条。本报告只对主池做分析,VLA·操作等次池见 5.4 速览。公众号源本期入库 0 条(Docker 未运行,且微信对该号长期频控),自 2026-09-05 起持续如此。

二、优先阅读清单

优先级 工作 任务/场景 核心贡献 关键证据 阅读理由
A1 GroundingVLN R2R-CE / RxR-CE(连续环境) 以视觉 grounding 作为推理与动作的共享接口;预测进度对齐的像素目标交给几何规划器 R2R-CE 69.9% SR、RxR-CE 75.1% SR;仅用最强基线 0.9% 训练数据;仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线 +20.1% 本期唯一在完整 R2R-CE 上报 SOTA 且样本效率有量级差的训练式方法
A2 EgoPathBench 第一人称航点决策评测 五任务基准,按候选可行性、相邻边合法性、目标到达三项评判,区分点代理与具身几何 九个 VLM 最高 EgoPath Score 28.3;Point Path 35.9% vs Embodied Path 2.9%、Intent Path 4.0%;31,852 训练 + 1,111 基准题;微调 Qwen 3.5 4B 使其分数由 3.9 升至 38.9 给出「基础模型空间能力」与「导航系统成绩」之间的落差刻度,是选型必读
A3 C2Nav 零样本 VLN-CE 训练无关;VLM 只在控制器构造的候选间做序数比较,几何/阈值/动作幅度留在机器人侧 OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 41.0% OSR / 31.0% SR / 16.7% SPL;换 GPT-5.5 达 54.0% / 44.0% / 29.0%;角色反转消融见结论三 接口设计的因果证据比性能数字更有价值,可直接迁移到自有 pipeline
A4 Harness Robotic OS 具身 Agent 运行时(四足巡检) 机器人运行时 / 自主技能 / 认知 agent 运行时 / 交互运维四平面;分层工作、情景、语义记忆;安全门控的自演化回路 住宅社区真机:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警与报告 99% 本期唯一给出完整真机闭环数据的具身 Agent 运行时,AgentOS 方向的参考实现
A5 GLAM ObjectNav(HM3D / Habitat) 在全局时空记忆上训练目标条件潜在世界模型,联合预测未来地图表征与机器人中心航点隐变量;JEPA 式潜在预测,不做 RGB 重建 在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线;摘要未给具体数值 空间记忆第三条路线的代表作,与 AdaGeoVLN / Navi-Agent 形成三方对照
A6 Finder 开放词表具身物体检索(Habitat/HM3D) agentic 闭环查找原语:带类型的循环状态串起查询条件规划、限定范围取证、候选验证与 accept/continue/abort 控制 Habitat/HM3D 与真实 RGB-D 场景上,平均 1 m 成功率较强基线 +15.75 点;同一原语可迁移到序列物体接地与具身物体中心问答 把 ObjectNav 从「静态检索」改造成「闭环取证」,机制清晰可移植
A7 HarnessVLN 离散 R2R / RxR / ObjectNav(HM3D) 训练无关 Agent Harness 统一指令跟随与目标物导航;分发前校验证据支持、几何可行性与子目标一致性 R2R 60.8%、RxR 53.9%、HM3D-v2 76.0%、HM3D-OVON 59.3% SR,称优于此前训练无关 SOTA;含人形机器人真机部署 注意是离散 R2R,不可与上述 R2R-CE 数字并列比较
A8 AdaGeoVLN R2R-CE / RxR-CE,单目 RGB 流式 GFM 分层特征按表征深度耦合策略各阶段;按指令相关性/几何置信/转移新颖度在有界预算内保留 VGGT 全局注意力 KV 摘要仅称「strong performance」,未提供可核验数字;消融结论为多深度耦合显著优于终端特征重复注入 机制层面对现有 GFM 用法构成反例;数字需等正式版核验
A9 Navi-Agent 零样本 VLN-CE,无定位单目 无坐标导航拓扑(节点=视觉地点、边=运动转移),支持近似自定位、进度校验与重访恢复 称在零样本 VLN-CE 基准与真机上达几何受限方法中的 SOTA,摘要未给具体数值 与 AdaGeoVLN 形成「要不要坐标」的路线对照
A10 UNI 轮式机器人导航数据采集 四轮助行器 + 手机采集受物理约束的人类演示,天然偏向轮式可通行路线 37.2 km 真实数据;留出 UNI 演示上轨迹预测误差降低 17.4–24.8%;闭环迁移到电动轮椅(路缘/楼梯/坡道口) 低成本绕开平台专属遥操作的数据路径,对地面平台直接可用

三、重点工作分析

1. EgoPathBench 与 GPT-6-Astra 对读:基础模型的空间能力,和导航系统的成绩,是两件事

这两篇单独看都容易读偏,放在一起才见全貌,故合并分析。

维度 分析
问题 同一个问题的两端。EgoPathBench 问:VLM 自身能不能从第一人称观测中选出可行且到达目标的航点序列。GPT-6-Astra 问:把一个通用大模型放进完整导航工作流、不做任何导航微调,系统整体能到什么水平。
方法 EgoPathBench 给出五任务基准,每题含第一人称 RGB、自然语言目标和编号的可见航点,模型返回可通行候选或有序路线;评判分候选可行性、相邻边合法性、目标到达三项,并区分点代理几何与具身几何。GPT-6-Astra 用标准观测—决策—执行工作流直接调 API,每次请求带入选定观测、执行反馈与保留的进度记录,评估对象是含上下文管理与动作控制的完整系统。
证据 EgoPathBench:九个 VLM 中最高 EgoPath Score 仅 28.3;排名第一的模型 Point Path 成功率 35.9%,但 Embodied Path 仅 2.9%、Intent Path 仅 4.0%。数据集含 31,852 训练题、1,345 验证题、1,111 基准题,每道路线题至少保留一条几何验证过的参考路线。用释出的训练集微调 Qwen 3.5 4B,其 EgoPath Score 由 3.9 升至 38.9,并在三个外部空间基准上普涨 1.4–9.6 点。GPT-6-Astra:Open-Nav 所用 100 条 R2R-CE val-unseen 中的前 50 条上,52.0% SR、48.9% SPL、70.8% nDTW;终止构成拆为 36.0% 工作流接受 STOP 而成功 + 16.0% 步数上限时满足距离判据。
价值 两组数字相差一个数量级,指向同一结论:当前零样本导航的成绩主要由系统结构贡献——候选构造、几何校验、上下文管理、执行反馈——而不是基础模型本身的空间智能。本报告判断这对技术选型有直接含义:把预算投在系统结构上的回报,目前显著高于换更强的 VLM。EgoPathBench 释出训练集这一点尤其实用,微调带来的 3.9→38.9 说明这项能力是可训的,只是没人训过。
局限 两者评测口径不同,不能相减:EgoPathBench 测的是单步/短程航点决策题,GPT-6-Astra 测的是完整 episode 的任务成功率;前者九模型、后者单模型 50 条 episode(1 条即 2 个百分点)。GPT-6-Astra 依赖闭源 API,成本与可复现性受制于供应商。
建议 EgoPathBench 高优先级精读并复现微调实验——它是本期唯一给出「这项能力可训」证据的工作。GPT-6-Astra 作为基线跟踪即可,但其终止构成的报告方式值得照搬。

2. GroundingVLN:把 grounding 当接口而非中间产物,样本效率出现量级差

维度 分析
问题 论文称存在两个耦合缺口:中间推理未显式锚定到视觉证据;高层决策缺少精确空间目标来指导底层运动。
方法 两段式使用 grounding:先「带 grounding 推理」,在结构化推理全过程把任务相关视觉证据锚到精确图像位置;再「经 grounding 行动」,预测与任务进度对齐的像素目标,由几何规划器翻译为基元动作。配套构建时序对齐的 grounded 推理轨迹数据集 GroundingCOTVLN-188K,并用 GEAR(Grounded and Execution-Aware RL)把 grounded 推理与空间决策对齐到下游执行。
证据 R2R-CE 69.9% SR、RxR-CE 75.1% SR,称为 SOTA;训练数据量为最强基线的 0.9%;跨数据集泛化上,仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线提升 20.1%。摘要未给出 SPL、nDTW 或基线方法名。
价值 像素目标 + 几何规划器的分工,与 C2Nav、AnchorVLN 的「语义归模型、度量归几何」是同一思想在训练式路线上的实现。0.9% 数据量若成立,意味着 grounded 监督的信息密度远高于纯轨迹监督——这与 EgoPathBench 的微调结论互相印证:航点/接地类监督的效率被长期低估。
局限 摘要未说明基线身份与评测 split 的完整设定,SOTA 声明暂无法独立核验;188K 数据集构造成本未披露;未见真机结果。
建议 高优先级精读。重点核验两件事:69.9% 对应的 val-unseen 是否为完整集;GEAR 的执行对齐奖励如何定义——这是「推理-执行脱节」的候选答案。

3. C2Nav:把 VLM 的回答形式从「报数」改成「比较」,本身就是性能来源

维度 分析
问题 现有零样本 VLN-CE 系统普遍向 VLM 索要基数型输出——路径点、像素、朝向、进度值或绝对到达判定,这把生成式回答直接耦合到几何量级或不可逆承诺上。
方法 训练无关框架,三个协同能力:Seeing 在物理上已校验的候选视角间做序数式 Gaze Election;Remembering 维护紧凑路线草图并比较相邻指令段假设;Arriving 组合犹豫阶梯、回看比较和可撤销走回来实现可靠停止。几何、阈值、动作幅度与执行全部留在机器人侧。
证据 OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 得 41.0% OSR / 31.0% SR / 16.7% SPL;同一接口换标准 GPT-5.5 得 54.0% / 44.0% / 29.0%。整能力消融:去掉 Seeing 后 SR 降至 14.0%,去掉 Remembering 降至 25.0%,去掉 Arriving 降至 29.0%。匹配的角色反转实验——只把比较式回答形式换成基数/绝对式提问——在空间、转移、终止三个决策位分别把 SR 压到 12.0%、28.0%、21.0%。论文结论是受约束的决策接口与更强的 VLM 推理二者互补而非可互相替代。
价值 角色反转把「接口形式」与「模型能力」两个混杂变量分开了,这在本期是独一份。结合 EgoPathBench 的 2.9% 看,这条结论更有分量:既然 VLM 在具身几何约束下的绝对判断如此之差,把它限制在序数比较上就不只是工程技巧,而是扬长避短的必然选择。
局限 100 episode 样本量小,单条 episode 权重 1%,消融间的百分点差异需谨慎解读;绝对 SR(31.0%/44.0%)距实用仍远;未见真机。
建议 精读并复现角色反转实验。在自有系统上先改 Arriving 一处(停止判定),代价最小。

4. Harness Robotic OS:具身 Agent 运行时第一次给出完整真机闭环数据

维度 分析
问题 可部署的自主巡检系统需要的不只是稳健导航,还要在一个可追溯的运行闭环里连接异构传感、可复用自主能力、多模态场景理解、人机交互与企业侧响应。现有四足巡检系统多用任务专用接口把这些功能拼起来,导致上下文协调、知识复用和受控适配都很困难。
方法 HROS 把系统划为机器人运行时、具身自主技能、认知 agent 运行时、交互与运维四个平面。共享上下文把物理状态与 agent 推理连起来;流式 ASR/TTS 支持语音任务交互;分层的工作记忆、情景记忆、语义记忆保存运行知识;安全门控的自演化回路把执行轨迹转成带版本的候选更新,不允许无约束的在线修改。Argos 原型集成 Vbot 四足、Fast-LIO2 定位建图、Hobot-Stereo 深度感知、PCT-Planner 全局规划、EGO-Planner 局部运动生成,以及 OpenClaw 编排的 Qwen3-VL 巡检分析。
证据 住宅物业环境实验:航点可达性 100%、室外定位误差低于 10 cm、局部避障响应延迟低于 200 ms、代表性危险检测率 85–95%、告警投递与结构化报告生成成功率 99%。
价值 这是本期唯一把「agent 架构」落到可测真机指标上的工作,也是用户关注的 AgentOS 方向的直接样本。三层记忆(工作/情景/语义)与安全门控自演化两个设计,对地面导航系统的长期运行有直接参考价值——尤其是「执行轨迹转成带版本的候选更新,不允许无约束在线修改」这条,它把持续学习的风险控制住了。
局限 场景为结构化的住宅社区巡检,任务是预定义巡检路线而非开放指令跟随,与 VLN 的任务分布差异大;报告的是系统集成指标(可达性、延迟、检测率),没有与其他 agent 架构的对照实验,无法判断各设计的独立贡献;未报告导航成功率这类可与 VLN 横向比较的指标。
建议 精读架构部分,重点是三层记忆的划分依据与自演化回路的安全门设计。不必复现整套系统——它的价值在架构组织方式,不在具体数字。

5. GLAM 与 Memory as Plans:空间记忆的第三条路线

维度 分析
问题 主动探索与语义导航要求智能体从局部观测建立记忆,预测已观测空间记忆的演化如何支撑未来运动,并把预测转成可执行计划。既有做法要么保留几何特征的原始形态(内存代价高),要么退化成无预测能力的拓扑图。
方法 GLAM 是目标条件的潜在世界模型,训练在全局时空记忆之上:给定历史地图 token、导航目标与当前位姿,联合预测未来地图表征与机器人中心的航点隐变量,使未来空间上下文与导航意图落在同一表示空间。它采用 JEPA 式潜在预测范式,直接作用于地图级潜在 token 而非 RGB 重建,并用预训练的航点编解码器在 GLAM NAV 中监督与解码导航计划。Memory as Plans(MaP-WAM)走另一条路:把记忆表示为含语言指令与稀疏视觉上下文的已完成段记录,转成紧凑计划(下一段级语言计划 + 对应视觉引导),由 World-Action-Progress 模型执行,联合预测动作块与执行进度。
证据 GLAM:训练数据由在 Habitat/HM3D v0.2 上回放 ObjectNav 专家轨迹、切成多时间尺度预测样本得到;在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线,摘要未给具体数值。MaP-WAM:RMBench 83.3% 成功率(称 SOTA),真机任务 78.0%,且执行器上下文长度固定、推理延迟随任务历史增长近似恒定。
价值 两者共同点是不把历史观测直接喂给执行器:GLAM 压进潜在地图 token 并预测其演化,MaP-WAM 压成段级计划。这对长程导航的意义是延迟不随 episode 增长——MaP-WAM 明确报告了这一点。GLAM 的「地图级潜在 token 而非 RGB 重建」与 AdaGeoVLN 的「保留 GFM 注意力 KV」构成有意思的对立:一个认为该在地图层抽象,一个认为该在特征层保真。
局限 GLAM 无公开数值,且基线是自行复现的 BSC-Nav,SOTA 与否无从判断;评测限于 HM3D-ObjectNav 的受控子集。MaP-WAM 的证据全部来自操作任务(RMBench + 真机操作),导航上未验证,其「段级计划」是否适配连续导航的细粒度决策存疑。
建议 GLAM 跟踪正式版与数值。MaP-WAM 的固定上下文长度 + KV 缓存设计可单独借鉴到导航执行器,这一步不依赖其任务设定。

四、可迁移方法

只收录迁移路径能说清楚的次池工作。

来源方向 工作 可迁移机制 可接入地面导航的位置 风险/前提
VLA 推理效率 VLA-ULAP 云端大模型调用与本地超轻量动作预测器交替;ULAP 约 7.4M 参数(含冻结视觉编码器),独立训练,不需 VLA 隐状态、在线验证或服务器往返 导航决策层:远端 VLM 只在关键决策点调用,直行/微调航向由本地预测器接管 数字全部来自操作任务,48.8–76.7% 的调用跳过率在导航长程依赖下能否维持未经验证
VLA 架构 DEM(解耦) 分离的视觉/语言编码器条件化一个紧凑动作头,替代每步跑数十亿参数 VLM 骨干;MeanFlow 头单次前向出动作块 语言条件化的导航策略主干,尤其算力受限的车载平台 结论限定在「已训练任务」范围内;RoboCasa 18 任务与导航的任务分布差异大
VLA 推理效率 rMuscle 跨执行相似性的双阶段缓存:Context Cache 复用视觉 token 输出降计算,Action Cache 复用神经元激活模式降权重访问 固定巡逻路线、重复往返等结构化导航场景的推理加速 前提是任务重复性高;开放环境导航的观测相似度远低于工厂工位
VLA 架构 What Makes an Efficient VLA 动作头性能主要由初始化而非解码器架构决定;把语言骨干最后若干 transformer 层拷入动作头是最大杠杆,且零延迟代价 任何自建 VLA 式导航策略的动作头初始化 论文自述这是最能组织其测量结果的解释而非已证因果
评测方法论 LIBERO-CTRL 配对式复合鲁棒性评测:对同一初始状态配对单轴与同时扰动条件,区分「涌现失败」与「补偿成功」 导航鲁棒性评测:光照×布局×动态障碍等多轴同时扰动 核心发现是两类转移在聚合统计中相互抵消——最多 29.0%(最严重条件 34.5%)的配对初始状态结果翻转却不体现在总成功率上,必须按实例配对记录
安全性 Beyond Patch Removal 状态恢复协议:在匹配的动作块边界移除对抗补丁,在相同剩余步数预算下测量可恢复性 导航策略的对抗鲁棒性评估与恢复适配器设计 证据来自 LIBERO-Long:OpenVLA-OFT 遭 EDPA 攻击后仅 36.2% episode 在五个 chunk 后可恢复(对照组 89.9% / 87.0%);恢复适配器在一个 chunk 延迟下把恢复率从 7.7% 提到 47.4%,延迟增大后收益明显下降
综述 World-Action Models 综述 耦合未来世界预测与可执行动作生成的统一分类法,覆盖表征、转移建模、动作接口、训练流程与扩展策略,并单列导航应用 WAM 路线进入导航的入口文献 综述性质,无自有实验;项目页 https://rcl-robotics.github.io/Awesome-World-Action-Models

五、分类速览

5.1 地面 VLN / ObjectNav / 语义导航

工作 主题 一句话贡献 链接
GroundingVLN R2R-CE / RxR-CE 见重点分析 链接
C2Nav 零样本 VLN-CE 见重点分析 链接
AdaGeoVLN R2R-CE / RxR-CE GFM 分层特征按表征深度耦合策略各阶段 + 有界 KV 保留 链接
GPT-6-Astra 工作流 零样本 VLN-CE 见重点分析 链接
GLAM ObjectNav(HM3D) 见重点分析 链接
HarnessVLN 离散 R2R/RxR + ObjectNav Agent Harness 分发前校验证据、几何可行性与子目标一致性,统一两类导航任务 链接
Navi-Agent 零样本 VLN-CE 无坐标视觉地点拓扑替代几何定位,支持进度校验与重访恢复 链接
LG-VLN 零样本 VLN-CE,单目 共享 CleanDIFT 稠密特征打通几何与语义,LangGraph 组织为有向状态图;自定 550 episode R2R-CE val-unseen 子集上 21.3% SR、12.1% SPL 链接
AnchorVLN 开放词表 VLN MCP 工具 schema 强制「VLM 提语义、几何定度量」;CMU VLN Challenge 2026 指令跟随 64.4%,去掉控制器建模降 13.3 点;物体指代 45 题中几何锚定过阈 10 题、直接估坐标 0 题 链接
TADreamer 陆空双模态零样本导航 用生成视频想象导航,再经两阶段标定恢复度量一致的 3D 航点与运动模式 链接
CueNav 通用机器人导航 BEV 地图传全局任务上下文、保留部分机体暴露具身上下文,引导视频规划;IDM 把稠密光流转成动作 链接
RoboFind 个性化物体搜索(无障碍) 手机教目标、四足执行搜索;教学 agent 产出语义目标画像与多视角参考库,供后续任务复用 链接
LEAP 四足导航 + 主动感知 不改任务目标、不加覆盖率/好奇心代理奖励,仅靠地形课程的任务压力使注视控制自发涌现 链接

5.2 具身 Agent / AgentOS(本期新覆盖方向)

本方向此前未纳入抓取,本期首次系统收录,故单列一节。除上文已分析的 Harness Robotic OS、Finder、GLAM、Memory as Plans 外:

工作 主题 核心贡献 可核验证据 与地面导航的关系
AeroWeaver 无人机集群 agent harness 把语义决策连到受治理的技能;角色条件化的本地 agent 做分布式协调;用角色索引的状态-动作-奖励经验在线精化技能选择 称在测试条件下保持有效技能执行,支持无中央 agent 的机体本地多机操作;奖励引导的在线更新提供免训练的适配路径。未给量化指标 「受治理技能 + 在线经验精化」的组织方式可迁移;但集群与单机地面导航的协调需求差异大
DeliveryGym 长程具身 agent 规划环境 面向长程具身规划的 RL 环境 未在摘要中给出基线成绩 长程任务分解的训练环境,与导航的长程性质相关
Embodied-BenchForge 具身基准自动构建 闭环基准合成:前向工件合成 + 反向验证修复;技能编排的工件合成配合工件依赖图,防止局部缺陷向下游传播 未在摘要中给出量化结果 若要自建导航评测集,其「逐工件验证而非端到端交付」的思路值得借鉴
EmbodiedMind 数据筛选与 RL 自适应数据筛选 + 前缀树强化学习 摘要未提供可核验数字 训练侧方法,与导航任务无直接绑定
STAGE 具身执行的语义迁移诊断 诊断语义在接地执行处的迁移情况 基准为 LIBERO(操作) 诊断方法可参考,证据来自操作任务
SIMLIFE 长程人机协作 长程人-agent 协作中的模式理解 摘要未提供可核验数字 人机协作场景,与社会导航有弱关联
ReactHuman 物理接地基准 类人反应式决策的物理接地基准 摘要未提供可核验数字 反应式决策评测,与动态避障弱相关
Autonomy, Social Norms, and Alignment 理论框架 自主性、社会规范与对齐的发展性框架 理论工作,无实验 偏理论,仅作领域观察
Exploring 2D backbone effects 室内语义占据预测 考察 2D 骨干网络对室内语义占据预测的影响 摘要未提供可核验数字 语义地图的上游感知模块

5.3 记忆、地图、规划与评测

工作 主题 一句话贡献 链接
EgoPathBench 航点决策评测 见重点分析 链接
ENCP VLN 不确定性 Episode 归一化共形预测,为变长依赖导航序列恢复逐步覆盖保证 链接
UDAV 越野航点规划不确定性 多次随机采样取 medoid 作自洽标称路线,用空间离散度估不确定性,超阈值才触发重议;400 条留出查询上平均 ADE 由 147.4 降至 110.4 像素(-25.1%) 链接
UNI 导航数据采集 助行器 + 手机的无机器人采集,物理约束天然筛出轮式可行路线 链接
Feeling Terrain Before Crossing 越野导航世界模型 过地形前先「感受」,用世界模型预判可通过性 链接
TRACER 多机器人社会导航 双向滚动时域,分离单机器人效应与非可加成对交互,按身份维持对响应模式的持久信念;SocialGym2 上提升无碰撞完成率 链接
PRISM 社会导航 交互风格与运动的预测性表征 链接
Mobile Multi-Robot Navigation 多机器人导航 用 Koopman 算子处理运行时不确定性 链接
Learning Safe Humanoid Navigation 人形导航 从降阶模型学习安全导航 链接
Tuning ROS 2 for Energy-Efficient Navigation 系统调优 ROS 2 导航栈的能效调参实证 链接
Task-Oriented Active Learning of Residual Dynamics MPC 面向任务的残差动力学主动学习 链接
Steering with Lexicographic Preferences 部署期偏好 字典序偏好引导生成式策略,策略权重不变;论文称在一个导航基准上验证有效 链接
OHRID-Retail 数据集 零售环境人类活动的开放多模态数据集 链接
SwarmNxt 集群平台 开源软硬件集群平台 链接
Custom PX4 firmware 陆空两栖 面向自主陆空混合任务的 PX4 固件定制 链接
UAVs Meet Embodied Intelligence 无人机具身智能 用物理-数字 AI 智能体桥接人类意图与飞行动力学 链接

5.4 次池速览(VLA·操作 / 自动驾驶 / 其他)

本期窗口共 162 条,主池 41 条已在上文覆盖;其余 121 条按「领域」字段归入次池,不做深度分析。分布为:VLA·操作 65 条、其他 50 条、自动驾驶 6 条。

VLA·操作池中与导航有潜在迁移价值的,已在第四节「可迁移方法」列出。其余为机械臂、力控、灵巧手、遥操作、水下双臂、实验室自动化等纯操作工作,以及动作分词、RL 微调、联邦训练等训练侧方法,本期均无导航侧验证,不逐条展开。完整清单见 index.md 中「领域」列。

六、趋势判断与行动建议

趋势

  • 系统结构而非模型能力,是当前零样本导航成绩的主要来源。 EgoPathBench 的 2.9%(具身几何下的航点决策)与 GPT-6-Astra 的 52.0%(完整工作流下的 episode 成功率)相差一个数量级;C2Nav 的角色反转进一步显示,同一模型换回基数式提问会掉 19 个百分点,而同一接口换更强模型只涨 13 个百分点。三者共同支持同一判断。
  • 空间记忆从「存什么」转向「预测什么」。 本期三条路线中,GLAM 直接预测未来地图表征与航点隐变量,Memory as Plans 把记忆转成段级计划,二者都不再把历史观测喂给执行器;AdaGeoVLN 的有界 KV 保留与 Navi-Agent 的无坐标拓扑则仍属「存什么」的优化。预测式记忆的一个可测好处是延迟不随 episode 增长,MaP-WAM 明确报告了这一点。
  • agent harness 正在从通用 LLM 领域外溢到具身系统。 本期出现 HarnessVLN(导航)、Harness Robotic OS(四足巡检运行时)、AeroWeaver(无人机集群)三个独立的 harness 工作,共同模式是:在分发动作前做一层校验(证据支持、几何可行性、子目标一致性、受治理技能),并维护跨步骤的共享状态与分层记忆。Harness Robotic OS 的安全门控自演化回路是其中唯一处理了「持续更新的风险控制」的。
  • 评测方法论本身成为独立研究对象。 EgoPathBench 指出现有空间智能基准只测孤立判断、测不出整合的导航能力;ENCP 指出标准共形预测在变长依赖 episode 上的覆盖保证失效;GPT-6-Astra 把成功率拆成主动停止与触底判定;Embodied-BenchForge 则直接把基准构建本身 agent 化并加逐工件验证。

研究空白

  • R2R-CE 的零样本评测缺少公认协议。 本期四种子集并存,且无一篇报告与其他子集的换算或重叠关系,使得「零样本 VLN-CE 当前到了什么水平」在文献层面无法回答。
  • 停止判定仍是最薄弱的单一环节,且缺少专门指标。 GPT-6-Astra 的 16.0% 触底成功、C2Nav 去掉 Arriving 后 SR 从 31.0% 降到 29.0% 都指向这里,但除这两篇外本期无人单独报告停止相关指标。
  • 具身 Agent 的架构设计缺少对照实验。 本期三个 harness 工作都只报系统整体指标,没有一个做过「去掉某一层校验/某一类记忆」的消融,因此无法判断各设计的独立贡献——这与 C2Nav 在导航侧的做法形成鲜明对比。
  • 效率工作与导航任务之间存在验证断层。 次池中的推理效率工作全部在 LIBERO 类操作基准上验证,无一在 VLN-CE 上测过。

建议动作

动作 目标 优先级
精读并复现 EgoPathBench 的微调实验(Qwen 3.5 4B 由 3.9 升至 38.9)——本期唯一证明「具身航点决策可训」的工作
精读 GroundingVLN:核验 69.9% SR 对应的 split 完整性与基线身份;拆解 GEAR 的执行对齐奖励设计
精读并局部复现 C2Nav 的角色反转实验;优先在自有系统的停止判定环节改用比较式提问
建立跟踪表 为 R2R-CE 结果建立「评测子集 + episode 数 + 是否零样本」三列登记表,杜绝跨协议数字直接比较
精读架构 Harness Robotic OS 的三层记忆划分与安全门控自演化回路;不必复现整套系统
最小验证 AdaGeoVLN 的多深度 GFM 耦合:把单点终端特征注入改为早/中/晚三点耦合,不依赖其代码
指标改造 在自有评测中固定拆分「主动 STOP 成功」与「步数上限触底成功」,参照 GPT-6-Astra
跟踪 GLAM 与 Finder 的正式版数值与代码释出;二者分别代表预测式记忆与闭环取证两条路线
跟踪 UNI 的助行器采集范式,评估是否适用于自有轮式平台的数据补充
暂缓 次池全部 VLA 推理效率工作——机制可借鉴,但在 VLN-CE 上的有效性未经任何验证

反馈