一、本期结论
- VLM 在具身几何约束下的航点决策几乎不可用,而系统级工作流能把成绩拉到 52%。 这是本期最值得注意的一组对照。EgoPathBench 逐项测九个 VLM 的第一人称航点决策,最高 EgoPath Score 仅 28.3;在点代理几何下 Point Path 尚有 35.9% 成功率,一旦加上具身几何约束,Embodied Path 掉到 2.9%、Intent Path 4.0%。而 GPT-6-Astra 在 R2R-CE 上跑出 52.0% SR,靠的是观测—决策—执行的完整工作流加上下文管理。本报告判断:当前零样本导航的成绩主要由系统结构贡献,而非基础模型的空间能力;把 VLM 直接当航点规划器用,是在它最弱的能力上下注。
- R2R-CE 仍是主战场,但评测协议碎裂到无法横向对比。 5 篇报 R2R-CE 却用了四套评测集:完整 val-unseen(GroundingVLN)、OpenNav 的 100 episode 协议(C2Nav)、该协议的前 50 条(GPT-6-Astra)、自定 550 条子集(LG-VLN)。把 GroundingVLN 的 69.9% SR 与 C2Nav 的 31.0% SR 并排解读会严重误导——前者是训练式方法在全量集上的结果,后者是零样本方法在百条子集上的。做对比前必须先对齐 episode 集合。
- 「让 VLM 做比较而不是让它报数」正在成为一条可复用的设计原则。 C2Nav 的角色反转消融是本期方法论质量最高的实验:仅把提问形式从比较式换成基数/绝对式,SR 在空间、转移、终止三个决策位分别从 31.0% 掉到 12.0%、28.0%、21.0%。AnchorVLN 用 MCP 工具 schema 强制「VLM 提语义、几何定度量」(无工具接受米/弧度参数),得到同向证据——直接让模型估坐标时 45 题 0 题过阈值,几何锚定后过 10 题。GroundingVLN 的像素目标 + 几何规划器是同一思想在训练式路线上的实现。
- 具身 Agent 运行时开始出现可部署的完整系统,不再只是框架图。 Harness Robotic OS 把机器人运行时、自主技能、认知 agent 运行时、交互与运维四个平面组织起来,并在住宅社区巡检真机上给出闭环数据:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警投递与结构化报告 99%。配合 Finder(agentic 闭环物体查找,Habitat/HM3D 上 1 m 成功率 +15.75 点)与 AeroWeaver(无人机集群 agent harness),本期首次能看出「agent harness 用于具身」这条线的轮廓。
- 空间记忆分化出三条路线,且本期三条都有新工作。 ① 保留几何基础模型的注意力 KV 并按相关性裁剪(AdaGeoVLN);② 彻底放弃坐标,用视觉地点拓扑或持久时空图(Navi-Agent、HarnessVLN);③ 在全局时空记忆上训练潜在世界模型来预测未来地图与航点(GLAM),或把记忆压缩成段级计划再执行(Memory as Plans)。三条路线都声称在各自设定下达到 SOTA,彼此之间没有直接比较。
- 本期覆盖口径已修正,与上期数字不可直接比较。 抓取配置在 2026-09-19 做了两处修复:补齐此前完全漏收的导航表述(robot / social / terrain / legged / egocentric navigation、waypoint),并新增具身 Agent / AgentOS 源。同一时间窗下,本期共入库 162 条,其中主池(导航 + 具身Agent)41 条——而修复前同窗口只抓到 70 条、真正相关的仅 14 条。本报告只对主池做分析,VLA·操作等次池见 5.4 速览。公众号源本期入库 0 条(Docker 未运行,且微信对该号长期频控),自 2026-09-05 起持续如此。
二、优先阅读清单
| 优先级 | 工作 | 任务/场景 | 核心贡献 | 关键证据 | 阅读理由 |
|---|---|---|---|---|---|
| A1 | GroundingVLN | R2R-CE / RxR-CE(连续环境) | 以视觉 grounding 作为推理与动作的共享接口;预测进度对齐的像素目标交给几何规划器 | R2R-CE 69.9% SR、RxR-CE 75.1% SR;仅用最强基线 0.9% 训练数据;仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线 +20.1% | 本期唯一在完整 R2R-CE 上报 SOTA 且样本效率有量级差的训练式方法 |
| A2 | EgoPathBench | 第一人称航点决策评测 | 五任务基准,按候选可行性、相邻边合法性、目标到达三项评判,区分点代理与具身几何 | 九个 VLM 最高 EgoPath Score 28.3;Point Path 35.9% vs Embodied Path 2.9%、Intent Path 4.0%;31,852 训练 + 1,111 基准题;微调 Qwen 3.5 4B 使其分数由 3.9 升至 38.9 | 给出「基础模型空间能力」与「导航系统成绩」之间的落差刻度,是选型必读 |
| A3 | C2Nav | 零样本 VLN-CE | 训练无关;VLM 只在控制器构造的候选间做序数比较,几何/阈值/动作幅度留在机器人侧 | OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 41.0% OSR / 31.0% SR / 16.7% SPL;换 GPT-5.5 达 54.0% / 44.0% / 29.0%;角色反转消融见结论三 | 接口设计的因果证据比性能数字更有价值,可直接迁移到自有 pipeline |
| A4 | Harness Robotic OS | 具身 Agent 运行时(四足巡检) | 机器人运行时 / 自主技能 / 认知 agent 运行时 / 交互运维四平面;分层工作、情景、语义记忆;安全门控的自演化回路 | 住宅社区真机:航点可达性 100%、室外定位误差 <10 cm、局部避障响应 <200 ms、危险检测 85–95%、告警与报告 99% | 本期唯一给出完整真机闭环数据的具身 Agent 运行时,AgentOS 方向的参考实现 |
| A5 | GLAM | ObjectNav(HM3D / Habitat) | 在全局时空记忆上训练目标条件潜在世界模型,联合预测未来地图表征与机器人中心航点隐变量;JEPA 式潜在预测,不做 RGB 重建 | 在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线;摘要未给具体数值 | 空间记忆第三条路线的代表作,与 AdaGeoVLN / Navi-Agent 形成三方对照 |
| A6 | Finder | 开放词表具身物体检索(Habitat/HM3D) | agentic 闭环查找原语:带类型的循环状态串起查询条件规划、限定范围取证、候选验证与 accept/continue/abort 控制 | Habitat/HM3D 与真实 RGB-D 场景上,平均 1 m 成功率较强基线 +15.75 点;同一原语可迁移到序列物体接地与具身物体中心问答 | 把 ObjectNav 从「静态检索」改造成「闭环取证」,机制清晰可移植 |
| A7 | HarnessVLN | 离散 R2R / RxR / ObjectNav(HM3D) | 训练无关 Agent Harness 统一指令跟随与目标物导航;分发前校验证据支持、几何可行性与子目标一致性 | R2R 60.8%、RxR 53.9%、HM3D-v2 76.0%、HM3D-OVON 59.3% SR,称优于此前训练无关 SOTA;含人形机器人真机部署 | 注意是离散 R2R,不可与上述 R2R-CE 数字并列比较 |
| A8 | AdaGeoVLN | R2R-CE / RxR-CE,单目 RGB 流式 | GFM 分层特征按表征深度耦合策略各阶段;按指令相关性/几何置信/转移新颖度在有界预算内保留 VGGT 全局注意力 KV | 摘要仅称「strong performance」,未提供可核验数字;消融结论为多深度耦合显著优于终端特征重复注入 | 机制层面对现有 GFM 用法构成反例;数字需等正式版核验 |
| A9 | Navi-Agent | 零样本 VLN-CE,无定位单目 | 无坐标导航拓扑(节点=视觉地点、边=运动转移),支持近似自定位、进度校验与重访恢复 | 称在零样本 VLN-CE 基准与真机上达几何受限方法中的 SOTA,摘要未给具体数值 | 与 AdaGeoVLN 形成「要不要坐标」的路线对照 |
| A10 | UNI | 轮式机器人导航数据采集 | 四轮助行器 + 手机采集受物理约束的人类演示,天然偏向轮式可通行路线 | 37.2 km 真实数据;留出 UNI 演示上轨迹预测误差降低 17.4–24.8%;闭环迁移到电动轮椅(路缘/楼梯/坡道口) | 低成本绕开平台专属遥操作的数据路径,对地面平台直接可用 |
三、重点工作分析
1. EgoPathBench 与 GPT-6-Astra 对读:基础模型的空间能力,和导航系统的成绩,是两件事
这两篇单独看都容易读偏,放在一起才见全貌,故合并分析。
| 维度 | 分析 |
|---|---|
| 问题 | 同一个问题的两端。EgoPathBench 问:VLM 自身能不能从第一人称观测中选出可行且到达目标的航点序列。GPT-6-Astra 问:把一个通用大模型放进完整导航工作流、不做任何导航微调,系统整体能到什么水平。 |
| 方法 | EgoPathBench 给出五任务基准,每题含第一人称 RGB、自然语言目标和编号的可见航点,模型返回可通行候选或有序路线;评判分候选可行性、相邻边合法性、目标到达三项,并区分点代理几何与具身几何。GPT-6-Astra 用标准观测—决策—执行工作流直接调 API,每次请求带入选定观测、执行反馈与保留的进度记录,评估对象是含上下文管理与动作控制的完整系统。 |
| 证据 | EgoPathBench:九个 VLM 中最高 EgoPath Score 仅 28.3;排名第一的模型 Point Path 成功率 35.9%,但 Embodied Path 仅 2.9%、Intent Path 仅 4.0%。数据集含 31,852 训练题、1,345 验证题、1,111 基准题,每道路线题至少保留一条几何验证过的参考路线。用释出的训练集微调 Qwen 3.5 4B,其 EgoPath Score 由 3.9 升至 38.9,并在三个外部空间基准上普涨 1.4–9.6 点。GPT-6-Astra:Open-Nav 所用 100 条 R2R-CE val-unseen 中的前 50 条上,52.0% SR、48.9% SPL、70.8% nDTW;终止构成拆为 36.0% 工作流接受 STOP 而成功 + 16.0% 步数上限时满足距离判据。 |
| 价值 | 两组数字相差一个数量级,指向同一结论:当前零样本导航的成绩主要由系统结构贡献——候选构造、几何校验、上下文管理、执行反馈——而不是基础模型本身的空间智能。本报告判断这对技术选型有直接含义:把预算投在系统结构上的回报,目前显著高于换更强的 VLM。EgoPathBench 释出训练集这一点尤其实用,微调带来的 3.9→38.9 说明这项能力是可训的,只是没人训过。 |
| 局限 | 两者评测口径不同,不能相减:EgoPathBench 测的是单步/短程航点决策题,GPT-6-Astra 测的是完整 episode 的任务成功率;前者九模型、后者单模型 50 条 episode(1 条即 2 个百分点)。GPT-6-Astra 依赖闭源 API,成本与可复现性受制于供应商。 |
| 建议 | EgoPathBench 高优先级精读并复现微调实验——它是本期唯一给出「这项能力可训」证据的工作。GPT-6-Astra 作为基线跟踪即可,但其终止构成的报告方式值得照搬。 |
2. GroundingVLN:把 grounding 当接口而非中间产物,样本效率出现量级差
| 维度 | 分析 |
|---|---|
| 问题 | 论文称存在两个耦合缺口:中间推理未显式锚定到视觉证据;高层决策缺少精确空间目标来指导底层运动。 |
| 方法 | 两段式使用 grounding:先「带 grounding 推理」,在结构化推理全过程把任务相关视觉证据锚到精确图像位置;再「经 grounding 行动」,预测与任务进度对齐的像素目标,由几何规划器翻译为基元动作。配套构建时序对齐的 grounded 推理轨迹数据集 GroundingCOTVLN-188K,并用 GEAR(Grounded and Execution-Aware RL)把 grounded 推理与空间决策对齐到下游执行。 |
| 证据 | R2R-CE 69.9% SR、RxR-CE 75.1% SR,称为 SOTA;训练数据量为最强基线的 0.9%;跨数据集泛化上,仅用 R2R 训练时 RxR-CE 达 59.9% SR,较最强基线提升 20.1%。摘要未给出 SPL、nDTW 或基线方法名。 |
| 价值 | 像素目标 + 几何规划器的分工,与 C2Nav、AnchorVLN 的「语义归模型、度量归几何」是同一思想在训练式路线上的实现。0.9% 数据量若成立,意味着 grounded 监督的信息密度远高于纯轨迹监督——这与 EgoPathBench 的微调结论互相印证:航点/接地类监督的效率被长期低估。 |
| 局限 | 摘要未说明基线身份与评测 split 的完整设定,SOTA 声明暂无法独立核验;188K 数据集构造成本未披露;未见真机结果。 |
| 建议 | 高优先级精读。重点核验两件事:69.9% 对应的 val-unseen 是否为完整集;GEAR 的执行对齐奖励如何定义——这是「推理-执行脱节」的候选答案。 |
3. C2Nav:把 VLM 的回答形式从「报数」改成「比较」,本身就是性能来源
| 维度 | 分析 |
|---|---|
| 问题 | 现有零样本 VLN-CE 系统普遍向 VLM 索要基数型输出——路径点、像素、朝向、进度值或绝对到达判定,这把生成式回答直接耦合到几何量级或不可逆承诺上。 |
| 方法 | 训练无关框架,三个协同能力:Seeing 在物理上已校验的候选视角间做序数式 Gaze Election;Remembering 维护紧凑路线草图并比较相邻指令段假设;Arriving 组合犹豫阶梯、回看比较和可撤销走回来实现可靠停止。几何、阈值、动作幅度与执行全部留在机器人侧。 |
| 证据 | OpenNav R2R-CE 100 协议:Qwen3-VL-8B-Instruct 得 41.0% OSR / 31.0% SR / 16.7% SPL;同一接口换标准 GPT-5.5 得 54.0% / 44.0% / 29.0%。整能力消融:去掉 Seeing 后 SR 降至 14.0%,去掉 Remembering 降至 25.0%,去掉 Arriving 降至 29.0%。匹配的角色反转实验——只把比较式回答形式换成基数/绝对式提问——在空间、转移、终止三个决策位分别把 SR 压到 12.0%、28.0%、21.0%。论文结论是受约束的决策接口与更强的 VLM 推理二者互补而非可互相替代。 |
| 价值 | 角色反转把「接口形式」与「模型能力」两个混杂变量分开了,这在本期是独一份。结合 EgoPathBench 的 2.9% 看,这条结论更有分量:既然 VLM 在具身几何约束下的绝对判断如此之差,把它限制在序数比较上就不只是工程技巧,而是扬长避短的必然选择。 |
| 局限 | 100 episode 样本量小,单条 episode 权重 1%,消融间的百分点差异需谨慎解读;绝对 SR(31.0%/44.0%)距实用仍远;未见真机。 |
| 建议 | 精读并复现角色反转实验。在自有系统上先改 Arriving 一处(停止判定),代价最小。 |
4. Harness Robotic OS:具身 Agent 运行时第一次给出完整真机闭环数据
| 维度 | 分析 |
|---|---|
| 问题 | 可部署的自主巡检系统需要的不只是稳健导航,还要在一个可追溯的运行闭环里连接异构传感、可复用自主能力、多模态场景理解、人机交互与企业侧响应。现有四足巡检系统多用任务专用接口把这些功能拼起来,导致上下文协调、知识复用和受控适配都很困难。 |
| 方法 | HROS 把系统划为机器人运行时、具身自主技能、认知 agent 运行时、交互与运维四个平面。共享上下文把物理状态与 agent 推理连起来;流式 ASR/TTS 支持语音任务交互;分层的工作记忆、情景记忆、语义记忆保存运行知识;安全门控的自演化回路把执行轨迹转成带版本的候选更新,不允许无约束的在线修改。Argos 原型集成 Vbot 四足、Fast-LIO2 定位建图、Hobot-Stereo 深度感知、PCT-Planner 全局规划、EGO-Planner 局部运动生成,以及 OpenClaw 编排的 Qwen3-VL 巡检分析。 |
| 证据 | 住宅物业环境实验:航点可达性 100%、室外定位误差低于 10 cm、局部避障响应延迟低于 200 ms、代表性危险检测率 85–95%、告警投递与结构化报告生成成功率 99%。 |
| 价值 | 这是本期唯一把「agent 架构」落到可测真机指标上的工作,也是用户关注的 AgentOS 方向的直接样本。三层记忆(工作/情景/语义)与安全门控自演化两个设计,对地面导航系统的长期运行有直接参考价值——尤其是「执行轨迹转成带版本的候选更新,不允许无约束在线修改」这条,它把持续学习的风险控制住了。 |
| 局限 | 场景为结构化的住宅社区巡检,任务是预定义巡检路线而非开放指令跟随,与 VLN 的任务分布差异大;报告的是系统集成指标(可达性、延迟、检测率),没有与其他 agent 架构的对照实验,无法判断各设计的独立贡献;未报告导航成功率这类可与 VLN 横向比较的指标。 |
| 建议 | 精读架构部分,重点是三层记忆的划分依据与自演化回路的安全门设计。不必复现整套系统——它的价值在架构组织方式,不在具体数字。 |
5. GLAM 与 Memory as Plans:空间记忆的第三条路线
| 维度 | 分析 |
|---|---|
| 问题 | 主动探索与语义导航要求智能体从局部观测建立记忆,预测已观测空间记忆的演化如何支撑未来运动,并把预测转成可执行计划。既有做法要么保留几何特征的原始形态(内存代价高),要么退化成无预测能力的拓扑图。 |
| 方法 | GLAM 是目标条件的潜在世界模型,训练在全局时空记忆之上:给定历史地图 token、导航目标与当前位姿,联合预测未来地图表征与机器人中心的航点隐变量,使未来空间上下文与导航意图落在同一表示空间。它采用 JEPA 式潜在预测范式,直接作用于地图级潜在 token 而非 RGB 重建,并用预训练的航点编解码器在 GLAM NAV 中监督与解码导航计划。Memory as Plans(MaP-WAM)走另一条路:把记忆表示为含语言指令与稀疏视觉上下文的已完成段记录,转成紧凑计划(下一段级语言计划 + 对应视觉引导),由 World-Action-Progress 模型执行,联合预测动作块与执行进度。 |
| 证据 | GLAM:训练数据由在 Habitat/HM3D v0.2 上回放 ObjectNav 专家轨迹、切成多时间尺度预测样本得到;在受控的 HM3D-ObjectNav 子集复现设定下,SR 与 SPL 均优于复现的 BSC-Nav 基线,摘要未给具体数值。MaP-WAM:RMBench 83.3% 成功率(称 SOTA),真机任务 78.0%,且执行器上下文长度固定、推理延迟随任务历史增长近似恒定。 |
| 价值 | 两者共同点是不把历史观测直接喂给执行器:GLAM 压进潜在地图 token 并预测其演化,MaP-WAM 压成段级计划。这对长程导航的意义是延迟不随 episode 增长——MaP-WAM 明确报告了这一点。GLAM 的「地图级潜在 token 而非 RGB 重建」与 AdaGeoVLN 的「保留 GFM 注意力 KV」构成有意思的对立:一个认为该在地图层抽象,一个认为该在特征层保真。 |
| 局限 | GLAM 无公开数值,且基线是自行复现的 BSC-Nav,SOTA 与否无从判断;评测限于 HM3D-ObjectNav 的受控子集。MaP-WAM 的证据全部来自操作任务(RMBench + 真机操作),导航上未验证,其「段级计划」是否适配连续导航的细粒度决策存疑。 |
| 建议 | GLAM 跟踪正式版与数值。MaP-WAM 的固定上下文长度 + KV 缓存设计可单独借鉴到导航执行器,这一步不依赖其任务设定。 |
四、可迁移方法
只收录迁移路径能说清楚的次池工作。
| 来源方向 | 工作 | 可迁移机制 | 可接入地面导航的位置 | 风险/前提 |
|---|---|---|---|---|
| VLA 推理效率 | VLA-ULAP | 云端大模型调用与本地超轻量动作预测器交替;ULAP 约 7.4M 参数(含冻结视觉编码器),独立训练,不需 VLA 隐状态、在线验证或服务器往返 | 导航决策层:远端 VLM 只在关键决策点调用,直行/微调航向由本地预测器接管 | 数字全部来自操作任务,48.8–76.7% 的调用跳过率在导航长程依赖下能否维持未经验证 |
| VLA 架构 | DEM(解耦) | 分离的视觉/语言编码器条件化一个紧凑动作头,替代每步跑数十亿参数 VLM 骨干;MeanFlow 头单次前向出动作块 | 语言条件化的导航策略主干,尤其算力受限的车载平台 | 结论限定在「已训练任务」范围内;RoboCasa 18 任务与导航的任务分布差异大 |
| VLA 推理效率 | rMuscle | 跨执行相似性的双阶段缓存:Context Cache 复用视觉 token 输出降计算,Action Cache 复用神经元激活模式降权重访问 | 固定巡逻路线、重复往返等结构化导航场景的推理加速 | 前提是任务重复性高;开放环境导航的观测相似度远低于工厂工位 |
| VLA 架构 | What Makes an Efficient VLA | 动作头性能主要由初始化而非解码器架构决定;把语言骨干最后若干 transformer 层拷入动作头是最大杠杆,且零延迟代价 | 任何自建 VLA 式导航策略的动作头初始化 | 论文自述这是最能组织其测量结果的解释而非已证因果 |
| 评测方法论 | LIBERO-CTRL | 配对式复合鲁棒性评测:对同一初始状态配对单轴与同时扰动条件,区分「涌现失败」与「补偿成功」 | 导航鲁棒性评测:光照×布局×动态障碍等多轴同时扰动 | 核心发现是两类转移在聚合统计中相互抵消——最多 29.0%(最严重条件 34.5%)的配对初始状态结果翻转却不体现在总成功率上,必须按实例配对记录 |
| 安全性 | Beyond Patch Removal | 状态恢复协议:在匹配的动作块边界移除对抗补丁,在相同剩余步数预算下测量可恢复性 | 导航策略的对抗鲁棒性评估与恢复适配器设计 | 证据来自 LIBERO-Long:OpenVLA-OFT 遭 EDPA 攻击后仅 36.2% episode 在五个 chunk 后可恢复(对照组 89.9% / 87.0%);恢复适配器在一个 chunk 延迟下把恢复率从 7.7% 提到 47.4%,延迟增大后收益明显下降 |
| 综述 | World-Action Models 综述 | 耦合未来世界预测与可执行动作生成的统一分类法,覆盖表征、转移建模、动作接口、训练流程与扩展策略,并单列导航应用 | WAM 路线进入导航的入口文献 | 综述性质,无自有实验;项目页 https://rcl-robotics.github.io/Awesome-World-Action-Models |
五、分类速览
5.1 地面 VLN / ObjectNav / 语义导航
| 工作 | 主题 | 一句话贡献 | 链接 |
|---|---|---|---|
| GroundingVLN | R2R-CE / RxR-CE | 见重点分析 | 链接 |
| C2Nav | 零样本 VLN-CE | 见重点分析 | 链接 |
| AdaGeoVLN | R2R-CE / RxR-CE | GFM 分层特征按表征深度耦合策略各阶段 + 有界 KV 保留 | 链接 |
| GPT-6-Astra 工作流 | 零样本 VLN-CE | 见重点分析 | 链接 |
| GLAM | ObjectNav(HM3D) | 见重点分析 | 链接 |
| HarnessVLN | 离散 R2R/RxR + ObjectNav | Agent Harness 分发前校验证据、几何可行性与子目标一致性,统一两类导航任务 | 链接 |
| Navi-Agent | 零样本 VLN-CE | 无坐标视觉地点拓扑替代几何定位,支持进度校验与重访恢复 | 链接 |
| LG-VLN | 零样本 VLN-CE,单目 | 共享 CleanDIFT 稠密特征打通几何与语义,LangGraph 组织为有向状态图;自定 550 episode R2R-CE val-unseen 子集上 21.3% SR、12.1% SPL | 链接 |
| AnchorVLN | 开放词表 VLN | MCP 工具 schema 强制「VLM 提语义、几何定度量」;CMU VLN Challenge 2026 指令跟随 64.4%,去掉控制器建模降 13.3 点;物体指代 45 题中几何锚定过阈 10 题、直接估坐标 0 题 | 链接 |
| TADreamer | 陆空双模态零样本导航 | 用生成视频想象导航,再经两阶段标定恢复度量一致的 3D 航点与运动模式 | 链接 |
| CueNav | 通用机器人导航 | BEV 地图传全局任务上下文、保留部分机体暴露具身上下文,引导视频规划;IDM 把稠密光流转成动作 | 链接 |
| RoboFind | 个性化物体搜索(无障碍) | 手机教目标、四足执行搜索;教学 agent 产出语义目标画像与多视角参考库,供后续任务复用 | 链接 |
| LEAP | 四足导航 + 主动感知 | 不改任务目标、不加覆盖率/好奇心代理奖励,仅靠地形课程的任务压力使注视控制自发涌现 | 链接 |
5.2 具身 Agent / AgentOS(本期新覆盖方向)
本方向此前未纳入抓取,本期首次系统收录,故单列一节。除上文已分析的 Harness Robotic OS、Finder、GLAM、Memory as Plans 外:
| 工作 | 主题 | 核心贡献 | 可核验证据 | 与地面导航的关系 |
|---|---|---|---|---|
| AeroWeaver | 无人机集群 agent harness | 把语义决策连到受治理的技能;角色条件化的本地 agent 做分布式协调;用角色索引的状态-动作-奖励经验在线精化技能选择 | 称在测试条件下保持有效技能执行,支持无中央 agent 的机体本地多机操作;奖励引导的在线更新提供免训练的适配路径。未给量化指标 | 「受治理技能 + 在线经验精化」的组织方式可迁移;但集群与单机地面导航的协调需求差异大 |
| DeliveryGym | 长程具身 agent 规划环境 | 面向长程具身规划的 RL 环境 | 未在摘要中给出基线成绩 | 长程任务分解的训练环境,与导航的长程性质相关 |
| Embodied-BenchForge | 具身基准自动构建 | 闭环基准合成:前向工件合成 + 反向验证修复;技能编排的工件合成配合工件依赖图,防止局部缺陷向下游传播 | 未在摘要中给出量化结果 | 若要自建导航评测集,其「逐工件验证而非端到端交付」的思路值得借鉴 |
| EmbodiedMind | 数据筛选与 RL | 自适应数据筛选 + 前缀树强化学习 | 摘要未提供可核验数字 | 训练侧方法,与导航任务无直接绑定 |
| STAGE | 具身执行的语义迁移诊断 | 诊断语义在接地执行处的迁移情况 | 基准为 LIBERO(操作) | 诊断方法可参考,证据来自操作任务 |
| SIMLIFE | 长程人机协作 | 长程人-agent 协作中的模式理解 | 摘要未提供可核验数字 | 人机协作场景,与社会导航有弱关联 |
| ReactHuman | 物理接地基准 | 类人反应式决策的物理接地基准 | 摘要未提供可核验数字 | 反应式决策评测,与动态避障弱相关 |
| Autonomy, Social Norms, and Alignment | 理论框架 | 自主性、社会规范与对齐的发展性框架 | 理论工作,无实验 | 偏理论,仅作领域观察 |
| Exploring 2D backbone effects | 室内语义占据预测 | 考察 2D 骨干网络对室内语义占据预测的影响 | 摘要未提供可核验数字 | 语义地图的上游感知模块 |
5.3 记忆、地图、规划与评测
| 工作 | 主题 | 一句话贡献 | 链接 |
|---|---|---|---|
| EgoPathBench | 航点决策评测 | 见重点分析 | 链接 |
| ENCP | VLN 不确定性 | Episode 归一化共形预测,为变长依赖导航序列恢复逐步覆盖保证 | 链接 |
| UDAV | 越野航点规划不确定性 | 多次随机采样取 medoid 作自洽标称路线,用空间离散度估不确定性,超阈值才触发重议;400 条留出查询上平均 ADE 由 147.4 降至 110.4 像素(-25.1%) | 链接 |
| UNI | 导航数据采集 | 助行器 + 手机的无机器人采集,物理约束天然筛出轮式可行路线 | 链接 |
| Feeling Terrain Before Crossing | 越野导航世界模型 | 过地形前先「感受」,用世界模型预判可通过性 | 链接 |
| TRACER | 多机器人社会导航 | 双向滚动时域,分离单机器人效应与非可加成对交互,按身份维持对响应模式的持久信念;SocialGym2 上提升无碰撞完成率 | 链接 |
| PRISM | 社会导航 | 交互风格与运动的预测性表征 | 链接 |
| Mobile Multi-Robot Navigation | 多机器人导航 | 用 Koopman 算子处理运行时不确定性 | 链接 |
| Learning Safe Humanoid Navigation | 人形导航 | 从降阶模型学习安全导航 | 链接 |
| Tuning ROS 2 for Energy-Efficient Navigation | 系统调优 | ROS 2 导航栈的能效调参实证 | 链接 |
| Task-Oriented Active Learning of Residual Dynamics | MPC | 面向任务的残差动力学主动学习 | 链接 |
| Steering with Lexicographic Preferences | 部署期偏好 | 字典序偏好引导生成式策略,策略权重不变;论文称在一个导航基准上验证有效 | 链接 |
| OHRID-Retail | 数据集 | 零售环境人类活动的开放多模态数据集 | 链接 |
| SwarmNxt | 集群平台 | 开源软硬件集群平台 | 链接 |
| Custom PX4 firmware | 陆空两栖 | 面向自主陆空混合任务的 PX4 固件定制 | 链接 |
| UAVs Meet Embodied Intelligence | 无人机具身智能 | 用物理-数字 AI 智能体桥接人类意图与飞行动力学 | 链接 |
5.4 次池速览(VLA·操作 / 自动驾驶 / 其他)
本期窗口共 162 条,主池 41 条已在上文覆盖;其余 121 条按「领域」字段归入次池,不做深度分析。分布为:VLA·操作 65 条、其他 50 条、自动驾驶 6 条。
VLA·操作池中与导航有潜在迁移价值的,已在第四节「可迁移方法」列出。其余为机械臂、力控、灵巧手、遥操作、水下双臂、实验室自动化等纯操作工作,以及动作分词、RL 微调、联邦训练等训练侧方法,本期均无导航侧验证,不逐条展开。完整清单见 index.md 中「领域」列。
六、趋势判断与行动建议
趋势
- 系统结构而非模型能力,是当前零样本导航成绩的主要来源。 EgoPathBench 的 2.9%(具身几何下的航点决策)与 GPT-6-Astra 的 52.0%(完整工作流下的 episode 成功率)相差一个数量级;C2Nav 的角色反转进一步显示,同一模型换回基数式提问会掉 19 个百分点,而同一接口换更强模型只涨 13 个百分点。三者共同支持同一判断。
- 空间记忆从「存什么」转向「预测什么」。 本期三条路线中,GLAM 直接预测未来地图表征与航点隐变量,Memory as Plans 把记忆转成段级计划,二者都不再把历史观测喂给执行器;AdaGeoVLN 的有界 KV 保留与 Navi-Agent 的无坐标拓扑则仍属「存什么」的优化。预测式记忆的一个可测好处是延迟不随 episode 增长,MaP-WAM 明确报告了这一点。
- agent harness 正在从通用 LLM 领域外溢到具身系统。 本期出现 HarnessVLN(导航)、Harness Robotic OS(四足巡检运行时)、AeroWeaver(无人机集群)三个独立的 harness 工作,共同模式是:在分发动作前做一层校验(证据支持、几何可行性、子目标一致性、受治理技能),并维护跨步骤的共享状态与分层记忆。Harness Robotic OS 的安全门控自演化回路是其中唯一处理了「持续更新的风险控制」的。
- 评测方法论本身成为独立研究对象。 EgoPathBench 指出现有空间智能基准只测孤立判断、测不出整合的导航能力;ENCP 指出标准共形预测在变长依赖 episode 上的覆盖保证失效;GPT-6-Astra 把成功率拆成主动停止与触底判定;Embodied-BenchForge 则直接把基准构建本身 agent 化并加逐工件验证。
研究空白
- R2R-CE 的零样本评测缺少公认协议。 本期四种子集并存,且无一篇报告与其他子集的换算或重叠关系,使得「零样本 VLN-CE 当前到了什么水平」在文献层面无法回答。
- 停止判定仍是最薄弱的单一环节,且缺少专门指标。 GPT-6-Astra 的 16.0% 触底成功、C2Nav 去掉 Arriving 后 SR 从 31.0% 降到 29.0% 都指向这里,但除这两篇外本期无人单独报告停止相关指标。
- 具身 Agent 的架构设计缺少对照实验。 本期三个 harness 工作都只报系统整体指标,没有一个做过「去掉某一层校验/某一类记忆」的消融,因此无法判断各设计的独立贡献——这与 C2Nav 在导航侧的做法形成鲜明对比。
- 效率工作与导航任务之间存在验证断层。 次池中的推理效率工作全部在 LIBERO 类操作基准上验证,无一在 VLN-CE 上测过。
建议动作
| 动作 | 目标 | 优先级 |
|---|---|---|
| 精读并复现 | EgoPathBench 的微调实验(Qwen 3.5 4B 由 3.9 升至 38.9)——本期唯一证明「具身航点决策可训」的工作 | 高 |
| 精读 | GroundingVLN:核验 69.9% SR 对应的 split 完整性与基线身份;拆解 GEAR 的执行对齐奖励设计 | 高 |
| 精读并局部复现 | C2Nav 的角色反转实验;优先在自有系统的停止判定环节改用比较式提问 | 高 |
| 建立跟踪表 | 为 R2R-CE 结果建立「评测子集 + episode 数 + 是否零样本」三列登记表,杜绝跨协议数字直接比较 | 高 |
| 精读架构 | Harness Robotic OS 的三层记忆划分与安全门控自演化回路;不必复现整套系统 | 中 |
| 最小验证 | AdaGeoVLN 的多深度 GFM 耦合:把单点终端特征注入改为早/中/晚三点耦合,不依赖其代码 | 中 |
| 指标改造 | 在自有评测中固定拆分「主动 STOP 成功」与「步数上限触底成功」,参照 GPT-6-Astra | 中 |
| 跟踪 | GLAM 与 Finder 的正式版数值与代码释出;二者分别代表预测式记忆与闭环取证两条路线 | 中 |
| 跟踪 | UNI 的助行器采集范式,评估是否适用于自有轮式平台的数据补充 | 中 |
| 暂缓 | 次池全部 VLA 推理效率工作——机制可借鉴,但在 VLN-CE 上的有效性未经任何验证 | 低 |