一、本期结论
- 本期 53 条新增中,只有 1 项工作报告了连续环境 VLN 数字。 用基准字段筛查,命中 R2R-CE / RxR-CE 的仅 VTInstructor 一项,而且它做的是指令生成(Speaker)而非指令跟随;另一条命中 R2R-CE 的公众号(TAMP-Nav)是上期已分析工作的解读,不计为新工作。对地面 VLN 的直接影响:本周没有可用于横向对比的新 R2R-CE 跟随器结果,若在维护 R2R-CE 基线对比,本期无需更新排行。
- 基准重心明显不在导航。 50 项独立工作里 15 项以 LIBERO 为主基准,约 30 项属于桌面/双臂操作类 VLA;地面导航相关只有 6 项,且分散在 ObjectNav、城市户外、人群避障三个互不兼容的评测体系里。本报告判断:VLA 社区的方法迭代速度远高于导航评测的迭代速度,导航侧要吸收这些方法只能自己搭桥。
- “推理延迟计入任务预算”从工程细节升级为评测口径。 RTNav 直接构造 HM3D 的实时异步变体,并报告既有零样本 ObjectNav 方法在真实计时下普遍掉点;FlashVLA、Just Noticeable Difference token 压缩、PonderPounce 的延迟披露、TacForcing 的执行期触觉反馈都指向同一件事。对地面 VLN 的影响:现有 R2R-CE 同步仿真结论未必在真机上成立,值得提前准备实时评测协议。
- 世界模型的用法从”重建观测”转向”当监督信号”。 LWM 预测动作条件下的潜特征兼容性而不重建画面,GaussianDream++ 只在训练期保留 Gaussian 预测头、推理时整条通路移除,Instruct-to-Act 把世界模型控制器当作 VLM 规划器的执行器。这条路线对导航特别友好——导航缺的是动作标注,不缺视频。
- 户外/城市地面导航同时冒出三套彼此独立的新评测。 WILD-Nav 的 WILD-LongTail(互联网街拍视频)、UrbanGround(真实尺度香港沙盒)、4DSynth-Nav(程序化生成 4D 场景)在同一周出现,任务定义、观测形式、指标均不互通。本报告判断:这是户外导航尚无共识基准的信号,短期内跨论文数字不可直接比较。
二、优先阅读清单
| 优先级 | 工作 | 任务/场景 | 核心贡献 | 关键证据 | 阅读理由 |
|---|---|---|---|---|---|
| A1 | VTInstructor | 连续环境 VLN 指令生成(R2R-CE / RxR-CE) | 仅用第一人称 RGB 视频 + 动作序列生成导航指令,推理期不需拓扑图、预建地图或三维重建 | 解读称在 R2R-CE、RxR-CE 的 Val Unseen 上 CIDEr 较最优基线分别 +0.357 / +0.109;生成指令驱动冻结跟随器成功率 63.3%,高出最优竞品 14.7 个百分点;作数据增强带来 +3 SR | 本期唯一给出连续环境数字的工作;Speaker 侧数据增强是扩充 R2R-CE 训练集的现实路径 |
| A2 | RTNav | 实时零样本目标导航(HM3D-v1 / v2 / OVON 实时变体) | 把推理延迟、异步环境步进、有界算力当作显式设计约束的架构 | 摘要称 SR 最多 +11%,Success weighted by Completion Time 最多 +5.1 点;并报告既有零样本方法在实时条件下一致掉点 | 直接挑战”同步仿真数字等于真机能力”这一默认假设,对真机导航评测口径有方法论价值 |
| A3 | WILD-Nav / WILD-LongTail | 城市户外局部导航(无预建图) | 互联网街拍第一视角视频的自动轨迹重建 + CoT 标注流水线;按”分布稀有度”和”任务难度”两维刻画长尾并做失效归因 | 解读称覆盖 15 国 30 城共 500 小时视频、超 50 万条导航样本;导航指标未在抓取内容中给出 | 数据获取路线(互联网视频到导航监督)与失效归因范式可直接复用到地面机器人 |
| A4 | Latent World Model for Navigation | 真实世界机器人导航策略学习 | 预测动作条件下的潜特征”兼容性”而非重建观测;可从无动作标注视频监督策略,并完全在世界模型内部做强化学习 | 摘要称在多个真实机器人导航数据集上于预测准确率、策略学习、真机导航性能三方面优于既有世界模型与模仿学习方法;未提供可核验数字 | 免动作标注 + 免额外环境交互,正好对上导航数据采集成本高的痛点 |
| A5 | UrbanGround | 真实尺度城市 MLLM 智能体导航沙盒 | 基于全境 3D 地理数据构建物理约束的香港复制体,第一人称闭环交互 + 可交互地图,按”局部接地 → 远距导航 → 路径/行人扰动”三级设问 | 摘要称当代 MLLM 智能体原子能力尚可,但朝向判断与行人感知移动不可靠,长程探索中误差累积且无有效自纠 | 给出城市尺度上”局部能力无法组合成持续目标导向行为”的系统性证据 |
| B1 | Think Only When Needed | 冻结 VLA 的检索增强(操作任务) | 指出 prompt-form collapse:检索文本一旦进入执行提示就构成控制干预 | 摘要称原始追加文本使平均成功率由 92.47% 降至 3.00%;有意义与等长无意义追加在全部 500 个状态上均失败 | 任何打算给导航策略挂检索或记忆文本的方案都应先看这个失效模式 |
| B2 | UniMem | 统一多模态记忆与控制(VLA) | 事件分类器触发记忆更新 + 关键帧编码器 + 关键帧缓存,单主干替代”外挂 VLM 管记忆” | 摘要称仿真 93.4% 对固定间隔采样基线 68.2%;硬件 80.0% 对分层基线 43.5%(5 仿真 + 4 硬件任务) | 与 TAMP-Nav 的锚点-轨迹记忆是同一问题的两种解法,可对照设计导航记忆 |
| B3 | Decoupling Planning and Control(Instruct-to-Act) | 指令可控智能体(7 个具身环境) | VLM 规划器输出稀疏高层文本指令,世界模型控制器高频自主执行;用合成指令重标注 rollout 片段做联合训练 | 摘要称在 7 个环境中一致优于纯控制器与 VLM 直接产动作变体,7 项中 6 项与强 VLA / 多智能体 RL 基线可比;可免微调更换预训练 VLM 规划器 | 高层慢规划 + 底层快控制的分工,正是长程 VLN 的结构问题 |
三、重点工作分析
1. VTInstructor:本期唯一的连续环境数字,来自 Speaker 而非跟随器
| 维度 | 分析 |
|---|---|
| 问题 | 导航指令生成的主流方案(全景 Speaker、知识增强、3D 增强)都建立在离散视点拓扑图上,路径走向与转角显式可见。到了 R2R-CE / RxR-CE 这类连续环境,机器人只有稠密第一人称 RGB 流,轨迹几何信息隐藏在帧间细微变化里,离散图训练的 Speaker 无法直接迁移。 |
| 方法 | 四模块流水线:EDTC 事件驱动轨迹压缩筛关键帧;VTP 把轨迹渲染成视觉提示掩码;VTMod 把轨迹信号注入视觉编码器;SFT + VT-GRPO 两阶段强化学习校准。核心思路是把”看不见的几何”渲染成模型本来就会读的视觉信号,而不是让模型自己从视频里学几何。 |
| 证据 | 公众号解读称:R2R-CE、RxR-CE 的 Val Unseen 上 CIDEr 较最优基线 +0.357 / +0.109;生成指令驱动冻结跟随器达 63.3% 成功率,高出最优竞品 14.7 个百分点;作为数据增强给下游导航带来 +3 SR;在 YouTube 真实第一视角视频上做人工评测,动作描述、地标识别、方向指引、可跟随性四个维度优于 GPT-5.4、Qwen3-VL-8B。本报告判断:63.3% 是”用生成指令喂冻结跟随器”的间接指标,不能与 R2R-CE 跟随器排行榜上的 SR 并列比较。 |
| 价值 | 对地面 VLN 有两条直接价值:一是把 Speaker 从离散图解绑,真机采集的视频可直接产指令;二是 +3 SR 的数据增强收益说明合成指令已具备训练价值,是扩充 R2R-CE 训练集的低成本路径。 |
| 局限 | 全部证据来自公众号解读,未核验原文实验设置;跟随器为冻结模型,未说明其身份与训练数据,14.7 个百分点的对比口径无法核实;真实视频评测为人工主观打分。 |
| 建议 | 精读原文并核对 R2R-CE / RxR-CE 的 Val Unseen 划分与 CIDEr 计算口径;若自建数据流水线,优先复现 EDTC 与 VTP 两个模块——它们与后续 RL 部分解耦,可单独接入现有 Speaker。 |
2. RTNav:把 wall-clock 时间放进任务预算,既有零样本 ObjectNav 方法普遍掉点
| 维度 | 分析 |
|---|---|
| 问题 | 主流零样本目标导航方法在同步仿真器中开发——环境等待智能体动作,推理时间等于免费。于是架构被设计成”感知 → 推理 → 动作”的顺序执行,完全不考虑时间约束。一旦切到真实世界连续运行,视觉语言基础模型的推理延迟不可忽略。 |
| 方法 | RTNav 把推理延迟、异步环境步进、有界算力三者当作显式设计考量,摘要将其描述为”简单但有效的架构”。抓取到的摘要未展开具体机制,本报告不推断其组件构成。 |
| 证据 | 摘要称:在 HM3D-v1、HM3D-v2、HM3D-OVON 的实时变体上,SR 最多 +11%,Success weighted by Completion Time 最多 +5.1 点;并明确报告近期零样本目标导航方法在这类真实计时条件下出现一致的性能退化。 |
| 价值 | 结论本身比方法更重要:它给出了”同步仿真数字高估真机能力”的可测量证据。地面 VLN 若要论证真机可行性,实时评测协议是绕不开的一环。 |
| 局限 | 仅覆盖 HM3D 系列的目标导航,未涉及 R2R-CE 这类语言指令跟随;实时变体由作者自建,尚无社区共识;摘要未给出延迟量级与硬件配置。 |
| 建议 | 精读并评估把”实时变体”的构造方式移植到 R2R-CE 的成本;若团队已有真机导航栈,可优先复用其 Success weighted by Completion Time 的指标定义。 |
3. WILD-Nav:把互联网街拍视频变成导航监督,并把失败归因到具体推理环节
| 维度 | 分析 |
|---|---|
| 问题 | 城市户外导航训练依赖仿真数据(有仿真-现实鸿沟、场景人为预设)或人工遥控采集(成本高、规模有限),两者都难以覆盖稀有但安全关键的长尾场景。平均指标好看,掩盖了模型在少数危险场景下的缺陷。 |
| 方法 | 对真实街拍第一视角视频自动完成轨迹重建,并生成”感知-分析-规划”结构化 CoT 标注,用于训练带推理能力的导航 VLA。长尾刻画拆成两个独立维度:感知-运动模式的分布稀有度、模型输出带来的任务难度;再用特权反思机制把失败案例定位到感知、预测、规划等具体环节。 |
| 证据 | 公众号解读称数据集 WILD-LongTail 收集 15 国 30 城共 500 小时视频、产出超 50 万条导航样本,并配套长尾评测基准。抓取内容中未给出导航成功率类可核验数字,本报告不补全。 |
| 价值 | 两点可直接借用:互联网视频转导航监督的标注流水线(尤其自动轨迹重建),以及”稀有度 × 难度”双维长尾划分——后者比单纯报平均 SR 更能暴露地面机器人的真实风险面。 |
| 局限 | 街拍视频是人类步行视角,与机器人本体高度、动力学、传感器均不一致;轨迹重建质量未见量化评估;数据集是否开放未在条目中说明。 |
| 建议 | 跟踪数据集与代码的开放情况;即使不用其数据,”把失败案例归因到感知/预测/规划环节”的评测习惯值得引入自己的实验报告。 |
4. Latent World Model:用潜特征兼容性替代观测重建,免动作标注学导航策略
| 维度 | 分析 |
|---|---|
| 问题 | 现有导航世界模型主要重建未来观测或特征,引入了对决策并不必要的复杂度——渲染像素的能力与”这个动作是否让我更接近目标”是两回事。 |
| 方法 | 提出兼容性预测式潜世界模型:不重建观测,而是预测动作条件下的潜特征兼容性。关键假设是空间邻近性与潜特征相似性相关,因而动作后果可直接在潜空间评估。训练用跨轨迹采样的动作序列做反事实监督,学习判断哪条序列更接近目标;进而用该世界模型从无标注视频监督策略学习,并完全在世界模型内部做强化学习。 |
| 证据 | 摘要称在多个真实世界机器人导航数据集上,于预测准确率、策略学习、真机导航性能三方面显著优于既有世界模型与模仿学习方法;摘要未给出具体数据集名称与数值,本报告不推断。资料另见项目主页。 |
| 价值 | 直接命中导航数据的结构性短板:视频容易拿,动作标注难拿。”免动作标注 + 免额外环境交互”这一组合若成立,对地面 VLN 的数据扩展意义大于任何单点 SR 提升。 |
| 局限 | “空间邻近性对应潜特征相似性”这一假设在视觉混淆场景(同构走廊、重复门厅)下是否成立,摘要未讨论——而这恰是室内 VLN 的高频失败场景;无可核验数字,评估结论待原文确认。 |
| 建议 | 精读并重点检查其潜空间相似性假设的失效分析;若成立,值得在自有真机视频上试跑其无标注监督流程。 |
5. UrbanGround:城市尺度上”原子能力不等于持续目标导向行为”的系统性证据
| 维度 | 分析 |
|---|---|
| 问题 | MLLM 能读懂一张街景图,但智能体一旦开始移动,局部证据是否还有用?既有评测多停留在静态视觉问答,无法回答这个问题。 |
| 方法 | 基于全境 3D 地理数据构建物理约束的香港真实尺度复制体,支持第一人称闭环交互并提供可交互地图。评测按问题递进三层:主动观察后能否回答空间问题;目标变远变含蓄后接地能否支撑导航;路径可用性与行人运动变化后行为是否仍然稳健。 |
| 证据 | 摘要称当代 MLLM 智能体在视觉识别与短程空间推理上具备有用的原子能力,但朝向判断与行人感知移动仍不可靠;核心失效出现在长程探索:局部能力无法组合成持续的目标导向行为,误差累积且缺乏有效纠正。摘要未给出模型名称与数值。 |
| 价值 | 提供了城市尺度、物理约束、闭环三个条件同时满足的沙盒,且三级设问的设计本身可复用为地面 VLN 的能力分解框架(接地能力 / 远距目标 / 动态扰动鲁棒性)。 |
| 局限 | 智能体是 MLLM 而非训练过的导航策略,结论刻画的是通用模型上限而非专用模型;未评测本体动力学;沙盒可得性未在条目中说明。 |
| 建议 | 跟踪其开放情况;无论是否使用该沙盒,”误差累积 + 无有效自纠”都应作为长程 VLN 的独立评测项,而不是并入总 SR。 |
四、可迁移方法
| 来源方向 | 工作 | 可迁移机制 | 可接入地面导航的位置 | 风险/前提 |
|---|---|---|---|---|
| 操作 VLA(记忆) | UniMem | 事件分类器触发记忆更新 + 关键帧编码 + 缓存,单主干统一记忆与控制 | 替换固定间隔历史帧采样,做长程 VLN 的关键帧记忆 | 事件定义依赖任务语义;导航的”事件”(转角、门厅)需重新界定 |
| 操作 VLA(记忆) | PonderPounce | System2 MLLM 用原生因果上下文当情节记忆,异步只向 System1 传”最新认知 token 及其年龄” | 慢思考与快控制之间的异步接口设计 | 摘要报告的 p50 78ms / 25ms、20Hz 属特定服务优化结果,换硬件不必然成立 |
| 操作 VLA(规划) | Instruct-to-Act | 用合成指令重标注控制器 rollout 片段,使世界模型控制器变得可语言指令化 | 让底层导航控制器接受稀疏高层文本指令,规划器可热插拔 | 合成指令质量决定上限;导航段落的自动重标注难度高于操作片段 |
| 操作 VLA(检索) | Think Only When Needed | 揭示 prompt-form collapse:检索文本进入执行提示即构成控制干预 | 为任何”记忆或检索文本拼进导航提示”的设计做前置风险检查 | 结论在操作任务上得出,导航提示结构不同,需自行复测 |
| 操作 VLA(可解释性) | LM-X | 在动作预测之外同时预测任务进度、事件与不确定性 | 导航过程中的进度估计与停止时机判断 | 摘要未给导航场景证据,属结构类比 |
| 操作 VLA(纠错) | FLARE | Retry 扰动片段 + Reset 技能库,MLLM 离线归因 OOD 状态、在线仲裁 | 导航走错后的回退与重规划机制 | 导航缺乏可复位的环境状态,Reset 迁移需重新设计 |
| 操作 VLA(世界模型) | GaussianDream++ | 训练期用 Gaussian 当前/未来预测头做 3D 监督,推理期整条通路移除,仅留 20 个 world token | 给导航策略加几何监督而不增加部署开销 | 其 LIBERO 98.6% / LIBERO-Plus 87.8% 为操作基准,与导航无可比性 |
| 无人机 VLN | RACO | 把粗目标当作运行时假设而非固定路点,用对象级候选锚点在阶段边界校验并纠正 | 地面 coarse-to-fine 导航的粗目标可靠性检查 | 证据来自 CityNav / CityRefer 派生的 LG-UVI 设定,SR 较复现 HETT 基线 +9.53 / +7.98 个百分点(val-unseen / test-unseen),室内场景未验证 |
| 无人机 VLA | Logic-VLA | STL 时序逻辑规范在推理时输入,语法图编码器 + 轨迹级偏好优化 | 给导航策略加安全或时序约束,而不必为每条约束训一个策略 | 摘要称 STL 满足率 +24.8 至 +40.7 个百分点、名义 NL 任务成功率下降至多 1.8 个百分点,来自四旋翼闭环仿真 |
| 四足运动控制 | DreamWaQ++ | 本体感知 + 3D 点云外部感知单阶段端到端联合训练,传感器故障可降级运行 | 越野与非结构化地形下 VLN 的底层运动层 | 纯运动控制,无语言或语义导航成分;与上层导航的接口需自行设计 |
| 推理效率 | FlashVLA | 流式动作解码,针对 flow-matching VLA 的多步迭代解码做异步化 | 与 RTNav 的实时约束配套,降低导航策略的闭环延迟 | 面向操作场景,导航的动作维度与控制频率不同 |
五、分类速览
5.1 地面 VLN / ObjectNav / 语义导航
| 工作 | 主题 | 一句话贡献 | 相关度 | 链接 |
|---|---|---|---|---|
| VTInstructor | 连续环境指令生成 | 见重点分析 | A | arXiv |
| RTNav | 实时零样本目标导航 | 见重点分析 | A | arXiv |
| WILD-Nav | 城市户外导航长尾 | 见重点分析 | A | arXiv |
| Latent World Model | 导航策略世界模型 | 见重点分析 | A | arXiv |
| UrbanGround | 城市尺度智能体沙盒 | 见重点分析 | A | arXiv |
| 越野机器人导航综述 | 非结构化户外导航 | 从具身智能视角梳理越野地面无人车导航,提出受大脑-小脑交互启发的统一架构,覆盖本体、仿真环境与具身智能体三模块 | A | ResearchGate |
| PDPO | 机器人人群导航 | 离线到在线的规划扩散策略优化,用短程规划替代单步反应式动作以表达多模态避让;无语言成分 | B | arXiv |
| TAMP-Nav / Embodied-Navigator | 连续环境 VLN | 上期已做重点分析,本期为公众号解读,不计为新工作 | A | arXiv |
5.2 记忆、地图、规划与评测
| 工作 | 主题 | 一句话贡献 | 相关度 | 链接 |
|---|---|---|---|---|
| UniMem | 统一记忆与控制 | 见可迁移方法 | B | arXiv |
| PonderPounce | MLLM 作情节记忆 | 见可迁移方法 | B | arXiv |
| Instruct-to-Act | 规划与控制解耦 | 见可迁移方法 | B | arXiv |
| Think Only When Needed | 检索干预失效 | 见可迁移方法 | B | arXiv |
| LM-X | 进度/事件/不确定性预测 | 见可迁移方法 | B | arXiv |
| FLARE | 失败感知纠错 | 见可迁移方法 | B | arXiv |
| 4DSynth | 可控程序化 4D 环境生成 | 由文本、蓝图掩码或单张照片生成可编辑 4D 环境,并据此构建交互式导航基准 4DSynth-Nav;摘要称两个 VLM 在三档难度上多数任务失败且早期子任务即停滞 | B | arXiv |
| TrAct | 视觉轨迹作世界模型条件 | 用与本体无关的视觉轨迹点作稠密图像空间引导,改善未来视频预测的空间精度 | B | arXiv |
| InstructMove | 指令跟随评测原则 | 提出”文本不可省”评测原则:多个动作在视觉与物理上均可行,只有一个符合语言指令,用于诊断视觉捷径 | B | arXiv |
| Hierarchical Skill Retrieval | 分层技能检索 | 面向少样本适配的分层技能检索,替代仅依赖视觉相似度的检索 | C | arXiv |
| RA-VLA | 测试时检索增强 | 面向新任务分布的检索增强测试时适配,缓解上下文模仿学习的适配瓶颈 | C | arXiv |
5.3 具身 VLA / 移动操作
| 工作 | 主题 | 一句话贡献 | 相关度 | 链接 |
|---|---|---|---|---|
| GaussianDream++ | 3D 高斯世界建模 | 见可迁移方法 | B | arXiv |
| FlashVLA | 流式动作解码 | 见可迁移方法 | B | arXiv |
| StreamPI | 流式多模态时序建模 | 给单帧范式的 pi0.5 类模型补上时序推理与历史观测保留 | C | arXiv |
| TemporalFlow-VLA | 物理接地的执行历史 | 针对多阶段操作中”视觉相似但需不同动作”的状态,学习有物理依据的执行历史表示 | C | arXiv |
| V-Link | 恢复动作专家的视觉表征 | 指出动作 DiT 对 VLM 特征中 3D 几何与 2D 语义的访问受限,并加以恢复 | C | arXiv |
| GaussVLA | 几何感知空间推理 | 基于 Mamba 的 VLA,用高斯表示替代扁平 2D patch token 与逐像素深度标量 | C | arXiv |
| One Policy, Many Embodiments | 统一相机中心动作几何预训练 | 不做显式动作重定向或数据集专用分支,用相机中心的动作几何统一异构本体数据 | C | arXiv |
| PredVLA | 极小参数预测编码策略 | 68 万可训练参数的语言条件预测编码策略,质疑大模型规模在语言条件控制上的必要性 | C | arXiv |
| CounterAlign | 反事实监督 | 为行为克隆补上”哪些动作与指令不一致”的显式负监督 | C | arXiv |
| Act with Intent | 行为意图蒸馏 | 蒸馏行为背后的局部目标,而非仅监督被演示的马达指令 | C | arXiv |
| Pointing-VLA | 类型化空间接地接口 | 用几何专用头直接输出归一化点、对象功能接地热图与视觉轨迹,取代自回归文本坐标 | C | arXiv |
| MA-VLA | 多臂协作 | 为多臂协作提供臂级行为的显式指派与组合机制 | C | arXiv |
| Robust Bimanual VLA | 模态掩码 | 用简单的模态掩码稳定多视角与语言融合,缓解双臂任务的动作不连续 | C | arXiv |
| TacForcing | 执行期触觉反馈 | 在动作块执行过程中注入实时触觉条件,避免触觉信息过期 | C | arXiv |
| Gripper-aware VLA | 夹具感知 | 打破”夹具不变性”隐含假设,为平行夹爪与吸盘等不同末端建模差异化抓取策略 | C | arXiv |
| ForeTime-VLA | 未来 token 蒸馏 | 从世界动作模型蒸馏面向未来的动作等价表示,用于传送带上的移动物体操作 | C | arXiv |
| PhysCaP | 物理知情主动感知 | 给 code-as-policy 智能体加物理知情探索层,通过交互主动获取隐含物理属性 | C | arXiv |
| GRAFT | 在线 RL 适配 | 区域级监督学习视角相关的视觉锚点,配合前缀缓存复用;摘要称四项生物医学操作任务成功率 +25 个百分点 | C | arXiv |
| Just Noticeable Difference | token 压缩 | 用恰可察觉差建模指导 VLA 的 token 压缩,兼顾闭环动作预测的延迟敏感性 | C | arXiv |
| ROS2SmolVLA | 工业轻量集成 | 把小型 VLA 接入工业级轻量机器人的 ROS 2 集成方案 | C | arXiv |
| TARCAT | 建筑任务分类体系 | 基于 91 项 O*NET 任务、七类高就业建筑职业构建机器人可执行能力清单 | C | arXiv |
| CertVLA | 物理视觉攻击认证防御 | 面向有界补丁与纹理攻击的闭环 VLA 认证防御,处理连续且时序相关的动作 | C | arXiv |
| TrapVLA | 后门攻击 | 提出”配置化失败陷阱”攻击任务,要求攻击者控制机器人以何种方式失败 | C | arXiv |
| EndoLIFT | 双向内窥镜控制 | 形式化”几乎相同观测需相反轴向动作”的双向控制歧义,用语言消歧的潜条件整流流求解 | C | arXiv |
| 多模态投机解码调研 | 推理加速综述 | 对基于扩散的并行草稿投机解码做综述与实证诊断 | C | arXiv |
5.4 无人机、自动驾驶与其他低相关方向
| 工作 | 主题 | 一句话贡献 | 相关度 | 链接 |
|---|---|---|---|---|
| RACO | 无人机巡检 VLN | 见可迁移方法 | B | arXiv |
| Logic-VLA | 四旋翼时序逻辑约束 | 见可迁移方法 | B | arXiv |
| DreamWaQ++ | 四足全地形运动控制 | 见可迁移方法 | B | IEEE T-RO |
| Collaborative Multi-Modality VLA | 端到端自动驾驶 | 指出多数驾驶 VLA 把端到端驾驶当作视觉问答,导致决策推理不可靠、不可解释 | C | arXiv |
| WildRoadBench | 航拍道路病害定位基准 | 1061 张无人机实拍图、1699 个病害边界框、8 类缺陷,同一数据与指标下并行评测 VLM 零样本定位与 LLM 智能体自建检测器两条路线 | C | arXiv |
| UniABG | 无监督跨视图地理定位 | 对抗桥接对齐无人机与卫星视图分布,再用异构图过滤清洗聚类伪标签 | C | arXiv |
| HAPS 功能层级审视 | 高空平台能力评估 | 以”18km 以上高度回传有业务价值实测数据”为验证门槛,19 项功能中仅 5 项获得可信飞行验证 | C | arXiv |
5.5 资讯与非论文
| 日期 | 事件 | 类型 | 与研究的关系 | 链接 |
|---|---|---|---|---|
| 2026-08-21 | “月薪50k*14薪”具身智能课程推广 | 培训广告 | 无研究价值;该条目正文抓取失败(未找到正文容器) | 公众号 |
| 2026-08-25 | “月薪8万”具身智能课程推广 | 培训广告 | 无研究价值,仅反映领域招聘热度 | 公众号 |
六、趋势判断与行动建议
趋势
- 延迟正在从工程指标变成评测变量。 RTNav 构造实时异步 ObjectNav 变体并报告既有方法一致掉点;PonderPounce 披露 p50 认知刷新 78ms、动作调用 25ms 与 20Hz 动作回放;FlashVLA 针对 flow-matching 的多步解码做流式化;Just Noticeable Difference 从 token 压缩侧切入;TacForcing 处理动作块执行期内的触觉过期。五项工作从不同角度指向同一命题:动作块执行期间世界仍在变化。地面 VLN 目前的 R2R-CE 评测完全不含这一维度。
- 记忆机制正在从”外挂模块”收敛到”统一主干”。 UniMem 明确以事件分类器加关键帧缓存替代额外 VLM 管记忆;PonderPounce 复用 MLLM 原生因果上下文而不建专用记忆模块;StreamPI 与 TemporalFlow-VLA 给单帧策略补时序;上期的 TAMP-Nav 用锚点-轨迹记忆压缩历史。共同动机是固定间隔采样历史帧既浪费又有害。
- 世界模型的角色从”生成器”退回”监督者”。 LWM 放弃观测重建改预测潜特征兼容性;GaussianDream++ 把 Gaussian 预测头限定在训练期、推理时整条移除;TrAct 用视觉轨迹而非本体动作作条件;Instruct-to-Act 把世界模型控制器当执行器。这条路线降低部署成本,对算力受限的移动平台尤其有利。
- 导航评测正在分叉而非收敛。 本期同时出现 WILD-LongTail(互联网视频)、UrbanGround(真实尺度城市沙盒)、4DSynth-Nav(程序化 4D 生成)、LG-UVI(无人机巡检)、InstructMove(文本不可省原则)五套新评测设定,没有一套与 R2R-CE 兼容。本报告判断:短期内户外与城市导航的跨论文数字不具可比性,做横向对比时必须锁定单一基准。
研究空白
- 连续环境指令跟随本身本期无新方法。 Speaker 侧(VTInstructor)有进展,跟随器侧空白。R2R-CE 上一次出现新数字还是上期的 TAMP-Nav(66.2% SR)。
- 实时评测尚未覆盖语言指令导航。 RTNav 只做了 HM3D 系列目标导航的实时变体;R2R-CE / RxR-CE 没有对应的异步实时协议,而语言指令跟随的推理开销(长指令编码加 CoT)比目标导航更高。
- “局部能力无法组合成长程行为”缺少量化指标。 UrbanGround 定性观察到误差累积与自纠失效,但没有把它从总成功率里拆出来;这与上期 CondVLN 拆分”选错分支”属于同一类需求。
建议动作
| 动作 | 目标 | 优先级 |
|---|---|---|
| 精读 | VTInstructor 原文,核对 R2R-CE / RxR-CE 的 Val Unseen 划分与 CIDEr 口径,确认 +3 SR 数据增强的实验设置 | 高 |
| 精读 | RTNav 原文,评估把实时异步评测协议移植到 R2R-CE 的构造成本 | 高 |
| 精读 | Latent World Model 原文,重点检查”空间邻近对应潜特征相似”假设在视觉混淆场景下的失效分析 | 高 |
| 加入基准跟踪 | UrbanGround、4DSynth-Nav、WILD-LongTail 三套户外与城市评测的开放情况及相互关系 | 中 |
| 借鉴 | Think Only When Needed 的 prompt-form collapse 失效模式,对自有导航策略的检索或记忆文本注入做一次对照测试 | 中 |
| 借鉴 | UniMem 与 TAMP-Nav 两种记忆压缩方案做对照,确定长程 VLN 的关键帧触发准则 | 中 |
| 暂缓 | 本期约 30 篇纯桌面操作 VLA(以 LIBERO 为主基准)不投入精读,仅在方法层面留意统一记忆与流式解码两条线 | 低 |