共 31 篇文章,按更新时间倒序:研究 18 · 周报 6 · 随笔 7
2026 年 10 月1 篇
2026 年 9 月26 篇
Embodied Agent 综述
从空间记忆、技能契约、执行评估与运行时监控出发,梳理具身 Agent Harness 与机器人运行系统的协同架构,分析通信选型、快慢循环、故障恢复及可验证的接口设计。
空间智能综述
空间智能是 AI 系统感知、理解、推理和交互三维物理世界的综合能力,是具身智能与通用人工智能的重要基础。本文系统梳理空间智能的核心技术体系,涵盖点云处理、深度估计、神经三维重建、三维目标检测与空间感知语言模型等方向的经典代表性工作,并梳理主流数据集、评测基准与 2023–2026 年最新进展,为学习和研究空间智能...
机器学习综述
从学习范式、数据划分与模型评估出发,梳理经典算法、深度网络、预训练模型与生成方法,重点说明核心假设、适用边界和实践选型。
深度学习综述
从机器学习三步骤框架出发,系统梳理神经网络、CNN、RNN/LSTM、Transformer、GNN、优化与正则化、生成模型、MoE、PEFT、量化和 Mamba/SSM,并提供训练排错与基准选择的实用参考。
Embodied Agent 论文精读
本文按系统运行时、物理编排、场景图评估、自演化治理、语义动作接口、动作分块、AgentOS 与巡检系统治理八条路线,精读 Embodied Agent 领域的代表性论文。
VLM 综述
从 CLIP 的图文对齐到 LLM 驱动的多模态理解,梳理 VLM 的视觉编码、连接模块、训练流程与评测方法,并结合代表论文说明高分辨率、视频理解和推理增强的设计取舍。
AI Agent 综述
围绕“Agent 如何决策、如何行动、如何可靠完成任务”,梳理推理规划、多 Agent 协作、记忆与技能、上下文工程、工具与连接协议,并结合产品案例、具身应用、评测和安全讨论系统设计的适用条件与取舍。
大语言模型训练综述
大语言模型训练是当前人工智能领域最前沿的研究方向之一。本文系统梳理大模型训练的完整流程、核心技术、工程实践与最新进展,为学习和研究大模型训练提供全面参考。
VLN 论文精读:目标导航与扩展篇
VLN 论文精读的目标导航与扩展篇:目标导航(ObjectNav、HM3D-OVON、图像 / 点目标)性能排行榜,以及目标导航、运动控制、移动操作与其他增补研究。
VLN 论文精读:指令跟随篇
本文系统梳理 VLN 指令跟随任务的论文,涵盖 DualVLN、StreamVLN 等最新研究成果,以及 Diffusion Policy 等 VLN 项目所依赖的基础工作。
VLN 综述
从任务、状态与动作接口、训练信号和闭环评测梳理 VLN;比较流式策略、快慢控制、空间记忆、Agent 与世界模型,给出带来源的数据集选型与开放问题分析。
强化学习综述
2026年深度总结:系统梳理强化学习与具身智能算法体系,从 MDP 理论基础、策略梯度推导、PPO/SAC/TD3 无模型基石,到世界模型(V-M-C/DreamerV3/TD-MPC2)、扩散策略(Diffusion Policy/DPPO),精选12篇里程碑经典论文深度解析,附仿真基准与算法选型矩阵。
世界模型综述
本文系统梳理具身智能世界模型(World Models):从认知科学起源与经典有模型强化学习(World Models 2018、DreamerV3、TD-MPC2)的理论奠基,到 Tokenizer、条件注入、生成范式、长程记忆与推理效率等核心工程设计选择;按「世界生成器」与「面向机器人决策的四大范式」两大家族...
具身导航周报(2026-09-16 ~ 2026-09-24)
R2R-CE 零样本出现 79.0% SR 的新声明(GPT-6-Astra,Codex harness + ultra 推理),但评测集、推理成本与停止口径均未在摘要中给出;一周前同一模型在直接工作流下为 52.0%,核验前不宜与训练式方法横向比较。同一基准上的数字越来越多地出自不同信息条件:SparseNav...
Jev:System One 模型与具身导航
Jev 将自由生成替换为类型化判断,但其速度、校准与泛化需要分开检验。本文先厘清接口和证据边界,再比较候选读出、任务训练、视觉共享与外挂感知等开源路线;最后围绕具身导航的行动决策、记忆管理与 Agent 内部协作,提出研究问题及可归因的实验方案。
Python 工程实践指南
把一堆能跑的研究脚本,整理成别人能安装、能运行、能维护的 Python 项目。本文围绕一个贯穿全文的示例工程,系统讲解解释器与环境边界、src 布局与 pyproject 声明、uv 依赖工作流与锁文件的真实保证范围、质量与测试流水线、构建交付与 CI,并专章处理 AI/机器人场景的 CUDA 依赖分层、ROS ...
ROS 2 核心架构指南
系统、深入地剖析 ROS 2 的核心架构、通信底座(DDS/RTPS)、五大通信原语、QoS 策略、执行器调度与零拷贝 IPC、Lifecycle 状态机、TF2、机器人建模、主流生态栈(Nav2/MoveIt2/ros2_control/micro-ROS)以及工业级多机部署与性能调优。
RoboTTT:用 Fast Weights 压缩长时程历史
详细剖析 NVIDIA 发布的 RoboTTT 架构。深入探讨测试时训练(Test-Time Training, TTT)如何通过在测试阶段运行梯度下降将多步交互历史(History)动态压缩进快权重(Fast Weights)的参数空间,克服传统 KV Cache 的显存爆炸与线性 RNN 的容量瓶颈,实现 8...
Graph Engineering:智能体图编排
Graph Engineering(图智能体工程)是继 Loop Engineering 之后,在 2026 年中后期迅速崛起的高阶多智能体编排范式。它主张将复杂的智能体交互与控制逻辑建模为显式的有向状态图(State Graph),以节点、边与全局状态等核心原语,实现非确定性 LLM 认知与确定性工程逻辑的结合...
Loop Engineering:Agent 闭环范式
Loop Engineering(循环工程)是 2026 年 AI 智能体开发的最核心演进。它将开发者的角色从“亲自 Prompt 的打字员”转变为“设计 Agent 闭环系统的架构师”。本文结合最新行业实践,深度拆解 Loop Engineering 的四种核心循环模式、五大基础原语、外部化状态机制,以及应对“...
Mixture-of-Transformers (MoT) 架构详解
深入剖析 Meta AI、NVIDIA 等机构提出的 Mixture-of-Transformers (MoT) 稀疏架构。从密集模型的模态竞争难题出发,详解 MoT 核心的「模态特定参数解耦 + 全局自注意力」机制、确定性模态路由,并重点剖析 NVIDIA Cosmos 3 物理世界模型在此架构上的前沿工程落地...
树状注意力:VLN 训练 Token 压缩 22×
聚焦 Robostral Navigate 的前缀树监督训练:为什么观测构成共享主干、动作必须成为叶节点,以及 tree attention 如何在阻止 ground-truth action 泄漏的同时将训练 Token 压缩 22×。
具身导航周报(2026-09-09 ~ 2026-09-17)
本期最值得注意的是一组对照:EgoPathBench 测九个 VLM 的第一人称航点决策,点代理几何下 Point Path 尚有 35.9% 成功率,加上具身几何约束后 Embodied Path 只剩 2.9%;而 GPT-6-Astra 靠完整工作流在 R2R-CE 上跑出 52.0% SR。当前零样本导航...
传统机器人导航算法综述
系统梳理传统机器人导航算法栈:从感知、定位与建图(SLAM),到全局与局部路径规划,再到路径跟踪控制器,涵盖主要算法原理、对比与应用场景。
具身导航周报(2026-09-02 ~ 2026-09-10)
本期 46 条新增全部来自 arXiv,公众号源因微信公众平台频控缺席,两个订阅号采集均为 0 条。46 篇中仅 1 篇报 R2R-CE:O2C-Nav 把零样本 VLN-CE 的每决策步大模型调用压缩到一次,但摘要只称超过现有零样本方法、未给可核验数值。证据质量最高的导航结果来自 OmniNav(真机 pick...
具身导航周报(2026-08-26 ~ 2026-09-03)
本期 45 条新增全部来自 arXiv,公众号源因上游中转随 Deno Deploy Classic 下线而永久失效缺席。45 篇中仅 2 篇报告 R2R-CE:LookStep 给出可核验的 Val-Unseen 成功率 49.7% 且已开源,Revisiting Topological Graphs 把 VL...
2026 年 8 月3 篇
具身导航周报(2026-08-20 ~ 2026-08-29)
本期 53 条新增中仅 1 项报告连续环境数字,且是指令生成侧的 VTInstructor(R2R-CE / RxR-CE Val Unseen CIDEr +0.357 / +0.109),跟随器侧空白;基准重心明显偏离导航,50 项独立工作中 15 项以 LIBERO 为主基准。RTNav 把推理延迟计入任务...
VLA 综述
围绕视觉、语言与动作的统一建模,梳理 VLA 的动作表示、训练方法、闭环执行、数据与评测,并结合代表论文讨论泛化能力、部署成本和适用边界。
具身导航周报(2026-08-13 ~ 2026-08-20)
本期 46 篇新增工作中导航为主仅 5 篇,R2R/RxR 榜单供给持续变稀:Embodied-Navigator 是唯一给出 R2R-CE 数字的工作(66.2% SR);CondVLN 用条件分支指令揭示 SR/SPL 评测口径对指令理解能力的高估;RP1、Remember Smarter 等可插拔的记忆压缩...