摘要

arXiv Robotics 最新公开批次为 2026 年 7 月 20 日,共 46 项。本期最值得关注的增量集中在工业 UWB 多传感器定位、具备动态属性的开放词汇地图、实时持续式 Gaussian 重建、面向重建质量的主动探索,以及“学习调几何、MPC 保安全”的混合控制架构。

模型侧的重要更新是 Xiaomi-Robotics-1:其预训练数据规模超过 10 万小时真实操作轨迹,并展示了明确的数据和模型规模扩展趋势;但截至目前,官方仓库仍标注代码和权重即将发布,因此暂时不能算开箱即用模型。

AI Coding 侧的主线不是再推出一个 IDE 聊天入口,而是把差分测试、确定性静态分析、AI 辅助质量检测、覆盖率门禁和成本配额组合成生产流程。GitHub Code Quality 已于 7 月 20 日正式 GA 并开始计费。


1. 工业 UWB 定位:自动标定锚点,再与本体传感器做地形感知融合

这项工作面向仓库 AMR 和叉车,提供一条从 UWB 锚点自动标定到在线定位的完整管线。标定阶段同时估计锚点位置和测距偏置;定位阶段使用考虑偏置的扩展卡尔曼滤波器,将 UWB 与机器人本体传感器融合,并针对贴地车辆的运动约束进行设计。作者在商业物流 AMR、仓库内外过渡区域以及独立叉车数据上进行了验证,并公开了仓库数据集。

为什么重要

UWB 在工业部署中真正麻烦的通常不是单次测距,而是:

  • 锚点安装后需要人工测量坐标;
  • 每个锚点存在不同固定偏置;
  • 金属货架和车辆造成非视距误差;
  • 机器人经过坡道、门槛或室内外过渡时,简单二维运动假设失效;
  • UWB 与轮速、IMU、LiDAR 定位之间容易重复或不一致地融合。

该工作把这些环节放在统一系统中,而不是只报告一个新的测距网络。

适合谁关注

适合仓储 AMR、厂区机器人、叉车、地下停车场定位,以及已经使用 LiDAR SLAM、但需要低成本绝对位置锚点的团队。

工程落地启发

建议将 UWB 作为低频绝对约束,而不是替换 LIO:

  1. LIO、轮速—IMU继续维持高频局部位姿;
  2. 自动标定程序估计锚点坐标和每个锚点的 range bias;
  3. UWB 残差根据视距情况、锚点几何分布和历史创新量动态加权;
  4. 在坡道和地面不平时放宽平面车辆约束;
  5. UWB 与 LIO 明显冲突时,进入故障隔离,而不是强行拉回;
  6. 长期运行中定期检测锚点是否被移动。

实时性、复现性与风险

论文强调减少人工配置和参数调节,但摘要未给出统一 CPU 平台上的绝对更新频率。数据集已公开,有利于复现;完整代码是否公开尚不明确。稀疏锚点和有限视距下仍能运行,不代表严重金属多径下可稳定提供高精度绝对位置。

工程判断

适合作为现有 LIO/轮速融合系统的绝对锚点层,是今天定位方向最接近生产部署的工作。


2. Vision-Language-Motion Maps:地图开始回答“什么在动、什么可能会动”

VLMM 在开放词汇三维地图的每个元素上增加融合运动属性,包括:

  • VLM/LLM 给出的语义可移动性先验;
  • 多帧几何观测到的真实运动;
  • 每个元素对应的不确定性。

这使机器人能够区分:

  • 已经被观察到移动的物体;
  • 理论上可移动、但当前尚未移动的物体;
  • 长期保持静止的结构。

作者在 AI2-THOR 仿真,以及 TUM、Bonn 动态 RGB-D 序列上验证;加入不确定性通道后,动静分类精度提高并减少误报。后处理校准后,预期校准误差达到 0.10。

为什么重要

传统语义地图可能知道某处是“椅子”或“门”,但不知道:

  • 这把椅子刚刚被人移动过;
  • 这扇门可以移动但当前是静止的;
  • 墙面误差是否被错误判断为动态;
  • 一个未移动对象是否适合当长期定位特征。

运动先验和观测运动不能互相替代:语义先验无法回答“现在什么正在动”,纯几何运动也无法回答“什么未来可能会动”。

工程落地启发

建议在现有地图中增加三层属性:

  • observed_motion:由跨帧几何估计;
  • movability_prior:由类别或 VLM 给出;
  • motion_uncertainty:表示位姿噪声、遮挡和匹配不确定性。

导航层可以据此采取不同策略:

  • 墙体、立柱等低可移动对象进入长期定位地图;
  • 已观测运动对象进入动态障碍层;
  • 可移动但暂时静止的对象用于短期定位,不固化为永久结构;
  • 不确定度高的对象不参与回环或长期地图更新。

落地风险

当前方法是一种地图表示贡献,不是一套完整动态 SLAM。其原始置信度并未天然校准,需要额外后处理;地图结果也依赖上游位姿、对象分割和跨帧关联质量。

工程判断

很适合与长期巡检地图结合,但不能让 VLM 的“可移动性判断”直接覆盖几何安全地图。


3. ImprovedVBGS:持续式 Gaussian 重建延迟从约 84 秒降至 50 毫秒

Variational Bayes Gaussian Splatting 可以持续接收新观测并更新地图,不需要维护完整 replay buffer,但原实现每帧需要反复遍历全部已观察点,难以实时运行。

ImprovedVBGS 通过两项主要优化实现加速:

  • 空间截断的变分推断,只更新与当前观测相关的局部区域;
  • 改进点到 Gaussian 的重新分配流程,减少无效重编译和重复计算。

在 NeRF Synthetic 数据集、RTX 3070 Ti 上,论文报告平均单帧延迟由约 84 秒降低至约 0.050 秒,约 1680 倍加速,同时基本保持重建质量;代码已经公开。

为什么重要

多数 Gaussian SLAM 工作依赖:

  • 长时间批量优化;
  • 大量关键帧回放;
  • 显存随地图规模增长;
  • 回环或新区域进入时重新训练。

持续式 Bayesian 更新更适合机器人在线场景,但只有延迟降到几十毫秒后才具有系统集成价值。

工程落地启发

它适合作为局部稠密地图后端,而非位姿前端:

  1. FAST-LIO、VIO 或 ORB-SLAM 提供关键帧位姿;
  2. 只在当前局部子图上更新 Gaussian;
  3. 将旧区域冻结或低频后台优化;
  4. 对回环受影响子图执行局部重新分配;
  5. 从 Gaussian 地图提取 mesh、TSDF 或保守占用表面供导航使用;
  6. 动态物体在写入 Gaussian 前独立过滤。

实时性和风险

50 毫秒对应约 20 Hz 的单帧更新能力,但该指标来自 NeRF Synthetic 和桌面 GPU,不能等同于包含 SLAM、语义分割、动态过滤和地图管理的完整机器人系统。技术报告仅 5 页,实验覆盖度有限。

工程判断

代码已开放,值得做局部地图实验;不应直接替代 TSDF、ESDF 或点云碰撞地图。


4. SCAGE:自主探索不再只追 frontier,而是主动修复“重建异常”

传统 frontier exploration 优先探索已知空间与未知空间的边界,能够扩大覆盖率,但不关心已经看过的区域是否重建完整。

SCAGE 将探索重新定义为“几何异常最小化”:

  • 使用学习到的标准室内结构先验理解墙面、桌子等典型几何;
  • 将实时无结构点云与先验预期比较;
  • 识别碎裂墙面、部分桌面等不完整重建区域;
  • 选择更合适的观察位姿,主动补足这些几何异常。

作者报告在测试场景中体积覆盖率均约为 90%,并且三维重建质量优于所比较的 frontier 基线;论文已被 IROS 2026 接收,并提供项目页面。

为什么重要

机器人完成“地图覆盖”不代表地图可用于:

  • NDT/GICP 重定位;
  • 门洞和楼梯测量;
  • 物体检测;
  • mesh/数字孪生生成;
  • 后续重复巡检。

一面墙只看到一小部分时,frontier 可能认为该区域已经探索,但重建质量仍不足。SCAGE 的设计直接把地图质量纳入下一视角规划。

工程落地启发

不必一开始训练复杂的室内结构基础模型,可以先实现规则版本:

  • 平面残缺度;
  • 墙面孔洞率;
  • 局部点密度;
  • 法向一致性;
  • 物体表面覆盖率;
  • 视角冗余度。

探索收益可以写成:

未知空间收益 + 重建异常收益 - 路径代价 - 定位退化风险

对于无人机,还应加入主动选择能提升 LIO 可观测性的观察方向。

风险

结构先验可能把真实的不规则建筑、管线和破损设施误判为“异常”,导致机器人反复观察无法修复的区域。论文摘要未给出真实平台算力和完整规划频率。

工程判断

非常适合三维扫描和高质量建图任务,建议先以几何规则实现,不必立即依赖学习模型。


5. Task-Space Receding Horizon:用短接触 rollout 获得 MPC 的前瞻性,但不求解完整轨迹优化

这项控制器介于纯反应式避障与完整 MPC 之间。

其核心流程是:

  1. 在任务空间中执行短时域 rollout;
  2. 使用膨胀后的凸机器人和障碍几何;
  3. 显式模拟机器人—障碍接触、动态障碍运动和自碰撞;
  4. 生成满足内部非穿透条件的终端运动学参考;
  5. 只计算从当前状态到该终端参考的最小加速度平滑过渡的第一步输入。

它避免了完整约束轨迹优化,却保留了短时间前瞻能力。作者在 40 自由度多链系统仿真和 6 自由度实体平台上验证,并称在动态杂乱环境中比动态优化 fabrics 和 MPC 基线获得更高成功率,同时保持实时可用的求解时间。

为什么重要

纯势场或反应式控制容易被移动障碍逼入死角;完整 MPC 在高自由度机械臂、多障碍和自碰撞条件下又可能计算过重。

该方法仅优化“下一步应该朝哪个安全终端参考移动”,将长轨迹问题压缩成短 rollout 和平滑控制输入。

适合谁关注

适合机械臂、双臂机器人、移动操作系统和动态人机共域操作。

工程落地启发

可以作为 MoveIt Servo、IK 控制器或阻抗控制器的增强层:

  • 高频反应控制维持目标跟踪;
  • 10–50 Hz 短 rollout 检查未来障碍;
  • 只在预测到冲突时移动终端参考;
  • 动态障碍速度进入 rollout;
  • 姿态、关节限位和自碰撞独立约束;
  • rollout 超时或不可行时减速停止。

主要风险

方法使用凸膨胀几何,复杂网格和狭窄空间可能过于保守。论文摘要未给出明确绝对控制频率,也未说明动态障碍速度估计错误时的最坏情况。

工程判断

适合在已有 IK/Servo 控制器外围试验,比直接替换成完整 NMPC 风险更低。


6. RAVEN:强化学习不直接导航,而是调节 visibility graph 的自由空间几何

RAVEN 将全局 visibility graph、强化学习和碰撞约束 MPC 组合起来。

与让 RL 调节 MPC 权重或直接输出速度不同,RAVEN 让 RL 修改:

  • 障碍物膨胀尺寸;
  • visibility graph 的构造参数;
  • 自由空间拓扑。

这样,RL 能根据控制延迟、状态估计噪声和步态跟踪误差,主动选择更宽、更保守或拓扑不同的路径;底层 MPC 继续显式执行速度上限和碰撞约束。

为什么重要

一个几何上最短的路径可能贴障过近。对于人形、机器狗或存在明显跟踪误差的机器人,即使 MPC 理论轨迹无碰撞,也可能因为:

  • 控制延迟;
  • 状态估计噪声;
  • 步态摆动;
  • 转弯超调;
  • 机身 footprint 随姿态变化

而发生实际碰撞。

RAVEN 让学习模块调整“应该在哪里规划”,而不是直接取代安全控制器。

对机器狗的工程启发

可以将其迁移到 Nav2 或自研规划器:

  1. 传统全局规划器生成 visibility graph 或骨架图;
  2. 学习模块根据速度、控制延迟、地形和定位置信度输出膨胀参数;
  3. 狭窄通道中允许使用非均匀安全距离;
  4. MPC/TEB 负责局部跟踪和动态约束;
  5. 学习输出必须设置上下限;
  6. 系统始终保留人工标定的保守参数回退。

风险

如果 RL 过度膨胀障碍,机器人可能认为所有通道都不可通行;膨胀过小则仍可能碰撞。当前结果主要说明相对手工调参和纯 RL 的优势,摘要未提供代码与实体机器人详细频率。

工程判断

这是“学习增强传统规划”很好的架构范例,适合先用监督学习预测安全膨胀量,再考虑 RL。


7. 快慢 VLA:5 Hz 做语义推理,20 Hz 使用最新画面生成动作

该工作针对自动驾驶 VLA 的典型时序问题:大模型只能低频运行,而车辆需要高频新控制。传统做法是在模型没返回时重放上一条命令,导致大量控制输出忽略最新观测。

其架构分为:

  • 冻结的 7B 视觉语言主干,以低频读取导航指令和视觉历史;
  • 保存各层 KV Cache,作为场景长期表示;
  • 轻量 action expert 在每个 50 毫秒控制周期读取当前图像和缓存;
  • 训练时随机模拟 KV Cache 过期,使 action expert 学会处理异步陈旧上下文。

在 CARLA LangAuto-Short 路线上,系统将 route completion 从 37.0 提高到 94.0;单独使用 action expert 后完成率为 82.1,而逐帧使用最新画面进一步提高至 94.0,并减少约三分之一的闯红灯行为。单次 action expert 推理约 32 毫秒,成本不随历史长度增加。

为什么重要

这比简单“量化大模型”更接近真实机器人部署。高层语义和低层反应不应运行在同一个频率:

  • 任务、路线和语义目标变化慢;
  • 障碍物、车辆和局部状态变化快;
  • 大模型缓存可作为长期背景;
  • 当前帧必须进入每个动作周期。

工程落地启发

对无人机或机器狗,可以设计:

  • VLM:1–5 Hz,输出任务阶段、目标和语义环境;
  • action expert:15–30 Hz,读取当前点云/图像和 VLM 缓存;
  • MPC:50–100 Hz,执行动力学与安全约束;
  • 厂商低层控制器:更高频运行。

训练 action expert 时应随机模拟 0–500 毫秒的语义上下文滞后,否则仿真训练和异步部署会不一致。

主要风险

结果来自 CARLA,真实机器人上的传感器时间同步、执行延迟和算力抖动会更复杂。KV Cache 中的错误语义可能持续影响 fast expert,必须允许缓存失效和重新初始化。

工程判断

架构非常值得复用;短期可用小型视觉编码器替代完整 7B VLM,先验证异步控制链路。


8. Xiaomi-Robotics-1 与 AI Coding:规模化机器人数据遇上差分测试和质量门禁

Xiaomi-Robotics-1:超过 10 万小时真实机器人轨迹

Xiaomi-Robotics-1 采用预训练与后训练两阶段方案。预训练阶段使用 UMI 设备采集的超过 10 万小时真实操作轨迹,并通过自动标注管线,为轨迹片段生成描述场景状态变化的语言标签;后训练阶段将基础动作能力对齐到具体机器人本体和人类自然指令。

论文报告:

  • RoboCasa365 成功率达到 57.6%,此前最好结果为 46.6%;
  • RoboDojo 平均分数达到 20.07,此前最好为 13.07;
  • 数据规模和模型规模增加时,预训练与后训练性能均持续改善;
  • 更强预训练模型能以更少下游数据适配复杂灵巧任务。

但官方 GitHub 页面目前仍明确标注代码和权重即将发布,因此当前只能验证论文和排行榜结果,不能独立复现实机能力。

工程判断

这项工作最值得关注的是数据工程,而不是单一网络结构:

  • UMI 低成本采集;
  • 状态变化自动语言标注;
  • 跨本体预训练;
  • 少量实体机器人数据后训练;
  • 私有测试集独立评测。

小团队无法复制 10 万小时规模,但可以复制数据组织方式:重点标注“动作导致了什么状态变化”,而不只是整条轨迹的任务名称。


DiffTestGen:让 Agent 生成真正触发代码行为变化的测试

DiffTestGen 面向代码修改后的差分测试。它结合静态调用图和项目文档寻找有效测试入口,再向 LLM 提供定向覆盖率反馈,持续引导测试触达被修改代码。

在总计 463 个 PR 的两个数据集上,DiffTestGen:

  • 在 78.2% 的 PR 中触发旧版本与新版本的行为差异;
  • 平均 union coverage 达到 90.7%;
  • 比基线额外暴露 99 个 PR 的行为差异;
  • 与回归检测器结合后,能发现既有方法漏掉的回归缺陷。

这对 Coding Agent 尤其重要:Agent 不应只补“能覆盖新代码的测试”,还应证明修改前后行为发生了预期变化,而没有出现意外副作用。

GitHub Code Quality 正式 GA

GitHub Code Quality 于 7 月 20 日正式 GA,将 CodeQL 的确定性分析与 AI 辅助检测结合,支持:

  • PR 内维护性和可靠性问题检测;
  • Copilot Autofix 建议;
  • 组织级质量面板;
  • Cobertura XML 覆盖率展示;
  • 通过 ruleset 设置覆盖率和质量门;
  • API 管理和读取问题。

产品定价为每位活跃提交者每月 10 美元,AI 检测与 Autofix 另按使用量计费,CodeQL 的 Actions 计算费用也需另计。

GitHub 同日还允许企业直接在 Billing UI 中管理各成本中心的 AI credit pool,并可在额度耗尽后阻止继续使用或允许产生额外费用。

推荐研发流程

  1. Agent 生成代码和候选测试;
  2. DiffTestGen 类工具主动寻找旧新版本行为差异;
  3. 单元、集成和硬件回放测试运行;
  4. CodeQL 与 Code Quality 检查安全、维护性和覆盖率;
  5. ruleset 阻止质量下降或覆盖率不足的 PR;
  6. 每个仓库设置 Agent 成本中心与预算;
  7. 最终由人审核“行为差异是否符合需求”,而不只是 CI 是否绿色。

工程判断

Coding Agent 生产化的关键不是让 Agent 写更多代码,而是让每次修改都留下可验证的行为证据。


今日结论

今天最明确的趋势是:机器人和 AI Coding 都在把学习模块放进可验证的工程边界内。

  • UWB 提供绝对位置,但必须由偏置建模和多传感器滤波约束;
  • VLMM 提供动态语义,但长期地图仍需几何置信度;
  • Gaussian 地图实现实时持续更新,但碰撞地图仍应独立;
  • 主动探索由重建异常驱动,但必须防止先验误判;
  • 学习模块调节规划几何,MPC 保留硬约束;
  • VLA 低频理解、高频动作,避免旧命令长期重放;
  • 机器人基础模型依赖大规模状态变化数据;
  • Coding Agent 必须通过差分测试和确定性质量门证明修改有效。

共同原则是:

模型负责生成候选、估计先验和适应环境;几何、优化、测试和规则负责判断输出能否真正执行。

最值得深入研究或复现的 3 个方向

方向一:为现有 LIO 增加 UWB 自动标定和偏置健康检查

优先级最高。

实施步骤:

  • 使用 LIO 轨迹作为锚点标定初值;
  • 联合估计锚点位置与每个锚点的距离偏置;
  • 记录各锚点创新量和 NLOS 比例;
  • 通过 EKF 或因子图低频融合;
  • 锚点长期残差异常时自动隔离;
  • 对坡道、室内外过渡和金属货架区域单独评估。

方向二:将 frontier exploration 升级为“覆盖率 + 重建质量”双目标

在现有探索系统中加入:

  • 墙面孔洞率;
  • 局部点云密度;
  • 法向一致性;
  • 平面碎裂度;
  • 对象表面可见比例;
  • LIO 退化指标。

候选点同时根据未知空间收益、重建质量收益、路径成本和定位风险评分。

方向三:为 Coding Agent 建立差分行为验证流水线

先从高风险 C++ 或后端仓库开始:

  • 保存修改前后两个 worktree;
  • Agent 自动寻找修改代码的公共入口;
  • 生成能同时运行在两个版本上的测试;
  • 比较返回值、日志、文件、网络和性能行为;
  • 只允许符合需求说明的差异;
  • 将覆盖率和质量门写入 GitHub ruleset;
  • 记录每个成功 PR 的完整模型和测试成本。

主要来源

  • arXiv Robotics 与 Software Engineering 最新列表。
  • 工业 UWB 自动标定与多传感器融合定位。
  • Vision-Language-Motion Maps。
  • ImprovedVBGS。
  • SCAGE 主动探索。
  • Task-Space Receding Horizon Controller。
  • RAVEN RL-MPC 导航。
  • Fast-Slow VLA。
  • Xiaomi-Robotics-1。
  • DiffTestGen、GitHub Code Quality 与 AI credit pools。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。