摘要

arXiv Robotics 最新公开批次标记为 2026 年 7 月 13 日,共包含 33 项;由于跨越周末,其中多篇论文实际于 7 月 10 日提交。本期从这一最新批次及同期官方更新中筛选 8 条高价值动态。

今天的核心趋势可以概括为四点:

  1. SLAM 地图正从单纯几何或渲染表示,转向兼顾增量重建、语义查询和机器人可用性的层级地图。
  2. MPPI 和机器人策略不再只优化成功率,而开始直接处理扰动统计、连续轨迹表示和接触力安全。
  3. Sim-to-real 的重点正在从扩大随机化范围,转向引入 CFD、解析运动学和全局教师等更可信的物理或信息先验。
  4. AI Coding 工程治理开始将提示注入检测、代码质量成本和 Agent 使用费用纳入常规研发预算。

1. AnythingReality:ORB-SLAM3 与在线 3D Gaussian Splatting 开始形成完整增量系统

AnythingReality 将 ORB-SLAM3 位姿估计、在线 3D Gaussian Splatting、VR 场景浏览和语音驱动的视觉语言模型交互整合在同一系统中。它没有假设外部精确位姿或干净深度,而是面向带噪真实数据进行在线重建。

论文在自建数据和 TUM-RGBD 上报告了相对现有在线 Gaussian Splatting 方法的图像质量提升,并提供不同质量—速度配置;系统还允许用户通过语音描述场景并记录兴趣点。

为什么重要

当前大量 3DGS SLAM 工作主要展示渲染质量,但真实机器人还需要:

  • 在线增量建图;
  • 稳定的相机位姿;
  • 可查询的语义对象;
  • 地图兴趣点记录;
  • 面向操作者的可视化与交互。

AnythingReality 的意义不是提出全新的前端,而是证明传统特征 SLAM、Gaussian 地图和 VLM 语义层可以组成一条完整工程管线。

算法模块

  • ORB-SLAM3:相机跟踪、关键帧与回环基础;
  • 在线 Gaussian reconstruction:增量稠密重建;
  • VR 渲染管线:浏览当前重建结果;
  • 语音识别与 VLM:场景描述、对象识别和兴趣点记录。

传感器假设

系统主要面向 RGB-D 或可获得深度信息的视觉输入。ORB-SLAM3 的跟踪质量仍直接决定 Gaussian 地图的一致性;在低纹理、运动模糊和动态场景下,重建层无法弥补错误位姿。

实时性与鲁棒性

论文称不同配置下帧率可与对比方案相当或更高,但摘要没有给出统一硬件上的绝对跟踪、优化和渲染频率。其鲁棒性主要来自成熟的 ORB-SLAM3 前端,而不是 Gaussian 表示本身。

可复现性与落地风险

arXiv 页面目前没有明确列出公开代码。主要风险包括:

  • 回环后 Gaussian 地图如何全局变形或重建;
  • 动态人员和物体造成残影;
  • 长时间建图后的显存增长;
  • VLM 对三维对象位置的描述是否具备度量准确性。

工程判断

适合作为“传统 SLAM 前端 + 3DGS 可视化后端”的参考架构,但不应把 Gaussian 地图直接当成导航碰撞地图。


2. Hydra++:层级 3D Scene Graph 开始补齐物体级形状与 LiDAR—相机户外能力

Hydra++ 在层级 3D Scene Graph 中加入类别无关的物体形状估计,并通过重投影掩膜一致性检查,拒绝因局部观测或分割误差产生的退化形状。

默认配置使用较快的 CRISP 形状估计器进行在线处理,同时将较慢的 SAM3D 作为可替换模块,用来研究精度与延迟之间的权衡。系统还加入 LiDAR—相机混合模式,以改善户外稀疏、噪声深度环境中的场景重建质量。

为什么重要

普通点云地图主要回答“哪里有障碍”,但机器人执行高层任务还需要回答:

  • 这里是什么房间或区域;
  • 哪些对象属于该区域;
  • 对象之间是什么空间关系;
  • 物体的完整形状和占用范围是什么;
  • 某个对象是否适合抓取、绕行或检查。

Hydra++ 把地图从点、体素和语义标签提升到“对象—地点—关系—形状”的层级结构,更适合长期自主机器人和语言任务规划。

算法模块

  • 层级 Dynamic Scene Graph;
  • 类别无关物体形状补全;
  • 分割与形状重投影一致性检测;
  • RGB-D 或 LiDAR—相机几何融合;
  • CRISP、SAM3D 等可插拔形状估计器。

传感器假设

室内可使用相机与深度,户外模式依赖 LiDAR 提供更稳定的几何。系统仍需要可靠的机器人位姿和实例分割,因此通常应运行在现有 VIO/LIO 后端之上。

实时性与鲁棒性

论文明确将系统定位为实时场景图构建,但不同形状估计器延迟差异明显。更适合的工程模式是:

  • 在线使用快速、较粗的形状估计;
  • 仅对任务相关对象调用高质量慢速模型;
  • 后台异步更新对象形状;
  • 导航继续使用独立的体素或 ESDF 地图。

可复现性与风险

论文提供项目页面,并已被 IROS 接收,可复现性优于只有摘要的工作。风险在于错误实例分割可能生成重复对象,形状补全也可能“补出”实际不存在的几何。

工程判断

适合用作长期语义地图和任务规划层,不建议替代底层实时避障地图。


3. Adaptive MPPI:在线学习空间变化的扰动协方差,并收紧稳定性界限

该工作研究扰动协方差未知、随空间位置变化并缓慢随时间漂移时的 MPPI 控制。作者提出按空间单元维护的递归协方差估计器,并通过空间扩散让访问较少区域从邻近区域获得统计信息。

估计得到的协方差会直接进入 MPPI 的采样分布。论文进一步给出稳定性分析,指出经过可计算的学习时间后,自适应控制器的理论稳定性界限可以严格优于失配的固定协方差配置。论文同时开放了仿真代码。

为什么重要

标准 MPPI 往往使用固定噪声协方差,但真实机器人不同区域的扰动可能完全不同:

  • 地面机器人在地砖、草地和碎石上的打滑程度不同;
  • 无人机在建筑背风面、门口和狭窄通道中的气流不同;
  • 机器狗在斜坡、湿滑面和松软地面上的足端误差不同。

固定采样噪声过小时,控制器难以覆盖真实扰动;过大时则会产生高抖动和不必要的保守动作。

算法模块

  • 空间网格化扰动统计;
  • 在线递归协方差估计;
  • 空间平滑与时间漂移建模;
  • 基于估计协方差的 MPPI 采样;
  • 带学习误差项的稳定性证书。

传感器假设

必须能够计算“预测状态与实际执行状态”的残差。对于移动机器人,可由定位和轮速得到;对于无人机,则可由状态估计器和动力学预测得到。

实时性与鲁棒性

协方差更新本身较轻量,主要算力仍来自 MPPI rollout。空间单元过细会导致数据不足,过粗又无法表示局部扰动差异。

可复现性与风险

作者开放了仿真代码,但当前结果以数值实验为主,尚未展示真实机器人闭环。

风险包括:

  • 定位误差被错误当作动力学扰动;
  • 动态障碍造成的轨迹变化污染统计;
  • 长时间未访问区域的旧协方差失效;
  • 协方差变大后控制器采样过于激进。

工程判断

非常适合在现有 MPPI 中做增量实验,建议先只用协方差调节采样强度和安全距离,不要立即替换全部噪声模型。


4. B-spline Policy 与 PAC-ACT:机器人策略开始同时优化轨迹连续性和接触安全

4.1 B-spline Policy:从离散 action chunk 转向连续参数曲线

B-spline Policy 不再预测逐时刻的离散动作,而是预测 B 样条的节点和控制点。底层控制器可以以更高频率采样该连续曲线,并通过时间缩放改变执行速度。

论文在仿真和真实任务中报告,在保持较强成功率的同时显著缩短任务完成时间。

这种表示的工程价值包括:

  • 轨迹天然平滑;
  • 网络输出维度可低于高频离散动作序列;
  • 可在不重新推理策略的情况下改变执行速度;
  • 便于底层控制器计算速度和加速度;
  • 更容易加入 jerk、关节速度和加速度限制。

主要风险是控制点预测的小误差可能影响整段轨迹,并且仅保证曲线平滑不代表保证无碰撞或满足动力学约束。

4.2 PAC-ACT:在行为克隆 ACT 上进行 chunk 级强化学习后训练

PAC-ACT 以预训练 Action Chunking Transformer 为起点,通过 actor-critic 进行 chunk 级强化学习后训练,并使用混合行为先验约束,防止在线探索过度偏离原有示范分布。

论文面向工业精密接触任务,报告了成功率、接触稳定性和力安全改善;在 Contour 任务中,超过 60 N 的力读数比例降低了 46 倍。

工程启发

这两项工作可以组合:

  1. 使用行为克隆获得基本动作能力;
  2. 策略输出 B 样条或短连续轨迹参数;
  3. 通过 RL 后训练处理初始位姿扰动和接触偏差;
  4. 使用行为先验限制策略偏离示范;
  5. 底层阻抗或 MPC 控制器执行连续轨迹;
  6. 超过力、速度或关节限制时截断 action chunk。

可复现性与风险

B-spline Policy 提供项目页面;PAC-ACT 页面暂未列出公开代码。PAC-ACT 的工业指标有吸引力,但仍需确认真实控制频率、力传感器配置和在线训练安全机制。

工程判断

B 样条动作表示适合快速接入现有 diffusion policy 或 ACT;RL 后训练则应先在数字孪生或带硬限制的低速设备上进行。


5. TACTIC:RGB-D、分布式触觉与解析接触雅可比进入采样式 MPC

TACTIC 面向全臂多接触操作,例如使用机械臂多个连杆同时推动、翻转或穿越受限环境。

它使用 RGB-D、分布式触觉和紧凑二维邻近表示,构建动作条件的潜在动力学模型;同时通过接触雅可比将解析运动学引入预测过程。未来接触状态与作用力预测随后进入采样式 MPC,采样动作会被投影到有利于调节接触力的方向。

为什么重要

多数机械臂规划器默认除末端执行器外,机械臂其他部分不应与环境接触。但在以下任务中,主动全臂接触反而更有效:

  • 扶起或移动人体模型;
  • 推动大型柔性物体;
  • 狭窄空间中依靠环境支撑;
  • 使用前臂和肘部辅助操作;
  • 服务机器人与人体进行安全物理交互。

算法模块

  • RGB-D 环境感知;
  • 分布式触觉阵列;
  • 学习式潜在接触动力学;
  • 解析运动学和接触 Jacobian;
  • 接触感知的 sampling-based MPC;
  • 任务进度与接触力联合代价。

实时性和传感器条件

系统需要覆盖多连杆的触觉或接触感知能力,这比只在夹爪安装力传感器复杂。论文展示了真实机器人任务,但摘要没有给出 MPC 频率、rollout 数量和硬件配置。

落地风险

  • 触觉阵列安装和标定成本高;
  • 软覆盖层会改变机械臂外形和动力学;
  • 学习模型在未见接触组合上可能产生错误力预测;
  • 采样 MPC 必须设置独立的硬力限制;
  • 人机接触不能只依赖学习模型保证安全。

工程判断

适合研究型服务机器人和医疗辅助机器人;普通工业机械臂可先从少量关键连杆的碰撞力估计开始。


6. CORAL-AUV:用 CFD 代理模型缩小强化学习水动力 sim-to-real 差距

CORAL-AUV 使用 CFD 数据训练快速的阻力代理模型,再将代理模型嵌入强化学习训练环境。这样既避免直接在每次 rollout 中运行昂贵 CFD,又比简单二次阻力模型更接近真实水动力。

作者称这是首次将基于 CFD 代理阻力模型训练的策略零样本部署到六自由度 AUV。相较使用简化物理训练的控制器,其能耗降低 31%,航点间运动速度提高 11%,误差降低 19%;策略在水池和野外环境中均进行了测试。

为什么重要

Domain Randomization 只能在仿真模型能够表达的物理范围内随机化。如果底层阻力、升力或耦合项本身错误,扩大参数范围也很难获得真正鲁棒的策略。

CORAL-AUV 的思路适用于更多机器人:

  • 用 CFD 代理无人机桨叶—机体气流;
  • 用有限元代理柔性结构;
  • 用轮胎模型代理高速车辆接地力;
  • 用土壤模型代理履带或足端沉陷;
  • 用系统辨识模型代理电机、减速器和液压执行器。

算法模块

  • 离线 CFD 数据生成;
  • 车辆专用水动力代理模型;
  • 快速 RL 仿真;
  • 参数随机化;
  • 六自由度闭环策略;
  • 水池和野外零样本验证。

实时性

CFD 只在离线生成数据时运行,在线策略仅调用轻量代理模型或神经策略,因此具备实时部署可能。

可复现性与风险

论文没有在摘要页列出代码。CFD 网格、边界条件和真实载体表面误差会直接影响代理模型。如果机器人结构改变,通常需要重新生成 CFD 数据。

工程判断

这是本期 sim-to-real 价值最高的工作,尤其适合动力学受流体或复杂接触影响、但可离线高精度仿真的机器人。


7. CoDiMAD:训练时使用全局信息,部署时实现无通信多机器人协同

CoDiMAD 针对无通信、局部可观测的多机器人协作。其流程分为三阶段:

  1. 用 MAPPO 训练可以访问全局信息的教师策略;
  2. 收集“局部观测—教师动作”离线数据;
  3. 将教师蒸馏为每个机器人独立运行的条件扩散策略。

作者指出,相同的局部观测可能对应多个不同全局状态,需要完全不同的协同行为。确定性蒸馏往往把这些动作平均成犹豫或无效输出,而扩散模型可以表示多峰动作分布并采样一个完整协作模式。

为什么重要

通信在真实机器人中经常不稳定:

  • 地下、隧道和建筑内部无线信号差;
  • 多机器人共享高带宽地图成本高;
  • 通信延迟可能超过控制周期;
  • 安全系统不能假设网络永远存在。

CoDiMAD 试图把训练阶段的全局协调知识压缩进每个机器人的本地策略。

传感器假设

部署时每个机器人仅使用本地传感器观测。实际效果取决于局部观测是否包含足够线索,例如邻居相对位置、障碍物、目标方向和历史状态。

实时性

扩散策略通常需要多步去噪,其部署延迟可能高于普通 MLP 或 Transformer。真实机器人中可能需要少步采样、蒸馏或动作缓存。

可复现性与风险

论文目前只表示代码将在论文接收后公开,现阶段无法直接复现。实验包含三个协作任务,但尚不足以证明在真实通信中断、传感器遮挡和机器人数量变化下的泛化。

主要风险是多峰策略虽然避免平均动作,但也可能在不同机器人间采样到不兼容模式。工程上仍需加入:

  • 碰撞规避安全层;
  • 短期历史或共享随机种子;
  • 通信恢复后的状态对齐;
  • 策略不确定性过高时的保守模式。

工程判断

适合无通信协同探索和编队研究,但距离直接替换显式任务分配或分布式规划器还有明显距离。


8. AI Coding 与模型动态:安全扫描和费用治理成为 Agent 工程的必要组成

8.1 CodeQL 开始检测系统提示注入数据流

GitHub CodeQL 2.26.0 新增 JavaScript/TypeScript 的 js/system-prompt-injection 查询,用于检测不可信用户输入流入模型 system prompt 的情况。它还补充了 OpenAI、Anthropic 和 Google GenAI SDK 中更多提示词与系统指令 sink。

这项变化非常关键,因为很多 Agent 应用的主要风险不是传统 SQL 注入,而是:

  • 用户数据被拼入系统提示词;
  • 网页、邮件或文档中的恶意文本影响 Agent;
  • 检索结果覆盖开发者指令;
  • Agent 被诱导调用 shell、网络或文件工具;
  • 不可信数据进入高权限工具的参数。

8.2 GitHub Code Quality 将于 7 月 20 日转为收费

GitHub 在 7 月 13 日开放 Code Quality 许可证费用估算,并确认该产品计划于 2026 年 7 月 20 日正式收费,标准价格为每位活跃提交者每月 10 美元。

该费用不包含 CodeQL 使用的 GitHub Actions 分钟,也不包含 Copilot Autofix 等按用量收费的 AI 功能。

8.3 最新模型判断

本次检查的 OpenAI 官方更新中,最新旗舰模型家族仍是 7 月 9 日全面发布的 GPT-5.6;过去一个公开更新日内没有发现需要替代这一判断的新一代旗舰发布。GPT-5.6 将模型划分为 Sol、Terra 和 Luna 三档,并加入 max 单 Agent 推理和 ultra 多子 Agent 模式。

今天更值得关注的不是再次比较模型榜单,而是开发团队需要把模型、Agent、静态分析和费用统一管理。

推荐研发管线

  1. Agent 先读取仓库级规范、架构与测试要求;
  2. 每个任务使用独立 worktree 或容器;
  3. 禁止不可信内容直接进入 system prompt;
  4. MCP、shell、浏览器和网络访问使用白名单;
  5. Agent 修改后运行单元测试、集成测试和 CodeQL;
  6. 对提示注入、密钥、SSRF 和依赖漏洞设置阻断规则;
  7. 记录每个 Agent 任务的模型、token、费用和人工修改量;
  8. PR 只有在自动验证和人工复核后才能合并。

工程判断

Agent 编码能力已经足以进入日常研发,但高权限自动化必须按供应链安全系统治理,而不能继续当作普通聊天工具。


今日结论

本期最重要的工程变化不是某个单点模型刷新,而是机器人和 AI 开发系统都在走向“混合架构”:

  • SLAM 使用成熟位姿前端,叠加 Gaussian 重建和场景图;
  • MPPI 使用在线数据修正扰动统计,而不是固定参数;
  • 操作策略使用连续轨迹表示、RL 后训练和传统控制器共同保证执行;
  • sim-to-real 使用 CFD 或解析模型补足纯随机化无法覆盖的物理;
  • 多机器人在训练时利用全局信息,部署时保留本地自主性;
  • Coding Agent 由静态分析、权限隔离、费用管理和人工审查包裹。

这类架构的共同点是:学习模型负责难以手工建模的部分,几何、物理和工程规则负责约束模型不能犯的错误。

最值得深入研究或尝试复现的 3 个方向

方向一:给现有 MPPI 增加空间扰动统计

优先级最高,改造成本相对较低:

  • 记录预测轨迹和实际轨迹残差;
  • 按地图网格维护位置、速度或姿态扰动协方差;
  • 对相邻网格做有限平滑;
  • 根据协方差调节 MPPI 采样强度;
  • 高扰动区域自动降速并扩大障碍物安全距离;
  • 分离定位跳变与真实动力学误差。

适合无人机风扰、机器狗滑移和轮式机器人复杂地面。

方向二:构建“LIO/VIO + Hydra++”双地图结构

保留现有 LIO/VIO 和体素地图,不改变底层导航:

  • 几何层继续负责定位、碰撞和局部规划;
  • Hydra++ 类场景图负责对象、地点和关系;
  • 仅对任务相关对象运行高质量形状补全;
  • 对象位置通过后端位姿更新;
  • 语义层错误时不得影响紧急避障。

这一方向特别适合巡检机器人、机器狗和自然语言指点导航。

方向三:用高保真代理模型提升 sim-to-real

选择一个当前最明显的模型误差:

  • 无人机:桨叶下洗、侧风或载荷变化;
  • 机器狗:足端摩擦和地面沉陷;
  • 轮式机器人:轮胎滑移;
  • 水下机器人:水动力阻力。

离线运行高精度仿真或采集真实数据,训练轻量代理模型,再将代理模型嵌入 RL 或 MPC。重点比较的不是仿真 reward,而是:

  • 零样本真实成功率;
  • 能耗;
  • 轨迹误差;
  • 扰动恢复时间;
  • 对结构和负载变化的泛化能力。

主要来源

  • arXiv Robotics 最新列表与 7 月 13 日公开批次。
  • AnythingReality。
  • Hydra++。
  • Adaptive MPPI。
  • B-spline Policy 与 PAC-ACT。
  • TACTIC。
  • CORAL-AUV。
  • CoDiMAD。
  • GitHub CodeQL、Code Quality 与 OpenAI GPT-5.6 官方更新。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。