机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-08-01

摘要

7 月 31 日,arXiv Robotics 公布 32 项新条目,Software Engineering 公布 34 项。定位建图方向最值得关注的是 RaDiVe:它把距离受限 NDT、基于多普勒速度差异的点不确定度以及神经隐式局部子图结合起来,在多个公开数据集上相对现有 4D 雷达里程计平均降低 44.4% 平移 ATE 和 21.3% 旋转 ATE,同时保持实时运行。另一项 Write-Safe Mapping 则提出一个更通用的原则:局部感知结果“看起来合理”并不意味着可以安全写入全局地图,尤其在感知歧义和定位漂移同时存在时。

导航与控制方向出现三条实用路线:X-NavDP 通过在线强化学习后训练,让同一 RGB-D 导航扩散策略跨轮式、四足和人形机器人学习脱困、长障碍绕行和本体适配;PAC-MAN 把全身控制屏障函数作为强化学习训练指导,在 Unitree G1 上使用纯机载分割深度实现 95% 的躲球成功率且无摔倒;FA-RDP 则根据接触阶段动态切换 10 Hz 多步扩散和 30 Hz 单步反应控制,在三个接触丰富任务上达到 81.7% 平均成功率。

机器人基础模型与 Agent 工程继续从“单个大模型”转向“系统编排”。RoboBRIDGE 用监控、感知、规划、控制和机器人接口五个模块包围现成 VLA;World Action Planner 让 VLM 提议动作,再用动作条件世界模型想象和搜索;PhiZero 尝试把物理变化压缩为离散“物理语言”。Coding Agent 侧,Change2Task 用仓库历史自动构造可执行任务,PAIChecker 发现 SWE-bench Verified 中约 13.6% 的 PR—Issue 配对存在错位,HALO 则在动作真正下发前重新检查依赖条件。过去 24 小时未发现 OpenAI、Anthropic 或 xAI 发布新的同级旗舰模型,今天更值得投入的是评测数据、执行协议与安全边界。

1. RaDiVe:用距离受限 NDT、多普勒一致性和隐式子图提升 4D 雷达里程计

RaDiVe 针对 4D 毫米波雷达点云稀疏、位置噪声大、虚警和多径明显的问题,提出三部分组合:距离受限 NDT 只在近距离体素对之间建立匹配,降低错误对应并改善优化稳定性;速度差异不确定度根据雷达点实测径向多普勒速度与当前自车速度预测值之间的差异,对每个点连续赋权;局部子图则通过神经隐式映射和 SDF 表面提取构造更一致、噪声更少的几何参考。

论文在多个公开数据集上报告,相比既有 4D 雷达里程计基线,平移绝对轨迹误差平均降低 44.4%,旋转误差平均降低 21.3%,同时保持实时性能。需要注意的是,论文给出的 GitHub 链接目前仍是待开放占位地址,尚不能按“已有可运行代码”处理。

为什么重要

雷达里程计过去常在两种极端之间选择:要么只使用经过强阈值筛选的少量静态点,鲁棒但信息损失严重;要么使用更多点,却容易被动态物体和多径拖坏。RaDiVe 的价值在于把几何距离、多普勒运动一致性和子图表面质量同时纳入注册,而不是仅依赖单一 CFAR 或 RANSAC 阈值。

算法模块

  • 4D 雷达点云预处理与自车速度估计;
  • 距离受限 NDT 体素匹配;
  • 基于实测/预测径向速度差的点级不确定度;
  • 神经隐式局部地图;
  • SDF 表面点提取;
  • 带不确定度权重的位姿优化。

传感器假设

系统需要能够输出三维位置和径向多普勒速度的 4D 成像雷达。若只有普通 FMCW 距离—方位数据,缺少可靠俯仰角和点级多普勒,无法直接复现完整流程。它也没有自动解决雷达—IMU 时间同步、外参漂移和高速旋转时的运动畸变。

实时性、鲁棒性与可复现性

论文明确报告实时运行,但公开摘要没有给出统一硬件、线程数和最坏帧时。代码链接当前为占位符,因此短期可复现性低于昨天的 Dense Soft Weighting 和已有开源雷达里程计。工程团队可先复现“速度差异点权重 + 常规 NDT”,再决定是否引入神经隐式子图。

工程落地启发

对于矿井、烟尘、雨雾和金属走廊,可把 RaDiVe 作为独立雷达里程计或 LIO 的退化观测源:

  1. 雷达前端输出位姿增量、速度和协方差;
  2. LiDAR 正常时低权融合;
  3. LiDAR 几何退化或受烟尘污染时提高雷达权重;
  4. 原地旋转、动态人群和强多径时,根据速度一致性主动扩大协方差;
  5. 不允许雷达单次大跳直接改写全局地图。

风险

多普勒一致并不等同于静态:与机器人具有相近径向速度的动态物体仍可能获得高权重。神经隐式子图还可能增加初始化时间和显存占用。部署前必须覆盖静止零速、原地旋转、对向车辆、并排行人、金属墙反射和降雨等测试。

2. X-NavDP:用强化学习后训练让导航扩散策略学会脱困并跨本体迁移

X-NavDP 从预训练 NavDP 出发,解决专家演示通常来自“知道完整地图的理想规划器”和单一机器人本体的问题。作者提出 Group Q-score Reweighted Matching:不直接对难以计算精确似然的扩散策略使用不稳定策略梯度,而是在同一状态下生成一组轨迹,按 Q 值做组内归一化,再用加权 score matching 把概率质量转移到更优轨迹。

训练还加入自举式行为扰动,在保留预训练先验的同时混合有目标与无目标轨迹,扩大脱困和长障碍绕行探索;轻量 FiLM 调制把机器人本体信息注入策略,使轮式 Dingo、Unitree Go2 和 Unitree G1 可以共享训练。项目已公开代码、配置和预训练/后训练权重入口,依赖 Isaac Sim 5.0、Isaac Lab、acados 及额外下载的场景和机器人资产。

为什么重要

视觉局部导航策略最常见的失败不是普通避障,而是局部最小值:死胡同里只会面向目标顶住障碍、长墙前左右犹豫、换到宽度和转弯半径不同的机器人后仍沿用原策略。X-NavDP 证明扩散策略可以在不丢掉多模态轨迹先验的前提下,通过在线 RL 后训练学习这些“专家数据中缺少的恢复行为”。

性能

项目报告仿真总体成功率从 61.20% 提升至 84.28%,SPL 从 58.95% 提升至 77.19%;真实困难场景平均成功率从 10% 提升至 65%。真实测试覆盖 Turtlebot、Unitree Go2 和 Unitree G1,每种设置只有 10 次试验,因此结果具有启发性,但置信区间仍不充分。

传感器与系统假设

策略使用 RGB-D 局部观察,并依赖底层本体控制器执行轨迹。它不是完整导航栈:不负责长期全局拓扑规划、定位漂移修正、地图回环或硬碰撞约束。训练需要大量并行仿真、场景资产和低层控制器权重。

工程落地启发

对机器狗或轮足平台,建议把 X-NavDP 放在局部规划层:

  • 全局层仍由 A*/拓扑图提供阶段目标;
  • 扩散策略只生成 1–3 秒短轨迹;
  • 根据机器人宽度、最小转弯半径、侧移能力和最大角速度输入本体条件;
  • ESDF/碰撞检测对候选轨迹做最终过滤;
  • 进入死胡同后允许短暂背离目标并后退;
  • 超时或无安全候选时停住,而不是强制输出动作。

风险

仿真中的深度、动力学和碰撞边界通常比真实传感器干净。异步推理若没有处理动作重叠和观测过期,可能产生轨迹跳变。对楼梯、低矮障碍和透明物体,还需要独立可通行性估计,不能只依赖 RGB-D 策略。

3. PAC-MAN:感知可观测性决定 CBF 能否真正转化为硬安全

PAC-MAN 将全身控制屏障函数与强化学习结合,用于人形机器人躲避高速来球。部署策略只看到头部相机生成的“语义分割掩膜后的深度图”和本体状态;训练时则计算球体到每个身体连杆的距离屏障,并用对抗式人体动作先验约束躲避姿态。

作者比较两种 CBF 结构:Link-CBF 以每个连杆的球面近似距离作为训练奖励,不在运行时执行投影;Joint-CBF 则可把最危险身体点的安全条件转成关节速度仿射约束,并通过闭式投影修正动作。但 Joint-CBF 需要更准确的球状态,在固定头部相机可观测性不足时会退化;当加入跟踪云台或特权状态滤波时才恢复优势。

实体结果

最终部署的是更轻量的 Link-CBF 策略。Unitree G1 使用 ZED 深度和 EfficientTAM 分割,在没有实体微调的情况下完成 20 次手抛球测试,躲过 19 次,成功率 95%,没有摔倒,并可对训练中未出现的不同球体工作。

为什么重要

“有 CBF”并不自动等于安全。屏障约束依赖威胁位置、速度和机器人连杆状态是否可观测。若相机无法稳定估计来球速度,运行时硬投影可能基于错误状态做出更糟动作。PAC-MAN 最有价值的结论,是安全结构必须与实际感知能力共同设计。

算法模块

  • 球体语义分割和深度掩膜;
  • 全身连杆距离屏障;
  • CBF 训练奖励或关节速度投影;
  • 强化学习全身策略;
  • 人体动作先验;
  • 站立恢复和回位循环。

工程落地启发

对机器狗、无人机和机械臂,可采用同样分层:

  1. 训练期使用精确仿真状态构造安全奖励;
  2. 运行期只保留由真实传感器可靠支持的约束;
  3. 对无法观测的速度和接触状态使用保守边界;
  4. 硬 CBF/QP 放在策略之后,并记录每次修正量;
  5. 当修正量持续过大时,触发降级或停止,而不是让 RL 与安全层长期对抗。

风险

Link-CBF 在该系统中只作为训练引导,并不是形式化运行时安全保证。95% 成功率来自受控抛球测试,不能外推到多目标、遮挡、相机失焦或机器人移动中的高速威胁。真实系统仍需关节限位、跌倒保护和紧急停机。

4. FA-RDP:接触前保留多模态,接触后切换高频力反馈

FA-RDP 观察到同一接触任务在不同阶段需要不同推理模式:接触前通常存在多条可行接近轨迹,低频多步扩散更能保留多模态;接触后几何和力约束迅速收窄,控制重点转为快速响应力反馈。固定频率策略必须在“多样性”和“反应速度”之间妥协。

系统使用共享的视觉—力 Transformer,在统一时间网格上支持两种频率:接触前以 10 Hz 多步扩散输出较长动作块;当学习到的多模态指标表明动作分布收窄后,切换到 30 Hz 高速模式。为了避免高频模式仍需多次去噪,作者提出 Manifold Consistency Distillation,让学生直接预测机器人动作流形上的动作,并保留 DDPM 残差监督,实现单步采样。

实验结果

项目页在翻箱、拨动开关和按按钮三个任务上各测试 20 次。FA-RDP 平均成功率为 81.7%,最佳对照 ImplicitRDP 为 51.7%;始终使用高频模式时平均成功率为 61.7%,说明动态频率切换贡献约 20 个百分点。FA-RDP 在接触前覆盖四种有效接近模式,而纯高频策略坍缩到一种。

为什么重要

这项工作提供了一个比“所有控制都越快越好”更准确的结论:高频是接触后的需求,接触前的多步生成仍有助于绕开障碍和保留备选动作。对扩散策略,频率、动作块长度和去噪步数应该随任务阶段变化。

传感器假设

需要同步视觉、本体状态和可靠力/力矩反馈。项目没有说明低成本单轴力传感器或估算接触力是否足够。视觉—力时间同步、滤波延迟和机械臂阻抗控制品质都会直接影响切换判断。

工程落地启发

可迁移到插接、旋钮、抽屉、充电枪和机器人狗接触环境任务:

  • 自由空间阶段低频规划较长动作块;
  • 接近接触时缩短动作块;
  • 检测到力变化后切换高频单步策略;
  • 底层阻抗/力控制继续执行硬限制;
  • 多模态指标异常抖动时使用滞回阈值,避免频繁切换。

可复现性与风险

项目页和视频已公开,但代码标记为“coming soon”。当前只覆盖三个受控任务和有限试验次数。学习到的切换器若把视觉遮挡、传感器噪声误判为接触阶段,可能过早坍缩动作模式;若切换过晚,则仍会因力反馈频率不足丢失接触。

5. RoboBRIDGE:VLA 只做动作预测器,可靠机器人 Agent 需要完整编排层

RoboBRIDGE 提出一个围绕现成 VLA 的模块化代理框架,由 Monitor、Perceptor、Planner、Controller 和 Robot Interface 五部分组成。Monitor 负责快速失败检测和分层恢复;场景偏离当前计划时,Planner 触发重规划;Perceptor 异步更新场景理解,避免感知刷新阻塞动作执行;Controller 将操作拆成较稳定的原子技能,并通过独立 LoRA 适配器微调不同技能。

作者在 LIBERO、RoboCasa 和多个真实机器人/VLA 骨干上报告,RoboBRIDGE 相比单独策略和已有 VLA 增强方式表现更稳定。论文已被 IROS 2026 接收,但 arXiv 页面没有给出公开代码仓库,因此目前更适合参考架构,而不是直接集成。

为什么重要

很多 VLA Demo 的失败原因不在动作模型本身:观测更新太慢、动作块执行中发生偏差、失败后没有恢复、机器人 SDK 与策略动作定义不一致。继续扩大模型参数,无法自动补齐这些系统能力。

工程落地启发

实际工程可以直接借用五层边界:

  • Monitor:监控定位、碰撞、力矩、动作超时和任务进度;
  • Perceptor:异步维护对象、可通行区域和接触状态;
  • Planner:负责阶段任务和失败后的新计划;
  • Controller:执行短动作块、MPC 或厂商技能;
  • Robot Interface:统一坐标系、单位、限幅、时间戳和急停。

对于机器狗上楼梯,VLA 可只决定“接近楼梯、对齐、进入登梯模式、平台转向”等阶段;步数闭环、障碍距离和 vx/vy/vw 限制应由 Monitor 与 Controller 管理。

风险

模块化会引入更多状态机和接口错误,尤其是 Planner、Monitor 和底层控制器同时试图纠正动作时。必须定义唯一动作所有权、明确抢占优先级,并让急停和安全控制拥有最高权限。

6. World Action Planner 与 PhiZero:世界模型开始从像素预测转向可搜索的动作和离散物理变化

World Action Planner 让 VLM 先提出初始动作计划,再使用多任务、姿态—图像条件的世界模型想象执行结果,并通过优化和搜索反复精化。机器人关节位姿通过正向运动学渲染成骨架图,作为世界模型条件。项目展示了 LIBERO 组合任务、新布局和零样本 Robosuite 任务,并已公开世界模型代码、环境和演示 notebook。

PhiZero 则探索另一种表示:不直接在高维像素空间中隐式学习全部物理规律,而是从相邻视频状态中提取离散“物理语言”符号。其流程先由自回归视觉语言模型根据首帧和动作意图预测物理变化序列,再由视频扩散解码器渲染未来。项目页称,四秒、33 帧视频只使用 256 个离散符号,相比 Wan2.2 VAE 的 44,800 个连续 token 少约 175 倍;训练数据从 5 万小时公开视频中筛选出 1 万小时,并构造 500 万个四秒片段。

为什么重要

端到端动作策略擅长熟悉分布内任务,但缺少显式“试想后果”的机制。World Action Planner 代表推理时搜索路线,适合低频、长时域和新布局;PhiZero 代表压缩世界变化表示的路线,希望让物理推理脱离昂贵像素 token。

适合谁关注

  • 需要组合任务和新场景泛化的机械臂团队;
  • 希望用世界模型筛选动作块而不是直接执行 VLA 的团队;
  • 研究视频世界模型、动作条件仿真和跨本体运动迁移的团队;
  • 有足够 GPU 和视频数据、能接受低频规划的实验室。

工程落地启发

世界模型不应直接成为安全控制器。更合理的用法是:

  1. VLM/策略生成有限候选;
  2. 世界模型预测候选结果;
  3. 几何碰撞、关节限制和任务条件过滤;
  4. MPC 或短动作控制器执行首段;
  5. 每次新观察后重新规划。

PhiZero 类离散物理 token 可用于检索相似转移、失败分类或生成训练数据,但在证明动作可控性和误差界限前,不应直接替代动力学模型。

可复现性与风险

World Action Planner 仓库已公开,但需要独立世界模型服务器、Wan 基础文件、多个仿真环境和检查点,部署成本较高。PhiZero 代码仍标记为即将开放,项目页给出的多数指标来自作者评测。视频看起来物理合理不等于机器人状态、力和接触量准确,尤其在遮挡和刚体碰撞中。

7. Coding Agent:训练数据、评测配对和运行时动作都需要独立验证

Change2Task 从仓库历史中的合并 PR 构造可执行 Agent 任务。它不会简单检出旧 commit,而是将历史证据映射到健康的现代代码基线,通过 Patch Reversal、Code Mapping 或 Agent Reconstruction 重建任务状态,再验证“健康基线 → 待修状态 → 修复状态”的完整生命周期。作者从 1,130 个可构造变更出发,在 Bug 修复、功能增加、测试生成、API 迁移和安全修复五类任务中达到 79.6% 的验证构造成功率,比基于 PR 的对照多恢复 29.2% 的验证任务。

PAIChecker 则指出常用基准本身存在标签问题。作者检查 SWE-bench Verified,发现 13.6% 实例存在 PR 与 Issue 错位,原因包括 PR 实际解决了额外问题、Issue 描述不足或补丁对应范围不同。其三阶段多 Agent 检查结合模式识别、跨 Agent 标签合成和代码级验证,在 SWE-Gym 与 SWE-bench Multilingual 上最高达到约 92.12% 和 91.67% 二分类准确率。

HALO 关注执行阶段:Agent 一次响应可能同时包含通知、请求、交接和动作,而外部条件在真正执行前可能已经变化。HALO 保留仍满足依赖的组件,对每个动作在下发前重新检查精确条件,并只允许用新生成候选替换被阻止动作。在十次冷启动 PX4/Gazebo 测试中,它阻止了全部陈旧路线,未观察到对应陈旧 setpoint,并完成所有新路线恢复。

CoGate 则在代码生成解码阶段引入安全专家模型,但只在专家自身置信度足够时增强其影响,避免 OOD 情况下低质量安全模型误导主模型。论文在 CodeGen、DeepSeek-Coder、Qwen-Coder 和 StarCoder 上测试,在 CWEval 的 Func-Sec@10 指标上最高比既有 co-decoding 提升 12.6%。

为什么重要

Coding Agent 的质量不能只用“最终测试是否通过”衡量:

  • 任务可能由错误 Issue—PR 配对构造;
  • 环境可能已过时或无法稳定复现;
  • 安全专家可能在陌生代码上给出错误建议;
  • Agent 计划在生成时有效,但执行时条件已经变化。

这四项工作分别覆盖任务供应、评测标签、生成安全和运行时协议,形成更完整的工程链路。

适合接入真实研发流程吗

Change2Task 和 PAIChecker 更适合用于内部评测平台,而不是直接放进每次编码会话。企业可从历史修复 PR 自动生成回归任务,并在人类抽检前用错位检查器筛除不可靠实例。HALO 的思想则应直接进入 Agent Harness:shell、部署、数据库迁移、机器人命令和 GitHub 写操作都必须在调用瞬间重新验证权限、资源版本和前置条件。

模型发布观察

截至 2026 年 8 月 1 日 09:00(Asia/Shanghai),OpenAI 官方新闻页最近的旗舰模型仍是 7 月 9 日发布的 GPT-5.6;Anthropic 最近的主要模型发布仍是 6 月 30 日的 Claude Sonnet 5;xAI 最近的旗舰模型仍是 7 月 16 日的 Grok 4.5。过去 24 小时未发现新的同级旗舰模型正式发布,因此今天没有把“无新模型”包装成单独新闻。

工程落地启发

  • 内部 Agent 基准必须保存任务基线 commit、环境镜像、测试命令和修复 oracle;
  • 从 PR 生成任务时检查 Issue 与补丁是否真正对齐;
  • 安全审查同时使用静态扫描、测试和模型建议,不信任单个安全模型;
  • 每个外部动作使用乐观并发控制或版本号,执行前重新读取目标状态;
  • 部署、删除、数据库写入和机器人动作必须支持拒绝、回滚和人工接管;
  • Agent 最终自述不能作为完成证据,必须由外部验证器确认。

风险

自动构造的任务可能继承历史补丁中的偶然实现,而不是唯一正确解;多 Agent 检查也会产生相关性错误。HALO 类协议只能保证声明过的依赖,无法保护未建模条件。真正安全的 Agent 系统仍需最小权限、隔离环境、不可绕过的策略引擎和可追溯审计日志。

今日结论

今天最值得关注的不是一套“端到端替代全部传统模块”的系统,而是多个边界正在变得更清楚。

定位建图方面,RaDiVe 将几何邻域、多普勒运动和地图表面质量共同用于雷达注册;Write-Safe Mapping 提醒我们,在定位漂移时必须先判断一次观测是否有资格写入全局地图。导航和控制方面,X-NavDP 用 RL 后训练补充专家演示缺少的脱困行为,PAC-MAN 说明 CBF 必须服从真实感知可观测性,FA-RDP 则让策略频率随接触阶段变化。

机器人基础模型方面,RoboBRIDGE 把 VLA 限定为编排系统中的一个动作模块,World Action Planner 和 PhiZero 分别探索“搜索想象结果”和“压缩物理变化”的路线。Coding Agent 侧,可靠性也不再只是换更强模型,而是任务构造、标签检查、解码安全、动作前重检和执行审计的系统问题。

最值得深入研究或尝试复现的方向

方向一:复现 RaDiVe 的速度差异点权重,并接入现有 NDT/ESKF

先不实现神经隐式子图,只在已有 4D 雷达数据上计算点的实测径向速度与当前自车运动预测值之差,将其转为连续权重,接入 NDT 或 GICP。与普通强度阈值、CFAR 点云和 RANSAC 静态点筛选比较 ATE、原地旋转漂移、动态物体场景和计算耗时。验证有效后,再增加 SDF 局部子图。

方向二:在现有机器人局部导航中加入“允许暂时背离目标”的脱困策略

参考 X-NavDP,但不必立即训练完整扩散 RL。可先建立死胡同、长墙和窄通道数据集,让局部规划器生成含后退、侧移、转身和长距离绕行的多候选轨迹;用碰撞、进度和控制代价做组内排序。重点评估卡死率、恢复时间和对不同机器人 footprint 的适配。

方向三:给 Coding/Robot Agent 增加动作下发前的版本化重检

为每个动作记录生成时依赖:目标文件 SHA、分支 HEAD、数据库版本、机器人模式、地图版本、任务阶段和安全状态。执行前重新读取并比较;任何依赖变化都禁止使用旧动作,只允许重新规划。先在 GitHub 写操作和仿真机器人导航中验证陈旧动作拦截率与恢复成功率。

参考资料