摘要

arXiv Robotics 在 7 月 27 日公开了 31 项新条目,Software Engineering 同日公开了 28 项。本期最值得关注的不是新的“大一统 SLAM”,而是几项更接近真实系统的改进:把 FAST-LIO2 类 LIO 从 10 Hz 点云输出改造成 200 Hz 飞控状态源;利用地磁为长期定位提供航向和跨会话回环线索;以固定复杂度的雷达—相机网络生成实时度量深度;以及用 conformal prediction、在线行为学习和 MPPI 为现有规划器补充安全边界。

机器人学习侧出现了一个明确分工:世界模型不应同时学习机器人控制器、机器人几何和环境交互。新工作开始把机器人轨迹生成、URDF 渲染和触觉接触显式拆出,使模型把能力集中在“环境会如何响应动作”上。AI Coding 侧则继续从单 Agent 生成代码转向测试质量治理、并行 Agent 写权限控制和跨客户端企业策略。

1. Flight-Ready LIO:FAST-LIO2 精度够用,但默认运行架构不适合飞控闭环

《Flight-Ready LiDAR-Inertial Odometry for Embedded Drone Platforms》分析了一套典型 IESKF + ikd-Tree LIO 在无人机部署中的五个系统问题:里程计输出绑定 10 Hz LiDAR 频率、没有完整速度输出、点云处理阻塞 IMU、互斥锁竞争,以及同步竞态。作者没有修改估计器数学模型,而是加入 IMU 频率前向传播、机体系速度输出、SLERP 平滑、双 executor 隔离和显式同步保护。最终里程计发布频率由约 10 Hz 提升到稳定的 200 Hz,并能在短时 LiDAR 丢失期间维持连续状态。实机使用 Livox MID360、Pixhawk 4 Mini 和动捕真值。

为什么重要

这篇对你的无人机和机器狗项目很有现实意义。很多人发现窄通道飞行“反应迟滞”后,会优先更换飞控、规划器或 SLAM 算法;但如果飞控实际接收到的是 10 Hz 位姿、没有同步速度,或者 IMU 回调被点云匹配阻塞,那么再强的控制器也只能追踪过时状态。

适合谁关注

使用 FAST-LIO2、Point-LIO 或其他 IESKF LIO,并将输出直接接入 PX4、MPC、MPPI、速度闭环或高动态机器人控制的团队。

工程落地启发

建议把状态估计接口明确拆成两条链路:

  • 高频传播链:每个 IMU 样本输出姿态、位置预测、机体系速度和时间戳;
  • 低频校正链:LiDAR 到达后更新滤波状态,再平滑修正高频传播结果。

需要重点记录的不是 ROS topic 标称频率,而是:

  • IMU 到状态发布的 P50、P95、P99 延迟;
  • LiDAR 优化期间丢失或积压的 IMU 数量;
  • 状态时间戳与真实发送时间的差值;
  • 飞控收到的速度是否与位置微分一致;
  • LiDAR 短时断流后的状态连续性。

风险与可复现性

论文摘要没有给出公开代码入口,因此可能需要根据文章自行移植。200 Hz 输出也不代表每个状态都是新测量结果,其中大部分是 IMU 传播值;IMU 偏置、时间同步和外参仍决定短时漂移。

工程判断:今天最值得优先复现的 LIO 工作。对现有 FAST-LIO2 改动较集中,收益可以直接在飞控闭环中量化。

2. DB-VIO:旋转和平移分支解耦,重点改善高动态姿态估计

DB-VIO 针对学习式 VIO 常用单一时序模型同时回归旋转和平移的问题,将估计器拆成专用旋转分支和位移分支。视觉侧引入深度线索改善单目几何表示,惯性侧加入显式积分姿态先验,使 IMU 特征包含更明确的旋转运动学信息。论文报告相对对应基线在 KITTI 上提升约 20%、EuRoC 上提升约 33%;在 EuRoC 高动态运动中,旋转指标提升 65.7%。

为什么重要

旋转与平移的观测性质不同:

  • 陀螺仪对短时旋转非常敏感;
  • 单目视觉的平移受尺度和深度影响更大;
  • 快速转动可能导致图像模糊,但姿态仍能由 IMU 维持;
  • 将两者完全混在一个隐状态中,容易让网络学习到数据集相关的耦合关系。

DB-VIO 的模块化思路可以迁移到混合式 VIO,即使不使用完整端到端模型,也可以为旋转和位移维护不同的网络辅助量或噪声模型。

工程落地启发

更稳妥的实现不是立即替换传统 VIO,而是:

  • 保留预积分和滑窗几何后端;
  • 使用学习模型估计视觉深度或匹配置信度;
  • 使用独立旋转网络预测陀螺偏置或姿态增量修正;
  • 位移分支只输出尺度、速度或观测协方差;
  • 网络输出必须经过 IMU 与多视图几何一致性检查;
  • 网络超时或 OOD 时回退纯几何估计。

风险与可复现性

当前页面没有公开代码,也没有端侧算力、延迟和显存数据。论文主要报告 KITTI、EuRoC 指标,尚不能证明在事件相机、鱼眼、严重运动模糊或长期温漂环境中优于成熟 VIO。

工程判断:方法结构有价值,但目前更适合作为传统 VIO 的学习辅助模块,而非生产系统的完整替代品。

3. Mag4D-SLAM:地磁开始从“电子罗盘”升级为长期定位和回环传感器

Mag4D-SLAM 是一个面向室外长期定位的多模态数据集,包含 14 条序列、总长超过 18 公里,同步记录 LiDAR、相机、IMU、三轴磁力计和 GNSS,并提供 SE(3) 真值。路线同时包含白天/夜间、正向/反向重复行驶,用于研究地磁场跨会话重复性、无漂移全局航向,以及利用磁场特征进行地点识别。

为什么重要

磁力计在机器人系统中经常只作为一个容易受干扰的 yaw 观测,因此很多 LIO 项目干脆弃用。但长期运行时,地磁可能提供两个 LiDAR/视觉不易获得的信号:

  • 无 GNSS 环境下的弱绝对航向参考;
  • 重复走廊、昼夜外观变化或几何相似区域中的跨会话地点特征。

它不需要额外基础设施,成本也远低于雷达或 RTK。

工程落地启发

不应将原始磁航向直接强融合到 EKF。更合理的是建立“磁场健康度 + 地图匹配”链路:

  • 对电机电流、姿态和位置建立磁干扰模型;
  • 机器人静止或低电流时更新磁偏置;
  • 将局部磁场序列而非单点航向作为地点描述子;
  • 磁场与 LiDAR/视觉候选回环一致时才加入后端;
  • 航向观测采用可切换因子或鲁棒核;
  • 在强磁设备、钢结构和电机负载突变时自动禁用。

风险

机器人自身电机、线缆、钢结构和载荷可能产生比环境磁场更强的扰动;换平台或改变电源布线后,磁场指纹可能变化。数据集证明了研究价值,但并不意味着普通手机级磁力计可直接提供可靠定位。

工程判断:值得作为 LIO 的低成本辅助方向,尤其适合长走廊、地下空间和昼夜重复巡检。

4. JustDepth:用雷达提供尺度,用相机补稠密结构,推理复杂度不随雷达点数增长

JustDepth 是单阶段雷达—相机深度估计器,训练时只需要雷达、相机和单帧 LiDAR 深度监督。它把所有雷达回波聚合为固定宽度的一维表示,因此运行时间不依赖雷达点数;随后通过 Height Fusion Block 和轻量 GNN 传播全局深度。置信度解码器只在训练期间使用,不增加部署成本。论文在 nuScenes 上报告保持精度的同时,将推理速度提高 39.7 倍,并将条纹伪影指标降低 66%。

为什么重要

对于恶劣天气、低照度或远距离目标:

  • 相机有丰富纹理,但没有可靠尺度;
  • 毫米波雷达有距离和速度,但极其稀疏;
  • LiDAR 几何稳定,但成本、功耗和雨雾性能并非总是理想。

JustDepth 的价值在于把 LiDAR 限制在训练监督阶段,部署时只使用雷达和相机。

适合谁关注

自动驾驶、低成本户外机器人、雨雾环境感知、雷达产品化,以及拥有 FPGA/SDR 和视觉软件能力的小团队。

工程落地启发

可以将稠密深度作为中间表示,服务于:

  • 动态目标检测和速度估计;
  • 雷达—视觉目标关联;
  • 远场 free-space 判断;
  • 视觉目标的度量距离补全;
  • LiDAR 盲区或故障时的降级感知。

但用于避障时应保留三类置信度:雷达直接测量、网络插值区域和纯视觉推断区域,并设置不同的安全膨胀。

风险与可复现性

项目页面已提供,但摘要没有给出具体部署硬件、绝对毫秒延迟和跨雷达型号表现。nuScenes 汽车雷达与低成本工业毫米波雷达的角分辨率和回波特性差别很大,迁移通常需要重新训练。

工程判断:雷达—视觉产品中很值得跟进,工程价值高于单纯用雷达做目标检测。

5. Conformal Constraint Tightening:无需替换规划器,也能为未知动力学增加概率安全裕度

该工作提出一种与规划器无关的约束收紧方法。系统只要求拥有近似标称动力学,以及一批标称轨迹与真实轨迹的偏差数据。通过 conformal prediction,方法估计标称—真实轨迹偏差的概率上界,再按照该边界收紧障碍物、状态或任务约束。只要标称模型下的收紧问题可行,真实系统就能以预设概率满足原约束。

为什么重要

很多机器人已经拥有能工作的 A*、RRT、MPC 或 MPPI,但在真实系统上会因为以下误差贴障或失败:

  • 控制延迟;
  • 轮胎或足端滑移;
  • 风扰和载荷变化;
  • 模型参数偏差;
  • 状态估计误差。

传统方法只能人工增大固定安全距离,而 conformal tightening 可以从真实执行误差中估计与目标置信度对应的裕度。

工程落地启发

可以直接包裹现有规划器:

  • 在不同速度、载荷和地形下记录预测—执行偏差;
  • 按任务类型或工况划分 calibration set;
  • 计算给定置信水平下的轨迹偏差分位数;
  • 在规划前收紧通道、障碍距离和状态限制;
  • 数据分布变化时重新校准;
  • 样本不足或 OOD 时退回最大保守裕度。

对于 MID360 无人机,可以把位置、速度和姿态跟踪误差共同转换成随速度变化的三维安全管道。

风险

Conformal 保证依赖校准数据与部署数据具有适当的可交换性。若从室内低速数据推断室外高速风扰,概率保证可能失效。约束收紧也可能过于保守,使窄通道完全不可行。

工程判断:很适合给现有 MPC、MPPI 和轨迹规划器增加数据驱动安全裕度,改造风险低于训练新的 Safe RL。

6. GRACE:Diffusion Policy 用于动作先验,MPPI 处理不可微安全约束

GRACE 将预训练 diffusion policy 与 MPPI 结合。传统 diffusion guidance 通常要求代价函数可微,因此无法直接处理二值碰撞检测、黑盒仿真代价和部分关节限制。GRACE 在每个反向扩散步骤,以 diffusion 的反向均值为中心执行一次 MPPI 更新,仅依赖前向代价计算,从而构造受代价约束的动作后验。

论文在仿真中优于 diffusion 和采样式基线,并在真实 7 自由度机械臂上加入训练时未出现的障碍物:未引导策略每次都会碰撞,而 GRACE 能够绕开该障碍。代码和实验视频已经提供。

为什么重要

这是较合理的学习策略部署方式:

  • Diffusion Policy 负责提供接近示范分布的动作先验;
  • MPPI 负责在部署时处理新障碍和黑盒代价;
  • 不需要为了每种安全约束重新训练策略;
  • 不要求碰撞检测或仿真器可微。

工程落地启发

可用于机械臂,也可迁移到移动机器人:

  • 学习策略生成符合专家行为的局部轨迹;
  • MPPI 使用真实 footprint、碰撞查询和动力学代价修正;
  • 近障时提高采样密度,开阔区域降低计算量;
  • 对 MPPI 修正幅度设置上限;
  • 修正过大说明先验已失效,应触发传统规划器重规划;
  • 最终动作继续经过速度、加速度和力限制。

风险

在 diffusion 的每个反向步骤运行 MPPI 会增加推理成本,摘要没有给出完整控制频率。MPPI 只能优化提供给它的代价,如果碰撞地图漏检或代价设置错误,GRACE 不会自动安全。

工程判断:非常适合“已有模仿策略,但部署环境会临时变化”的机器人操作系统。

7. 世界模型分工升级:触觉负责接触,URDF 渲染负责机器人本体

ViTacWorld:同时预测视觉和触觉结果

ViTacWorld 是动作条件的视觉—触觉世界模型,使用公开真实触觉数据和构建的仿真环境扩展视觉—触觉—动作轨迹。模型给定机器人动作后,同时预测时间对齐的视觉画面和触觉反馈,用于生成训练 rollout,也用于在受控动作序列下评估策略。作者认为触觉直接锚定物理接触,在部分任务上可能比纯视觉具有更小的 sim-to-real gap。

Robot-Factored World Model:不要让模型重复学习控制器和机器人外观

另一项工作指出,直接用动作命令条件化世界模型,会迫使模型同时学习“命令如何经过控制器变成机器人运动”和“机器人运动如何影响环境”。该方法先将动作经过现有控制器和运动学转换成部署时可获得的标称轨迹,再根据 URDF 把机器人几何渲染到图像和深度中。世界模型只观察渲染后的机器人运动,重点学习物体如何响应接触。论文报告这种接口优于向量动作条件,并能泛化到未见过的机器人本体。

为什么重要

两项工作共同说明,机器人世界模型不应是一个完全黑盒:

  • 控制器和运动学可由已有系统提供;
  • 机器人几何可由 URDF 精确渲染;
  • 触觉用于补充视觉不可见的接触;
  • 世界模型集中学习环境响应和对象运动。

工程落地启发

一个实用的世界模型输入可以包括:

  • 相机 RGB/depth;
  • 由底层控制器预测的短时机器人轨迹;
  • URDF 渲染的机器人深度和 mask;
  • 力、触觉或关节力矩;
  • 当前对象状态和任务阶段。

模型输出的未来只用于候选动作排序和数据生成;碰撞、力和动力学仍由独立模块验证。

风险与可复现性

ViTacWorld 提供项目页面,但真实触觉硬件差异很大;Robot-Factored 方法依赖准确 URDF、外参和控制器模型。渲染轨迹如果与真实执行偏差过大,世界模型会基于错误的机器人未来进行预测。

工程判断:这是比“动作向量直接喂视频模型”更有前景的世界模型架构,适合构建跨本体训练平台。

8. AI Coding:并行 Agent 需要写入准入控制,TDD 需要先验证测试本身

Claim Plane:在 Agent 写代码前声明修改意图

Claim Plane 要求每个并行 Coding Agent 在动手前声明版本化 ChangeIntent,包含基础 commit、资源、依赖和计划操作。确定性控制面原子化判断多个意图能否并行,限制同文件写入区域,对未声明重叠进行串行化,并在依赖失效或权限模糊时 fail closed。其小规模机制测试中,静态模式 6/6 通过但完全串行;动态范围允许部分任务继续并行,完成 7 次范围提升,并拒绝了两次未声明写入。作者明确说明样本太小,不能据此作性能结论。

TDD 与 MineValiCoder:测试代码也可能是错误源

一项 vibe coding + TDD 探索实验发现,Agentic 工作流适合快速生成可工作的生产代码,但容易引入需求未明确要求的额外实现决策,而这些决策常没有对应测试;人类—模型协作工作流则更容易产生组织良好的测试套件。

MineValiCoder 进一步将测试质量当作一等对象:先通过自验证过滤错误测试,再并行优化多个代码候选,最后通过代码—测试二部图进行相互验证,避免一个错误测试把整个迭代方向带偏。论文在 HumanEval、MBPP、APPS 和 LiveCodeBench 上报告了较强结果,但仍属于代码生成基准,而非大型真实仓库。

7 月 27 日 GitHub 工程更新

GitHub 已将企业托管设置扩展到 Copilot App 和 Cloud Agent。企业可以统一限制插件、插件市场、命令/文件/URL 操作是否允许绕过审批,并使托管值覆盖开发者本地设置;Copilot App 也获得独立启停策略,不再与 CLI 策略绑定。

最新模型状态

在本次核查的主要官方更新中,7 月 27 日没有新的通用旗舰模型发布。当前最近的重要旗舰仍是 Anthropic 于 7 月 24 日发布的 Claude Opus 5,价格为每百万 token 输入 5 美元、输出 25 美元,面向长程 Agent、复杂编码和专业工作;OpenAI 最近的旗舰家族仍是 7 月 9 日发布的 GPT‑5.6 Sol、Terra 和 Luna。

对真实研发流程的建议

一个任务开始前,Agent 应声明:

  • 基础 commit;
  • 准备修改的文件、符号和配置;
  • 依赖的其他任务;
  • 是否可能新增依赖或数据库迁移;
  • 必须执行的测试和验收证据。

执行期间,未声明写入必须重新申请,而不能静默扩大范围。测试也要经过验证:至少使用修改前版本运行,确认它确实能捕获目标缺陷;随后再在修改后版本上验证通过。

工程判断:并行 Agent 的关键不是“多开几个会话”,而是确定性的写权限、测试可信度和统一策略执行。

今日结论

今天最值得关注的工程变化不是又出现一个更大的模型,而是系统接口开始被认真重构:

  • LIO 输出从点云频率提升到 IMU 频率,使定位真正适配控制;
  • 学习式 VIO 将旋转和平移建模解耦,但仍需几何后端约束;
  • 地磁、雷达和相机开始作为长期定位与恶劣环境感知的互补传感器;
  • Conformal tightening 用真实误差修正规划安全裕度;
  • GRACE 用 diffusion 提供先验,用 MPPI 处理部署时黑盒约束;
  • 世界模型把机器人控制器、机器人几何和环境响应拆开建模;
  • Coding Agent 将规划权与实际写权限分离,测试本身也需要验证。

共同原则是:

模型负责产生测量、先验和候选;估计器、优化器、控制器和验证器负责决定它们是否能够进入真实系统。

最值得深入研究或尝试复现的 3 个方向

方向一:将 FAST-LIO2 改造成真正的飞控状态源

  • 将 IMU propagation 与点云更新线程隔离;
  • 以 IMU 频率发布 pose、body velocity 和协方差;
  • 记录每条状态的测量时间与发布时间;
  • 对 LiDAR 校正使用平滑注入,避免位姿跳变;
  • 模拟 0.2–2 秒 LiDAR 丢失;
  • 比较改造前后 PX4/MPC 的跟踪延迟、超调和窄通道最小净空。

方向二:地磁航向与磁场回环接入 LIO 后端

  • 采集白天/夜间、正向/反向重复路线;
  • 同步记录磁力计、电机电流和 LIO 轨迹;
  • 先评估磁场序列跨会话重复性;
  • 构建磁场地点描述子和航向置信度;
  • 只有与 LiDAR/视觉候选一致时加入回环;
  • 在钢结构、电机负载变化和传感器安装变化下做失效测试。

方向三:为并行 Coding Agent 建立 ChangeIntent 准入层

  • 每个 Agent 在修改前声明 commit、文件、符号和测试;
  • 同文件同区域冲突自动串行;
  • 未声明写入触发重新审批;
  • worktree、锁和权限绑定到 intent 版本;
  • 测试必须在旧版本证明能失败、在新版本证明能通过;
  • 合并前删除未被需求和测试覆盖的额外实现决策。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。