机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-08-06

摘要

arXiv 在 2026 年 8 月 5 日公开的最新批次中,Robotics 列表包含 55 条记录,Software Engineering 列表包含 52 条记录。本期已先读取 helywin/daily 的去重索引,并排除截至 8 月 5 日已经完整报道的条目。最终筛选 7 条主动态,其中 6 条直接涉及 SLAM、标定、轨迹优化、MPC 或足式控制。(arXiv Robotics 最新列表arXiv Software Engineering 最新列表

今天最值得关注的技术变化有四点:

  1. 几何 Transformer SLAM 开始尝试跨越十几公里运行,但长程一致性仍依赖显式回环图和全局几何优化;
  2. MPC 的性能瓶颈正在从数学形式转向 GPU kernel 组织、跨时域同步和显存流量;
  3. 黑箱或学习动力学也可以通过局部策略 rollout 近似 Jacobian,进入 multiple shooting 轨迹优化;
  4. AI Coding Agent 的常见重复工具轨迹可以编译成确定性工作流,但不可逆副作用和未见过的分支必须继续交给 Agent 或人工处理。

在本次核验的 OpenAI 官方发布页和 GitHub Copilot 官方更新源中,没有发现 8 月 5 日新发布且足以进入本期主动态的通用大模型或代码模型,因此本期不以旧模型新闻凑数。(OpenAI 官方发布页GitHub Copilot Changelog

1. SLAMFormer-∞:几何 Transformer SLAM 开始跨越 17 公里长程场景

公开时间:2026-08-05 最新公开批次;论文 v1 提交于 2026-08-04。

SLAMFormer-∞ 试图解决几何 Transformer SLAM 的长程扩展问题。系统不再让一个 Transformer 持续处理完整历史,而是使用 memory condition 为不同局部窗口定义可变坐标系和尺度:前端在局部坐标系中持续估计稠密几何与相机运动,后端周期性联合优化局部轨迹和结构;发现回环或任务结束时,再通过全局 Pose-Geometry Graph Optimization 统一调整位姿与几何。作者在自采约 17 公里、45 分钟的驾驶序列上展示了连续运行。(论文项目页

为什么重要

VGGT、DUSt3R 系列方法证明了大型几何模型可以从图像直接推断相机和点图,但它们通常受固定窗口、显存和统一坐标尺度限制。SLAMFormer-∞ 的关键价值不是简单增加上下文,而是把大型模型重新放回经典 SLAM 的分层架构:局部窗口承担实时连续性,显式图结构承担长程回环和全局一致性。

这也说明,当前学习式 SLAM 尚未真正摆脱图优化。模型可以改善局部几何表示,但数公里轨迹中的漂移、回环和尺度传播仍需要可检查的全局约束。

算法模块

  • RGB 图像输入与 calibration-free 稠密点图预测;
  • memory-conditioned 局部几何 Transformer 前端;
  • 周期性局部后端联合优化相机与场景结构;
  • 回环候选和局部子图连接;
  • Pose-Geometry Graph Optimization 联合调整位姿与几何;
  • 局部坐标系与尺度之间的转换和传播。

传感器假设

系统当前以 RGB 相机为主要输入,没有使用 IMU、LiDAR 或轮速提供高频运动先验。它适合验证纯视觉大模型的几何能力,但在快速运动、运动模糊、低照度和重复纹理中,缺少惯性传播会增加前端丢失风险。

实时性

项目结果显示其能够处理长程数据,但论文训练使用 48 张 A100 GPU,室内和室外训练窗口、分辨率也经过专门配置。当前公开信息没有给出 Jetson 或普通桌面 GPU 上完整前端、后端和全局优化的固定最坏延迟,因此不能仅凭长序列结果判断其已经适合实时机器人部署。(论文

鲁棒性

在 KITTI、Waymo 和 7-Scenes 等数据上,全局 PGGO 相对只运行局部模型进一步降低了轨迹误差,说明显式全局结构确实有价值。但论文也明确指出,PGGO 使用前端和回环模块给出的预定义图;如果回环图缺边或出现错误连接,全局优化本身不会自动修复图拓扑。(论文

可复现性与风险

项目页已公开,但当前没有列出完整训练与推理代码。主要落地风险包括:

  • 训练资源远超一般机器人团队;
  • 长程动态交通和光照变化可能导致几何模型域外失效;
  • 回环图质量决定全局优化上限;
  • 纯视觉系统缺少高速惯性传播和故障冗余;
  • 稠密几何地图的内存、裁剪和长期更新策略仍需工程化。

适合谁关注

适合研究学习式 SLAM、几何基础模型、长程视觉定位,以及希望把 DUSt3R/VGGT 类模型接入传统图优化后端的团队。

工程落地启发

更现实的近期方案不是用它替换现有 LIO/VIO,而是让几何 Transformer 作为低频局部重建与回环验证模块:

  1. VIO 或 LIO 继续输出高频局部状态;
  2. 几何模型处理关键帧窗口并生成稠密结构;
  3. 模型输出只作为带协方差的局部子图;
  4. 回环仍需描述子检索和几何验证;
  5. 全局因子图负责 RTK、轮速、反光标志和回环融合;
  6. 模型超时或不确定时自动退回传统前端。

2. PLS-Calib:用偏最小二乘稳定事件相机与里程计旋转外参标定

公开时间:2026-08-05 最新公开批次;论文 v1 提交于 2026-08-04。

PLS-Calib 面向地面机器人事件相机与里程计之间的旋转外参标定。传统相关分析方法需要白化协方差,在运动激励不足或事件统计退化时容易出现病态矩阵。该工作改用 Partial Least Squares,直接最大化事件特征与里程计运动之间的协方差,并设计考虑事件极性的时空表示,得到闭式旋转解。论文已被 IROS 2026 接收。(论文

为什么重要

事件相机适合高速和高动态范围环境,但其数据不是普通帧图像,无法简单复用相机—IMU或相机—轮速的标准外参流程。对轮式机器人而言,地面运动本身还带有平面约束,运动激励有限,数值稳定性比理论可解性更重要。

PLS-Calib 的工程价值在于:它不要求完整重建事件图像,也不依赖复杂非线性批量优化,而是将事件统计与里程计角运动压缩成一个稳定的相关问题。

算法模块

  • 将事件按时间、位置和极性形成局部特征;
  • 从轮式里程计提取相邻时段旋转运动;
  • 使用 PLS 建立事件表示和里程计运动之间的低维关联;
  • 避免 CCA 中显式协方差白化;
  • 通过闭式分解恢复传感器间旋转外参;
  • 使用目标图案和多段运动进行统计聚合。

传感器假设

需要事件相机、可靠里程计,以及近似平面运动的地面平台。当前方法只估计旋转外参,不解决三维平移、时间偏移和轮速尺度误差。

实时性与实验结果

真实平台使用 Clearpath Jackal 和 DAVIS 346,数据由 Jetson Orin 采集,离线标定在桌面 CPU 上运行。真实实验中,Andreff 和 CCA 方法的旋转误差分别约为 74.65° 和 40.73°,PLS-Calib 降至约 3.18°;合成不同平面路线中,其误差约为 0.23°–1.05°。(论文

鲁棒性

PLS 避免了小样本或相关变量下协方差逆的病态问题,但它仍依赖运动段能够提供足够旋转变化。持续直行、低事件率、重复闪烁、轮滑和里程计跳变都可能污染相关关系。

可复现性与风险

当前页面没有公开完整代码。真实数据的参考旋转来自 DAVIS 同传感器的 APS 图像,而不是外部高精度运动捕捉,因此 3.18° 不能等同于绝对真值误差。其他限制还包括:

  • 仅旋转标定;
  • 使用特定标定图案;
  • 假设平地运动;
  • 未联合估计时间偏移;
  • 尚未展示长期在线外参漂移跟踪。

适合谁关注

适合事件相机 VIO、轮式机器人高速视觉、低照度定位,以及需要标定事件相机和轮速/里程计坐标系的团队。

工程落地启发

可将 PLS 结果作为非线性联合标定的初值:

  1. 先用 PLS 得到稳定旋转;
  2. 再联合优化旋转、平移和时间偏移;
  3. 以轮滑检测剔除异常运动段;
  4. 同时监测事件率和运动激励;
  5. 标定结果进入 VIO 前先进行重投影与闭环轨迹验证。

3. CUDA MPC:把跨时域 ADMM 压缩成单个融合 CUDA Kernel

公开时间:2026-08-05 最新公开批次;论文 v1 提交于 2026-08-04。

这项工作针对长预测时域非线性 MPC,将相邻时间步之间的耦合通过 ADMM 拆分,并让每个时间块在 GPU 上并行计算。真正的技术重点不是简单使用 CUDA,而是把完整迭代融合成单个 persistent kernel:变量长期保留在 shared memory,相邻 block 通过原子标志同步,从而避免每轮 kernel launch 和全局显存往返。(论文

为什么重要

许多 GPU MPC 实现虽然并行 rollout,但优化器仍频繁启动 kernel、读写全局显存,预测时域变长后调度和内存开销会吞掉算力。该工作表明,对结构规则的优化问题,kernel 组织方式可能比更换求解算法本身带来更大收益。

算法模块

  • 非线性动力学局部线性化;
  • 按时间维度进行变量分裂;
  • ADMM 处理相邻时间块一致性;
  • 每个 block 负责一个或一组时域节点;
  • shared memory 保存局部变量;
  • 原子标志执行相邻块同步;
  • persistent fused kernel 完成整轮优化;
  • warm start 用于滚动 MPC。

传感器与动力学假设

算法本身不限制传感器,但要求状态估计器能够在控制周期内提供低延迟状态,并且系统动力学可微或可局部线性化。模型严重失配时,GPU 只能更快求出错误模型下的解。

实时性

测试硬件为 Intel i7-12700H 和 RTX 3060 Laptop 6 GB。在长度 1000 的问题中,kernel launch 从 172456 次降为 1 次,显存流量由约 17.42 GB 降至 31.2 MB,单迭代由约 0.86 ms 降到 0.006 ms;部分规模下,相对同一分裂算法的 tensor-framework 实现最高加速约 965 倍。(论文

10 智能体、预测长度 100 的集中式群体案例中,该实现约 28.22 ms,可落在 100 ms 控制周期内;acados 和 CasADi 配置需要数秒,另一 iLQR 基线虽约 26.37 ms,但在局部极小值中出现死锁或碰撞。(论文

鲁棒性

这是求解速度工作,不自动提高感知、建模或安全鲁棒性。ADMM 的停止容差、线性化质量和 warm start 会影响约束违反量;共享内存容量也限制状态维度、智能体数量和预测长度。

可复现性与风险

作者表示代码将在论文接收后公开,目前尚不能直接复现。论文的主要实验仍在 RTX 3060 Laptop 上,尚未完成 Jetson 等嵌入式 GPU 和真实机器人闭环验证。(论文

其他风险包括:

  • persistent kernel 可能长期占用 GPU,影响感知线程;
  • block 同步设计对 GPU 架构敏感;
  • 高维接触动力学可能超出 shared memory;
  • first-order ADMM 可能需要较多迭代才能达到严格约束精度;
  • 多模块共享 GPU 时最坏延迟可能明显高于单程序测试。

适合谁关注

适合无人机、机械臂、多机器人 MPC,以及已经确认求解器瓶颈来自 kernel launch 和内存访问的团队。

工程落地启发

迁移前应先做时间剖析:

  1. 分开统计线性化、QP/ADMM、kernel launch 和内存复制;
  2. 只有时域结构规则且 GPU 开销占主导时才值得重写 persistent kernel;
  3. 为定位、检测和 MPC 设置独立 CUDA stream 和优先级;
  4. 监测最坏延迟而非平均延迟;
  5. 保留 CPU 或短时域降级控制器;
  6. 对每次解做约束违反量和动力学残差检查。

4. 随机 Multiple Shooting:通过局部策略 rollout 为黑箱动力学构造近似 Jacobian

公开时间:2026-08-05 最新公开批次;论文 v1 提交于 2026-08-04。

《Stochastic Multiple Shooting Trajectory Optimization via Sequential Local Policy Evaluation》将长时域轨迹拆成多个短段,并在段与段之间使用局部反馈策略连接。对于无法直接求导的仿真器、真实系统或神经网络动力学,它通过多次带扰动 rollout 评估局部策略,估计状态转移和代价对段初始条件的近似 Jacobian,再用 multiple shooting 协调所有段。(论文

为什么重要

经典 iLQR、DDP 和 direct shooting 通常要求可微动力学或稳定的有限差分。面对黑箱仿真器、接触系统和学习模型时,长时域梯度会迅速失真。Multiple shooting 通过引入中间状态,将长链敏感性拆成短段;局部反馈策略又比单纯开环扰动更能稳定 rollout。

算法模块

  • 将整条轨迹分成多个 shooting segment;
  • 每段维护短控制序列和局部反馈策略;
  • 对初始状态和控制施加随机扰动;
  • 从 rollout 统计近似状态转移 Jacobian;
  • 估计局部代价和终端连接误差;
  • 全局协调各段初始状态与控制;
  • 迭代收紧段间连续性约束。

动力学假设

不要求显式解析模型,但要求在局部扰动范围内,系统响应能够用一阶近似描述。若系统存在强烈不连续接触、模式切换或碰撞,局部 Jacobian 可能随采样发生突变。

实时性与结果

论文在解析 cartpole、神经网络 cartpole 和 VTOL quadplane 上评估。VTOL 模型包含 22 维状态和 9 维输入,任务是在 2.5 秒内从约 15 m/s、15 m 高度状态转入距离目标 1 m 内且速度低于 2 m/s 的着陆状态。(论文

在文中对比中,MPPI 和 CEM 在 quadplane 任务上未成功,而 multiple shooting 方案成功完成;相同方法也在含噪学习动力学上保持较低终端代价。(论文

鲁棒性

局部策略能够减小 rollout 发散,但算法仍依赖:

  • 采样数量;
  • 扰动尺度;
  • 局部反馈增益;
  • segment 长度;
  • 段间连续性权重;
  • 黑箱系统噪声。

噪声过大会使 Jacobian 方差增大,扰动过小又可能被数值误差淹没。

可复现性与风险

当前页面没有列出代码,实验也主要为仿真。论文将地面碰撞等事件简化为代价,尚未展示真实接触平台和硬约束保证。作者把混合动力学、接触事件和自适应 segment 划分列为后续方向。(论文

适合谁关注

适合无法获得解析 Jacobian 的飞行器、复杂仿真器、学习动力学 MPC,以及希望把真实机器人 rollout 用于局部轨迹优化的团队。

工程落地启发

可先在安全仿真中作为离线 teacher:

  1. 用真实日志拟合局部黑箱动力学;
  2. multiple shooting 生成高质量轨迹;
  3. 将结果蒸馏给低延迟策略或 residual MPC;
  4. 对接触和模式切换位置强制插入 segment 边界;
  5. 在线仅在模型置信度高且计算预算允许时使用;
  6. 真实平台 rollout 必须设置动作边界和急停。

5. BMTP:双凸最短时间轨迹规划在 521 个障碍物中实现 0.19 秒求解

时间回补:论文 v1 提交于 2026-08-03,并进入 8 月 5 日最新公开列表。入选原因是代码已公开且包含双臂实体实验。

《Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles》通过变量替换,将最短时间目标以及速度、加速度、jerk 和 snap 约束转成凸形式;碰撞约束则由随时间变化的分离超平面表达。固定轨迹时可以求最大间隔分离面,固定分离面时可以求最短时间轨迹,因此整体形成双凸交替优化。(论文项目页

为什么重要

机器人轨迹优化中,最短时间、平滑高阶导数和障碍物碰撞通常同时导致非凸问题。许多方法只能固定总时间,或把碰撞写成软惩罚。BMTP 将问题拆成两个可稳定求解的凸子问题,并且每轮都有可行轨迹和单调改善,适合作为 anytime planner。

算法模块

  • 以 Bézier/多项式表示平滑轨迹;
  • 变量替换处理总时间和高阶导数约束;
  • 凸障碍物与机器人轨迹之间构造分离超平面;
  • 固定轨迹时最大化分离间隔;
  • 固定平面时优化最短时间轨迹;
  • 只为实际碰撞的障碍物增量添加平面;
  • 使用新的分离面改变绕行侧,帮助逃离局部路径类别。

动力学与环境假设

环境障碍物需要能表示为凸集合或凸分解。算法需要一条初始多边形或轨迹种子,并假设优化期间障碍物静止。动态障碍、不确定占用和传感器延迟需要额外的时空膨胀或预测层。

实时性与实体结果

在 Drone Village 场景中,系统处理 521 个盒状障碍,生成满足速度、加速度、jerk 和 snap 限制的四阶连续轨迹;6 次迭代约 0.19 秒,得到约 11.83 秒的飞行轨迹,相对论文中的 FPP 最短时间变体快 50 倍以上。(论文项目页

双 Franka FR3 实验中,50 次规划与执行均成功且无碰撞,单阶段规划平均约 145 ms;随机双臂测试也报告全部成功。(论文项目页

鲁棒性

交替优化保证收敛到稳定点,但不保证全局最短时间。初始路径类别、凸分解和分离面选择仍会影响最终结果。障碍物几何略有误差时,极限最短时间轨迹可能缺少足够安全余量。

可复现性与风险

代码 pybmtp 已公开,采用 MIT 许可证,包含 Python 接口、C++ 碰撞内核、示例和测试,可复现性较高。(GitHub

主要风险包括:

  • 高维机器人碰撞几何凸分解复杂;
  • 动态障碍需要重新规划;
  • 最短时间目标可能贴近障碍和执行器边界;
  • 真实控制误差没有自动写入分离间隔;
  • 非凸机器人本体需要多凸体近似。

适合谁关注

适合无人机平滑轨迹、机械臂避障、双臂协同和对 jerk/snap 有严格要求的平台。

工程落地启发

对无人机可把它作为中低频轨迹生成器:

  • ESDF 或点云先转成局部凸障碍;
  • A*/GCS 提供多个初始同伦路径;
  • BMTP 分别优化并比较总时间和净空;
  • 根据定位协方差、风扰和控制残差扩大障碍物;
  • MPC 继续负责高频跟踪;
  • 轨迹执行中若净空或跟踪误差超限则立即减速重规划。

6. Light-Loco-Parkour:一个深度策略统一走、爬、下台阶和翻越动作

时间回补:论文 v1 提交于 2026-08-01。入选原因是它给出了统一技能策略、Real2Sim2Real 训练管线和零样本实体展示。

Light-Loco-Parkour 希望消除足式跑酷系统中的技能标签、手工状态机和运行时 motion graph。系统从少量动作 seed 出发,在物理仿真中通过 curriculum 扩展可跨越高度,再把多个 privileged teacher 蒸馏到一个只使用机载深度图和速度指令的循环策略。部署时,机器人根据当前地形自行在行走、平衡、攀爬、下台阶和 vault 之间切换。(论文项目页

为什么重要

许多机器狗跑酷系统需要:

  • 先识别障碍类型;
  • 再选择专用技能;
  • 运行手工 transition;
  • 对每种技能分别维护策略。

这使系统在障碍高度、形状或接近速度发生变化时容易进入错误技能。Light-Loco-Parkour 用连续视觉策略统一这些行为,说明“技能边界”可以由策略内部时序状态表达,而不一定由外部状态机硬编码。

算法模块

  • 从人或机器人 seed motion 提取基础动作;
  • 在仿真中使用物理约束和 curriculum 扩展动作能力;
  • 训练四个 privileged teacher;
  • 使用 multi-expert DAgger 收集统一监督;
  • 以 reward-only transition 训练技能切换;
  • 深度编码器加 GRU 维护时序状态;
  • 策略以 50 Hz 输出动作;
  • 训练中随机化深度帧率、延迟、噪声和丢帧。

传感器假设

部署策略只依赖一个前视深度相机和本体状态,不需要外部地图或显式障碍标签。这降低了系统复杂度,但也使性能高度依赖深度质量和相机可见范围。

实时性与结果

项目页报告,一个 45 cm 的基础动作 seed 被扩展到最高约 75 cm,相当于机器人高度的约 83%。完整策略在 60、65、70、75 cm 障碍上的仿真成功率约为 99.2%、98.8%、90.0% 和 33.4%;privileged teacher 在 75 cm 上仍约为 98.6%,说明视觉蒸馏和实体感知是极限能力的主要瓶颈。(项目页

训练时模拟 27–33 Hz 深度帧率和约 30–60 ms 延迟,策略控制频率为 50 Hz。实体机器人展示为零样本部署,但项目页明确说明定量表格主要来自仿真,真实硬件尚缺少同规模成功率统计。(项目页

鲁棒性

GRU 与多帧深度有助于处理短时遮挡和技能连续性,但单前视深度仍可能在以下场景失效:

  • 玻璃和强光;
  • 深度空洞;
  • 下楼边缘不可见;
  • 侧向障碍;
  • 动态人员;
  • 泥水、草丛和软地面;
  • 相机被身体或腿部遮挡。

可复现性与风险

当前项目页没有列出完整训练代码。风险还包括:

  • 极限高度下视觉策略与 privileged teacher 差距明显;
  • 统一策略更难定位具体失效原因;
  • 没有形式化稳定和碰撞保证;
  • 真实跌倒会造成硬件损伤;
  • 训练地形覆盖不足时可能产生自信错误动作。

适合谁关注

适合机器狗视觉跑酷、统一 locomotion policy、技能蒸馏和 sim-to-real 研究团队。

工程落地启发

对已有第三方轮足机器狗,不建议直接替换 SDK 登梯模式。更现实的是将其思想用于上层模式选择:

  1. 深度策略预测地形类别、可通行速度和失败概率;
  2. SDK 继续执行稳定步态或登梯模式;
  3. 策略只输出 vx、vy、vw 和模式切换建议;
  4. MID360 独立检查台阶、悬崖和障碍;
  5. 低置信度时减速并切回确定性状态机;
  6. 所有真实跑酷训练先在吊架和软保护区进行。

7. TraceCompiler:把重复 Agent 工具轨迹编译成带证据的确定性工作流

时间回补:论文 v1 提交于 2026-08-03,并进入 8 月 5 日最新公开列表。入选原因是它直接涉及 AI Coding/Agent 工程成本、可靠性和副作用治理。

TraceCompiler 从多次 Agent 工具调用轨迹中恢复依赖关系,再将高频、稳定的部分编译成确定性工作流。它只在某个工具参数能够唯一归因于此前某个输出时建立硬依赖;若存在多个可能来源,则标记为 suspected edge,不强行排序。参数绑定可分为常量、用户输入、直接复制、确定性转换和仍需 LLM 判断的 residual decision。(论文

为什么重要

当前 Coding Agent 或通用 Agent 经常重复执行相同的搜索、读取、转换和提交步骤。每次都让大模型重新规划,会带来:

  • token 和工具调用成本;
  • 输出格式漂移;
  • 不必要的网络访问;
  • 副作用顺序错误;
  • 调试困难。

TraceCompiler 的关键不是把全部 Agent 变成脚本,而是只编译证据充分的稳定部分,把真正需要语义判断的分支保留给模型。

算法模块

  • 收集多次成功和失败工具轨迹;
  • 分析参数值在不同步骤间的来源;
  • 建立带证据的 producer-consumer 依赖;
  • 区分确定依赖与 suspected edge;
  • 归纳常量、用户输入和输出变换;
  • 生成确定性工具 DAG;
  • 对未知分支保留 residual LLM node;
  • 对不可安全编译的流程拒绝生成。

实验结果

在 T1 依赖恢复任务中,方法的精确率约 0.928、召回率约 0.943,显著高于简单相邻步骤基线;盲编译器技能测试在 250 条边上达到约 0.992。AppWorld 实验中的依赖精确率约 0.993。(论文

Venmo 意图工作流从 34 次调用压缩到 11 次,并通过 21 个留一测试中的 15 个;失败折暴露了训练轨迹未覆盖的新分支。对 Spotify 和 Todoist 的部分任务,编译器因为不可逆副作用或依赖不确定而主动拒绝编译。

突破性工程价值

它适合把高频稳定流程变成 typed harness,例如:

  • 获取 Issue 和相关代码;
  • 创建隔离 worktree;
  • 运行固定静态检查;
  • 收集测试和覆盖率;
  • 生成结构化 PR 证据;
  • 更新日报索引。

而“应该修改哪个设计”“是否覆盖用户新代码”“能否执行生产副作用”等决策仍应由模型或人工处理。

是否适合接入真实研发流程

适合,但必须增加以下治理:

  • 工具和 schema 版本锁定;
  • 文件 revision 检查;
  • 幂等 key;
  • 不可逆写操作前人工确认;
  • 密钥和网络权限最小化;
  • 每次执行保留完整 provenance;
  • residual LLM node 有明确输入输出类型。

可复现性与风险

当前论文页面没有公开完整代码。作者也没有统计离线编译成本,因此不能仅凭调用数减少就声称总体成本一定下降。主要风险包括:

  • 训练轨迹遗漏异常分支;
  • API schema 更新导致工作流静默失效;
  • 参数值相同不代表语义来源相同;
  • 过度编译会把偶然行为固化;
  • 不可逆副作用必须拒绝自动化,而不是依赖置信度阈值。

适合谁关注

适合 Coding Agent 平台、MCP 工作流、企业自动化和多 Agent harness 团队。

工程落地启发

可以从无副作用的读取流程开始:

  1. 收集至少几十条真实执行轨迹;
  2. 只编译高频且参数来源唯一的步骤;
  3. 对搜索结果选择、代码设计和冲突处理保留 LLM;
  4. 用留一轨迹测试未见分支;
  5. 工具版本变化后自动失效重编译;
  6. 发送邮件、合并 PR、删除资源等写操作保留人工门禁。

经典论文回顾

LOAM:把高频 LiDAR 里程计与低频地图配准解耦

发表时间与历史位置: Ji Zhang 和 Sanjiv Singh 的《LOAM: Lidar Odometry and Mapping in Real-time》发表于 RSS 2014,DOI 为 10.15607/RSS.2014.X.007。它在实时三维 LiDAR SLAM 仍高度依赖昂贵计算和特定硬件的时期,提出高频低精度里程计与低频高精度地图配准的双线程结构,并获得 RSS 2024 Test of Time Award。(RSS 论文页

解决的核心问题

旋转 LiDAR 一帧扫描需要一定时间,平台在扫描期间持续运动。如果直接把整帧点云视为同一时刻,会产生运动畸变;如果每帧都与大地图执行高精度配准,又难以满足实时性。

LOAM 将问题拆成:

  • 高频 odometry:快速估计相邻扫描间运动;
  • 低频 mapping:将特征与局部地图精确配准并修正漂移。

这种解耦使系统在有限 CPU 上同时保持高频状态输出和较低地图漂移。

关键数学思想与算法模块

  • 根据扫描线局部曲率提取 sharp edge、less sharp edge、flat plane 和 less flat plane;
  • 使用扫描内运动估计进行点云去畸变;
  • 里程计线程执行 scan-to-scan 匹配;
  • 边缘点使用 point-to-line 残差;
  • 平面点使用 point-to-plane 残差;
  • 地图线程执行 scan-to-map 配准;
  • 低频地图更新反向修正高频里程计;
  • 以局部地图和 KD-tree 加速近邻查询。

传感器与运动假设

原始 LOAM 面向二维旋转形成三维扫描的 LiDAR,假设环境大部分静态、扫描期间运动连续,并且场景中存在足够的边缘和平面特征。它不要求高精度 IMU,但缺少惯性后,在高速旋转、剧烈振动和低结构场景中更容易退化。

当年为什么重要

LOAM 证明,不需要先构建完整概率地图,也可以通过稀疏几何特征和双频率优化实现低漂移实时三维 LiDAR SLAM。它长期占据 KITTI Odometry 前列,并直接影响了 LeGO-LOAM、A-LOAM、LIO-SAM 以及大量 scan-to-map 系统的架构。(RSS 论文页CMU 页面

今天仍然有效的思想

  • 里程计和地图优化使用不同频率;
  • 对扫描进行运动去畸变;
  • 边缘与平面使用不同几何残差;
  • scan-to-map 通常比纯 scan-to-scan 更稳定;
  • 局部地图应限制大小并及时更新;
  • 高速前端与低速全局后端分层;
  • 几何特征质量和退化监测比盲目增加点数更重要。

已经被后续方法替代的部分

  • IMU 预积分和紧耦合 LIO 提供更可靠高速传播;
  • FAST-LIO2 等直接方法不再依赖显式边缘/平面分类;
  • ikd-tree、voxel hash 和 surfel map 改善动态地图更新;
  • 因子图加入回环、GNSS、轮速和外参估计;
  • 现代系统增加退化检测、动态点剔除和鲁棒核;
  • 固态 LiDAR 需要适配非重复扫描和不同时间模型;
  • 多 LiDAR 系统需要分别处理时间同步、外参和重叠视场。

公开代码、数据和可复现性

原始连续 LOAM 代码曾以 BSD 形式发布,但后来从公开域移除,因此当前常见仓库多为第三方重实现,而不是作者原始版本。A-LOAM、LeGO-LOAM 和其他实现对特征阈值、优化频率和坐标约定有明显差异,复现时必须以论文残差和时间模型为准。(A-LOAMLIO-SAM

可使用 KITTI 等公开数据验证,但应重点检查:

  • 每个点的时间戳和去畸变;
  • LiDAR—IMU 外参方向;
  • scan period;
  • 曲率阈值和每扫描线特征数量;
  • 局部地图范围;
  • 优化迭代和鲁棒核;
  • 退化场景中的 Hessian 特征值。

对当前工程项目的重新解读

对于多 LiDAR、远置 IMU、轮速、RTK 和反光标志融合系统,LOAM 最值得保留的是架构分层,而不是原始特征公式:

IMU 高频传播
    ↓
各 LiDAR 独立时间补偿与特征健康度
    ↓
局部 scan-to-map LIO
    ↓
低频子图、RTK、轮速、反光标志和回环因子图

多雷达不应简单拼接后再运行原始 LOAM。更合理的是分别校正每个 LiDAR 的时间和外参,按视场与结构计算观测置信度;16 线雷达在平面和长走廊中退化时,应让 MID360、IMU、轮速和全局因子接管,而不是持续提高点云权重。

今日结论

本期最值得关注的并不是单一“全栈替代方案”,而是各层技术边界更加明确:

  • SLAMFormer-∞ 证明几何 Transformer 可以进入长程 SLAM,但最终仍依赖局部窗口、回环图和全局优化;
  • PLS-Calib 说明在受限地面运动中,数值稳定的统计标定可能比更复杂的非线性模型更实用;
  • CUDA MPC 表明实时优化的决定因素常常是 kernel 融合和内存流量,而非论文中的渐近复杂度;
  • 随机 Multiple Shooting 为黑箱动力学提供了介于采样控制和显式梯度优化之间的路线;
  • BMTP 展示了最短时间、平滑高阶导数和实体碰撞约束可以通过双凸分解获得较稳定的 anytime 性能;
  • Light-Loco-Parkour 减少了手工技能图,但真实系统仍需要独立地形安全层;
  • TraceCompiler 可以降低重复 Agent 调用,但只应编译证据充分且可安全回放的步骤。

工程上最可靠的趋势仍是分层:高频状态估计和控制保持确定性,学习模型负责几何、候选轨迹或技能表征,低频图优化和安全过滤负责长期一致性与约束验证。

最值得深入研究或尝试复现的方向

  1. 几何 Transformer 子图接入现有 LIO/VIO 后端

    不复现 48 张 A100 的完整训练,先使用公开几何模型生成关键帧局部点图,与现有 LIO 子图比较回环几何验证能力、运行延迟和动态场景误匹配率。

  2. BMTP 与 GCS/MINCO 的多同伦组合

    使用 GCS 或 A* 生成 2–4 条不同绕行路径,BMTP 分别优化最短时间轨迹;将定位协方差和控制残差转换为障碍膨胀量,验证窄通道中的成功率和最坏规划时间。

  3. Coding Agent 轨迹编译与共享工作区门禁

    只编译读取、检索、测试和证据收集流程;所有文件写入继续使用 revision token、三方合并和 targeted test。比较编译前后的工具调用数、token 成本、失败恢复率和用户修改覆盖率。

参考资料

  1. SLAMFormer-∞
  2. PLS-Calib
  3. CUDA MPC
  4. Stochastic Multiple Shooting Trajectory Optimization via Sequential Local Policy Evaluation
  5. Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles
  6. Light-Loco-Parkour
  7. TraceCompiler
  8. LOAM
  9. 最新公开列表