机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-08-05

摘要

arXiv Robotics 在 2026 年 8 月 4 日公开了 118 条记录。本期先对照仓库去重索引,排除了 8 月 4 日以前已经报道的工作,再从最新批次中筛选 7 条可完整核验、且对 SLAM、状态估计、机器人控制和真实研发流程有明确工程价值的动态。

今天最值得关注的变化有四点:

  1. VIO 开始从“被动接受当前运动带来的视差”转向主动维持可三角化几何,规划器会在低视差时主动注入平移。
  2. 3DGS 与 VIO 的结合正在从离线后处理转向跟踪线程和增量训练线程并行运行,但稠密地图仍不能自动等价为导航地图。
  3. 足式机器人状态估计和控制都在减少手工调参:一边在线适配 Kalman 噪声协方差,另一边通过可微分仿真直接获得一阶策略梯度。
  4. Coding Agent 的新风险不只是“写错代码”,而是无法感知用户在共享工作区中途修改了同一段代码,导致静默覆盖或保留冲突逻辑。

过去 24 小时内没有发现足以进入本期主动态、且相对既有索引具有明确新增价值的官方通用大模型或代码模型发布,因此本期不使用旧模型新闻凑数。

1. TANGO-VIO:让飞行轨迹主动维持三角化视差

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-03。

TANGO-VIO 研究一个传统 VIO 经常被忽略的问题:状态估计器只能使用飞行轨迹实际产生的视差。如果无人机纯旋转、缓慢悬停、沿视线方向运动,或者随着高度增加导致视角变化过小,特征虽然仍可被跟踪,却可能无法稳定三角化。

该方法对滑动窗口中每个特征构造 stacked-bearing matrix,以其行列式衡量多视角射线是否具有足够几何信息;再把所有特征的平均 log-det 指标写成 Control Barrier Function。名义速度即将令该指标跌破阈值时,闭式安全过滤器对机体系速度做最小修正,主动制造额外视差。项目同时提供硬 CBF 和带松弛变量的软 CBF:前者优先维持三角化质量,后者允许在任务跟踪与观测质量之间折中。

为什么重要

大多数 VIO 鲁棒化工作集中在特征筛选、动态点剔除、后端鲁棒核和退化检测,但检测到低视差后通常只能报警或降低置信度。TANGO-VIO 把“可观测性退化”反馈给导航层,让机器人主动改变运动,这是 active perception 与传统 VIO 更直接的接口。

需要准确理解其保证范围:论文保证的是特征几何层面的三角化信息下界,不是对完整非线性 VIO 状态可观测性的全局证明。IMU 激励、时间同步、尺度、偏置和外参仍可能退化。

算法模块

  • VIO 前端维护滑动窗口相机位姿、特征轨迹和 bearing vector;
  • 为每个特征构造多视角 stacked-bearing matrix;
  • 使用平均 log-det 定义三角化质量 barrier;
  • 将 barrier 对当前机体系速度求导,形成控制仿射 CBF 约束;
  • 采用加权最小偏差闭式解修正名义速度,不需要在线 QP 求解器;
  • 硬 CBF 强制维持阈值,软 CBF 使用 slack 量化任务与观测冲突。

传感器假设

系统需要相机、IMU、稳定的特征跟踪和滑动窗口 VIO。论文仿真使用 OpenVINS,真实平台使用向下安装的 80° 视场 CSI 相机、Jetson Orin Nano、MATEKSYS 飞控和 ArduPilot 速度控制。

它还依赖特征大体静态、深度和 bearing 估计足够可信。动态物体、大面积重复纹理或错误特征关联会让 log-det 指标看起来良好,但几何约束实际错误。

实时性与鲁棒性

安全过滤器以 20 Hz 更新,并具有闭式速度修正。仿真与真实爬升实验使用相同阈值和增益,未重新调参;在高度增加、视差逐渐不足时,硬 CBF 会持续提高平移速度以维持新特征初始化。

这也暴露出风险:硬约束在悬停、终点停车或狭窄空间中可能拒绝停止,甚至把速度推向设定上限。真实系统更适合默认使用软 CBF,并叠加独立的障碍物、速度、加速度和地理围栏约束。

可复现性与风险

项目页已经公开方法、飞行曲线和参数,但代码仍标注为即将发布。当前实验只覆盖有限轨迹,尚未证明在动态环境、低纹理、强曝光变化和障碍密集环境中的综合收益。

适合谁关注

适合无人机 VIO、主动感知、视觉伺服,以及正在处理“悬停或沿走廊轴向飞行时特征仍在、三角化却逐渐变差”的团队。

工程落地启发

可先不改 VIO 后端,只增加一个低视差 supervisor:

  1. 从现有滑窗导出特征 bearing 与位姿;
  2. 计算每个特征的三角化条件数或 log-det;
  3. 指标持续下降时,向局部规划器增加小幅横向激励;
  4. 只有在净空、速度和任务状态允许时执行;
  5. 在窄通道和终点停车阶段允许 slack,并把冲突量记录为定位健康度。

2. Stipple:VIO 跟踪与增量 3DGS 训练真正并行运行

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-02。

Stipple 将 Basalt 视觉惯性跟踪与 Brush 的 Rust、跨 GPU 厂商 3D Gaussian Splatting 实现结合,使跟踪和增量 Gaussian 训练并行执行。与先完整 SfM、再离线优化 3DGS 的流程不同,它直接利用 VIO 已经产生的相机位姿、关键帧和立体深度,省去大量预处理。

系统不会对所有关键帧都执行昂贵深度估计,而是选择少量 anchor frame 初始化 Gaussian;其余帧主要用于光度优化和地图增量更新。回环后可以继续使用修正位姿更新场景,但跟踪精度仍由 Basalt 前端决定。

为什么重要

很多“3DGS-SLAM”同时承担跟踪和渲染,结果是位姿优化、Gaussian densification 与 GPU 渲染互相争抢算力。Stipple 的工程价值在于明确分层:

  • VIO 保证高频、低延迟位姿;
  • 3DGS 在后台吸收关键帧并提供可视化稠密地图;
  • 两者通过关键帧和位姿接口耦合,而不是把整个估计器改成一个巨型联合优化问题。

这更接近机器人和 XR 的实际软件架构。

算法模块

  • Basalt 双目惯性前端输出位姿、关键帧与回环修正;
  • 关键帧筛选和 culling 控制训练数据规模;
  • 少量 anchor frame 运行立体深度估计并初始化 Gaussian;
  • Brush/CubeCL 后端执行跨 GPU 的增量 splatting 与优化;
  • 跟踪线程和重建线程异步并行;
  • 回环后的相机位姿变化继续传递到重建层。

传感器假设

系统面向双目相机与 IMU。立体深度有利于避免单目 3DGS 初始化中的尺度和深度歧义,但低纹理、反光、玻璃和远距离区域仍会产生错误深度。

实时性

论文在 EuRoC Vicon Room 上报告约 211 FPS 的重建吞吐,在 Monado 序列上最高约 264 FPS;测试硬件为 Ryzen 9 9950X 与 RTX 5060 Ti 16 GB。较大的 Machine Hall 序列仍可达到约 173 FPS,但出现更多 Gaussian、显存增长和重建质量下降。

这些数字主要说明增量训练管线很快,不应被理解为整个机器人系统在所有模块开启后都能维持同样频率。FoundationStereo 等深度模块单帧仍可能需要约 150 ms,因此作者通过只处理少量 anchor frame 避免阻塞主线程。

鲁棒性、可复现性与风险

论文基于 Basalt 和 Brush 两个公开组件,但当前 arXiv 页面尚未提供 Stipple 自身完整仓库。主要风险包括:

  • 大场景可能过度 densification,Gaussian 数量和显存持续增长;
  • 跟踪错误会直接写入重建;
  • 回环后 Gaussian 如何全局一致变形仍需更严格验证;
  • 高质量渲染不代表几何可用于碰撞检测;
  • 动态人员和车辆会形成残影。

适合谁关注

适合 XR、机器人远程操作、现场快速三维可视化,以及希望在现有 VIO 外增加稠密重建而不破坏实时定位的团队。

工程落地启发

对导航机器人,应继续保留独立 voxel/ESDF 地图。3DGS 更适合承担:

  • 操作者可视化;
  • 语义对象贴图;
  • 任务回放;
  • 地图变化人工检查;
  • 低频几何精修。

不要直接用 Gaussian alpha 或渲染深度替代确定性的近场碰撞地图。

3. 残差自适应 InEKF:不依赖足端力传感器在线调整测量噪声

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-03。

《Residual-Based Adaptive Kalman Filtering for Legged Robot State Estimation》在融合 IMU 与腿部运动学的 Invariant EKF 中,根据 filter residual 和 innovation 在线更新过程噪声协方差 Q 与测量噪声协方差 R。

Unitree Go2 的室内外数据表明,仅在线适配 R 就足以在 trotting 步态下相对固定调参 InEKF 提升约 25% 精度;效果与依赖 IMU 和足端力测量的基线接近,但不需要足端力传感器和额外阈值调节。

为什么重要

足式机器人接触条件变化很快。硬地、草地、碎石、斜坡和打滑会让“支撑足速度为零”这一运动学测量的可信度不断变化。固定 R 通常只能针对某一种步态和地面调好,在换步态或滑移时会过度相信足端约束。

在线适配测量协方差比直接切换多套手工参数更通用,也比依赖足端力阈值更容易迁移到没有力传感器的低成本机器狗。

算法模块

  • InEKF 维护浮动基座位姿与速度;
  • IMU 提供高频传播;
  • 关节编码器和正运动学构造足端接触速度测量;
  • 使用 innovation 和 filter residual 估计当前测量统计;
  • 在线调整 R,并可选择同时调整 Q;
  • 对不同步态与地形自动改变运动学约束权重。

传感器假设

需要 IMU、关节编码器、可靠的机器人运动学模型和接触状态判断。方法不要求足端力传感器,但并不意味着不需要判断哪只脚处于支撑期。

实时性与鲁棒性

协方差递推本身计算量较小,适合加入现有 EKF/InEKF。但论文摘要没有给出处理频率或 CPU 占用,因此不能直接断言在所有嵌入式平台上无开销。

残差增大不一定只来自地面滑移,也可能来自外参错误、时间戳漂移、关节回差、错误接触状态或 IMU 饱和。适配器若不区分原因,可能只是把 R 调大,把系统故障“解释成噪声”。

可复现性与风险

当前页面未列出代码。工程部署时必须为 Q、R 设置上下界和变化速率限制,并保留一致性统计,例如 NIS/NEES,防止协方差无限膨胀。

适合谁关注

适合轮足和四足机器人状态估计、没有足端力传感器的平台,以及需要在多步态、多地面之间切换的控制系统。

工程落地启发

建议先只适配足端运动学测量的 R:

  1. 按腿或按接触相位分别维护协方差;
  2. 以 innovation 突增识别疑似滑移;
  3. 限制 R 的最小值、最大值和单周期变化;
  4. 将轮速、足端、视觉和 LiDAR 残差分开统计;
  5. 若多个模态同时异常,触发传感器健康检查,而不是继续放大协方差。

4. Open-DiffLoco:用可微分仿真在消费级显卡上训练可部署机器狗策略

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-03。

Open-DiffLoco 是一个基于 MuJoCo XLA 的开源足式控制框架,实现 Short-Horizon Actor-Critic。与 PPO 主要依赖采样得到的零阶策略梯度不同,SHAC 通过可微分动力学直接反向传播一阶梯度,并用短时域截断减轻接触不连续和长链 Jacobian 带来的数值不稳定。

其部署策略不使用基座线速度等 privileged actor observation,也不依赖参考步态轨迹;奖励主要由速度跟踪、姿态、高度、关节偏差和动作平滑等少量可微项组成。作者还提出 JAVE,通过监督 critic 对状态的 Jacobian,改善训练早期一阶策略梯度的方向。

为什么重要

当前很多足式 RL 框架能够训练出强策略,但需要数千并行环境、复杂奖励组合和高端 GPU。Open-DiffLoco 展示了一条更低样本量的路线:接触动力学虽然不可完全光滑,但在短时域内直接利用模型梯度,可能显著减少环境交互次数和奖励工程。

更重要的是,它提供从 MJX 训练到 Unitree Go2 的 C++/ROS 2 部署链,而不是只展示仿真曲线。

算法模块

  • MJX 可微分刚体与接触仿真;
  • SHAC 短时域 actor 梯度;
  • critic 近似截断时域后的剩余回报;
  • JAVE 增加 Bellman-gradient/Jacobian 监督;
  • 简化的可微奖励;
  • domain randomization;
  • 50 Hz 策略,250 Hz 仿真子步;
  • Jetson AGX Orin 上的 C++ 实机部署。

实时性与效果

论文报告单张 RTX 5080、低于 6 GB 显存,训练约 20–60 分钟。Unitree Go2 实机速度跟踪 RMSE 低于 0.2 m/s,速度超过 1 m/s,并能应对不平地面和侧向推扰。

作者同时指出,一阶方法虽然环境样本效率约高两个数量级,但单个环境步需要穿过仿真器反向传播,wall-clock 并不必然优于高度优化的 RSL-RL/PPO。JAVE 的主要提升集中在训练早期稳定性,而不是最终性能的决定性跃升。

传感器与动力学假设

这是 blind locomotion,部署依赖本体感觉,不使用地形视觉。策略能否迁移取决于 MuJoCo 接触、执行器、延迟、摩擦和质量参数是否足够接近真实平台,以及 domain randomization 是否覆盖实际误差。

可复现性与风险

代码、配置、训练参数和部署代码已经公开,是本期可复现性最高的控制项目之一。限制包括:

  • 高于 2 m/s 的稳定训练仍困难;
  • 尚未研究多步态之间显式切换;
  • 接触不连续会令解析梯度产生偏差或爆炸;
  • 当前是盲走策略,不能独立解决楼梯感知或障碍规划;
  • 实机结果使用外部运动捕捉评估速度,但控制本身在机载运行。

适合谁关注

适合机器狗低层控制、可微分仿真、希望降低训练成本的团队,以及需要对比 PPO、SHAC、AHAC 实际工程差异的研究者。

工程落地启发

可以先把 Open-DiffLoco 作为低层速度跟踪基线,不直接替换完整运动栈:

  • 上层仍由 MID360/地图规划输出 vx、vy、vw
  • 策略只负责关节目标或力矩;
  • 楼梯、悬崖和障碍安全由独立感知层约束;
  • 用同一 URDF、执行器模型和日志回放比较 PPO 与 SHAC;
  • 重点记录 wall-clock、能耗、跌倒率和 sim-to-real 调参次数,而不只比较 reward。

5. FlowPilot:世界—动作联合训练,部署时只输出可跟踪多项式轨迹

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-01。

FlowPilot 面向仅使用深度图的高速无人机导航。训练阶段,视频分支和动作分支通过共享注意力共同进行 Flow Matching:一边预测未来深度变化,一边生成可执行轨迹,使动作学习获得显式未来场景监督。部署阶段不再解码未来视频,只运行 action-centric 路径并输出轨迹。

动作采用 7 次 Bernstein 多项式。当前状态确定开头若干控制点,网络只预测 5 个自由控制点,因此轨迹天然具有 C² 连续性,并可解析计算速度、加速度和 jerk,再交给 100 Hz 轨迹控制器执行。

为什么重要

端到端避障策略常直接输出速度或离散 waypoint,容易产生不连续动作;世界模型方法又经常因视频解码太慢无法进入机载控制环。FlowPilot 的关键取舍是:

  • 训练时利用世界预测提升动作表示;
  • 部署时丢弃昂贵视频输出;
  • 用结构化多项式将网络动作限制为控制器可跟踪的轨迹。

这比让大模型直接输出电机或姿态命令更接近可部署架构。

算法模块

  • 深度图编码;
  • 视频与动作双流 Mixture-of-Transformers;
  • Flow Matching 联合去噪未来深度和轨迹;
  • 7 次 Bernstein 曲线及 5 个自由控制点;
  • 高吞吐 Isaac Lab、较真实 Flightmare 与真实机载数据组成三层训练数据;
  • 部署时只保留动作分支;
  • 100 Hz 传统轨迹跟踪控制器执行。

传感器假设

系统依赖深度相机和机体状态估计,不显式构建局部地图。透明物体、强阳光、雨雾、深度空洞以及高速振动造成的深度错误,都会直接影响策略。

实时性与鲁棒性

在 Jetson Orin NX 上,完整感知到动作延迟低于 18 ms;仿真测试的命令速度最高 8 m/s,实体机在室内和树林密集环境中达到 5.5 m/s。论文强调全部感知与计算均在机载完成。

这些结果证明其延迟具备工程吸引力,但不代表具有形式化碰撞保证。世界预测只在训练中作为表征监督,部署时无法显式检查预测未来是否与真实环境一致。

可复现性与风险

当前 arXiv 页面未提供公开代码或权重。主要风险包括:

  • 对深度传感器域差异敏感;
  • 训练数据覆盖不足时可能选择不可恢复轨迹;
  • 多项式连续不等于动力学和碰撞一定可行;
  • 无局部地图使持续遮挡和死胡同处理更困难;
  • 高速实验需要独立急停、最小净空和状态估计健康检查。

适合谁关注

适合高速无人机端到端控制、Jetson 机载推理、世界模型辅助策略训练,以及希望让网络输出结构化轨迹而非原始控制量的团队。

工程落地启发

针对 MID360 无人机,可保留其动作表示,但将输入替换或增强为深度投影与局部点云风险:

  1. 网络输出多条 Bernstein 候选轨迹;
  2. 用 MID360 ESDF 对候选做确定性碰撞检查;
  3. 用动力学和扰动模型筛除不可跟踪轨迹;
  4. 无候选通过时减速或悬停;
  5. 传统控制器继续负责姿态和推力闭环。

6. 可达动作验证:冻结视觉编码器,把形式验证限制在低维策略接口

公开时间:2026-08-04 最新批次;论文 v1 提交于 2026-08-03。

《Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training》尝试解决视觉策略难以验证的问题。直接对大型视觉编码器传播集合会产生巨大计算量和过度保守的输出界,因此作者冻结视觉编码器,只在视觉特征与下游动作策略之间的低维接口构造不确定集合。

接口集合由保留的相机位姿扰动数据校准,再通过 zonotope 传播到动作输出。训练时不只优化行为克隆误差,还直接缩小终端动作 enclosure;评估阶段使用 rollout-level split conformal calibration,把动作偏差转换成具有有限样本覆盖率的概率可达半径。

为什么重要

多数机器人策略安全评测只在若干随机扰动上测成功率,无法回答“相机轻微移动后,动作最多会偏离多远”。该工作把视觉域扰动、集合传播和概率校准连接起来,提供一个比平均成功率更可审计的量。

它也提出了现实折中:不验证整个视觉基础模型,而是冻结其输出,并验证一个可控、低维、结构明确的 downstream policy。

算法模块

  • 冻结视觉编码器;
  • 从相机外参扰动样本估计低维接口集合;
  • 使用 zonotope 穿过下游 affine/ReLU 策略;
  • set-based loss 直接压缩动作输出 enclosure;
  • 保留行为克隆损失维持任务能力;
  • 使用 split conformal calibration 给出 rollout 级概率半径;
  • 单独处理近离散的夹爪通道。

传感器和模型假设

保证只针对预先定义的相机位姿扰动分布及已验证的下游网络结构。论文为便于 zonotope 传播,将策略下游改造成 affine/ReLU 形式,因此不能直接套到任意 Transformer、diffusion policy 或带复杂归一化的 VLA。

实时性与实验结果

在 LIBERO-10 相机外参扰动实验中,set-based training 在 99% 覆盖设置下,相对仅行为训练将可达半径改善到中位约 2.09 倍,同时经验覆盖率保持约 0.99–1.00。验证主要在离线集合传播和训练阶段完成,在线策略仍可保持普通前向推理。

鲁棒性、可复现性与风险

该证书是分布条件下的有限样本概率保证,不是对所有相机位置、所有环境和物理碰撞的绝对安全证明。若实际扰动超出校准分布,或视觉编码器遇到新物体、遮挡与光照变化,半径可能失效。

当前页面未列出代码。工程接入还需解决 Transformer/VLA 中非线性算子的集合近似,以及动作半径如何映射到真实碰撞和接触风险。

适合谁关注

适合视觉伺服、VLA 安全评测、机器人策略认证和需要量化相机安装误差影响的团队。

工程落地启发

可先将方法用于部署验收,而不是在线安全控制:

  • 对相机外参、裁剪、延迟和噪声分别建立扰动分布;
  • 计算每类扰动下的动作可达半径;
  • 把半径与机械臂净空、速度限制和接触力预算对应;
  • 超出允许半径时拒绝发布模型;
  • 在线仍保留独立碰撞检查和力控保护。

7. SWE-Touch:Coding Agent 在用户中途改代码后平均掉 7.7 个百分点

公开时间:2026-08-04 软件工程最新批次;论文 v1 提交于 2026-08-03。

SWE-Touch 研究现有 SWE-bench 类评测没有覆盖的真实工作流:Agent 执行任务期间,用户可能检查并修改同一个工作区。

框架先从多条修复轨迹中定位任务关键代码区域,再由独立 User Patch Generator 生成“合理但与任务完成冲突”的 Counter-Edit,并在 Agent 到达相关阶段时同时注入代码修改和用户消息。九个代码模型在 SWE-bench Verified 上的平均解决率下降 7.7 个百分点,在更长时域的 SWE-Bench Pro 和 DeepSWE 上也持续下降。

轨迹分析显示,Agent 经常没有重新检查工作区:有的保留了互相冲突的用户代码,有的直接覆盖用户修改,却没有运行针对受影响逻辑的测试。

为什么重要

这不是模型代码能力不足,而是 Agent harness 缺乏工作区状态感知和并发写入协议。即使模型在单人沙盒中表现很好,一旦用户、另一个 Agent、格式化工具或生成器同时修改文件,原先的计划和上下文就可能立即过期。

工程价值

真实研发流程应把文件状态当成带版本的资源,而不是默认从任务开始到结束保持不变:

  • 每次读取文件记录 blob/hash 或 Git revision;
  • 写入前检查目标文件是否自上次读取后变化;
  • 发现变化时执行三方合并,而不是覆盖写;
  • 区分用户提交、其他 Agent 修改和自动格式化;
  • 重新读取受影响函数和调用链;
  • 针对冲突区域重新生成测试;
  • 用户修改默认拥有更高优先级,除非明确授权 Agent 回退。

是否适合接入真实研发流程

非常适合,尤其是 Codex、Claude Code、Copilot Agent、多 Agent worktree 和用户边看边改的 IDE 场景。

最佳实现不是简单“检测到变化就停止”,而是:

  1. 事件监听器记录文件变化;
  2. Agent 将变化与当前任务依赖图对齐;
  3. 只使受影响的计划步骤失效;
  4. 展示冲突意图并保留用户代码;
  5. 重新运行局部测试和最终完整验证。

可复现性与风险

论文代码已公开。Counter-Edit 是评测构造,未必覆盖真实协作中的所有修改类型,但它比只通过聊天消息模拟用户干预更接近实际。

接入生产时还要避免文件监听产生过多无意义重规划,例如构建产物、格式化、IDE 临时文件和生成代码变化应单独分类。

适合谁关注

适合 AI IDE、Coding Agent harness、并行开发平台和正在构建自动 PR 修复流水线的团队。

工程落地启发

建议将“写前比较”设为强制门禁:

read(file, revision=A)
plan patch
user/agent changes file -> revision=B
apply only if A == B
otherwise: re-read B -> three-way merge -> targeted tests

这比仅依赖 Git 最终冲突更早发现语义覆盖问题。

经典论文回顾

MSCKF:不把地标放入状态,也能利用多帧视觉约束

发表时间与历史位置: Anastasios I. Mourikis 与 Stergios I. Roumeliotis 的《A Multi-State Constraint Kalman Filter for Vision-aided Inertial Navigation》发表于 ICRA 2007。它是现代滤波式 VIO 的奠基工作之一,并直接影响了 OpenVINS、VINS 滤波器和大量资源受限视觉惯性系统。

解决的核心问题

传统 EKF-SLAM 将每个三维地标都加入状态。地标数量增长后,协方差矩阵和更新计算迅速变大,不适合长距离实时 VIO。

另一种做法是只使用单帧视觉测量,但无法充分利用一个特征跨多帧形成的几何约束。MSCKF 的核心问题是:如何利用多相机位姿对同一静态特征的观测,同时不把该特征永久加入滤波器状态。

关键数学思想与算法模块

  • 状态中保留当前 IMU 状态和一组克隆的历史相机位姿;
  • IMU 负责连续传播;
  • 相机到来时把当前相机位姿克隆进状态;
  • 对跨多帧特征轨迹进行三角化;
  • 将视觉残差分别对相机状态和特征位置线性化;
  • 用特征 Jacobian 的左零空间消去特征位置扰动;
  • 得到只约束多个相机克隆与 IMU 状态的 measurement update;
  • 特征轨迹结束或滑窗满时执行更新并删除旧克隆。

因此,地标只是临时计算变量,不随环境规模永久扩张。原论文指出其计算复杂度对特征数量近似线性,并在城市相机/IMU 数据上展示了大范围实时定位。

传感器与模型假设

MSCKF 假设:

  • 相机与 IMU 时间同步和外参已知或可标定;
  • IMU 噪声和偏置可由误差状态模型描述;
  • 被使用的视觉特征属于静态环境;
  • 特征具有足够视差可三角化;
  • 线性化点附近误差可用高斯近似。

这些假设与今天 TANGO-VIO 关注的低视差问题直接呼应:MSCKF 能高效利用多帧约束,但不会主动保证机器人产生足够视差。

当年为什么重要

MSCKF 在精度与计算量之间提供了非常成功的折中:

  • 比只使用帧间光流约束的信息更完整;
  • 比把所有地标加入 EKF 状态更轻量;
  • 不依赖全局地图即可持续输出低延迟 VIO;
  • 与 IMU 高频传播天然结合;
  • 适合机载和嵌入式平台。

今天仍然有效的思想

  • 滑动窗口相机位姿克隆;
  • 特征轨迹产生多状态约束;
  • 利用 nullspace marginalization 消去 nuisance feature;
  • 视觉低频更新与 IMU 高频传播分离;
  • 不维护永久地标的轻量局部里程计;
  • 在线标定时间偏移、外参和相机内参;
  • 将多相机、双目和轮速等测量统一加入误差状态滤波器。

OpenVINS 延续并工程化了这些思想,提供单目、双目、多相机、在线标定和仿真评测。

已经被替代或扩展的部分

原始 MSCKF 的主要不足后来被大量工作改进:

  • First-Estimate Jacobian 和 observability-constrained EKF 改善不一致性;
  • 更好的特征参数化、延迟初始化和 Schmidt 状态提高鲁棒性;
  • 滑窗非线性优化在高算力平台上通常能获得更高精度;
  • 回环与全局地图需要独立 pose graph 或 SLAM 后端;
  • 学习特征和直接法可改善低纹理或光照变化,但也引入新域风险;
  • 动态环境需要语义、几何或运动一致性剔除。

公开代码、数据与可复现性

OpenVINS 是当前最适合复现 MSCKF 系列思想的开源实现之一,使用 GPL-3.0,提供 ROS 接口、仿真器、标定和多种数据集支持。复现时最关键的并不是“程序能跑”,而是检查:

  • IMU 噪声密度和随机游走单位;
  • 相机—IMU 外参方向;
  • 时间偏移;
  • 特征轨迹长度和三角化条件;
  • clone 数量;
  • nullspace 压缩和 QR;
  • FEJ/线性化策略;
  • NIS 与协方差一致性。

对当前工程项目的重新解读

对于无人机或机器狗,MSCKF 可以作为高频局部 VIO,但不应独自承担长期全局定位。更合理的架构是:

MSCKF/OpenVINS 局部里程计
        ↓
低频回环、RTK、反光标志或先验地图因子
        ↓
独立全局图优化

如果相机长时间沿单一方向运动,先从特征 stacked-bearing、三角化条件数和新特征初始化率监测退化;必要时让局部规划器产生可控横向激励,而不是等滤波器协方差失控后再恢复。

今日结论

本期的核心不是又出现一套能够替代所有成熟 SLAM 和控制栈的大系统,而是多个关键接口正在变得更清晰:

  • 状态估计与规划的接口: TANGO-VIO 让规划器主动维持视觉几何,而不是把退化完全留给 VIO 后端处理。
  • 定位与稠密地图的接口: Stipple 证明 VIO 与 3DGS 可以并行,但也再次说明渲染地图和导航地图应分层。
  • 状态估计与环境变化的接口: 自适应 InEKF 根据残差调节足端约束可信度,但必须防止把标定或同步故障误当成随机噪声。
  • 仿真与真实控制的接口: Open-DiffLoco 把可微分训练、简化奖励和 C++ 机载部署连接起来,但接触梯度偏差和高速泛化仍是瓶颈。
  • 学习策略与传统控制的接口: FlowPilot 不是直接输出电机命令,而是输出 C² 连续多项式轨迹,这一设计比纯端到端速度回归更值得迁移。
  • 学习策略与安全审计的接口: 可达动作验证把形式分析限制在低维 downstream policy,为视觉策略部署验收提供了现实路径。
  • Agent 与人类协作的接口: SWE-Touch 表明共享工作区必须有 revision、冲突检测和重验证协议,不能假设 Agent 独占代码库。

最值得深入研究或尝试复现的方向

  1. TANGO-VIO 退化指标接入现有无人机规划器

    不必先复现完整论文,可在 OpenVINS 或现有 VIO 中导出多帧 bearing,比较平均 log-det、最小特征条件数、新三角化特征数与实际定位误差的相关性;再只在安全净空允许时注入小幅横向速度。

  2. Open-DiffLoco 与 PPO 的同平台实测

    在同一 Unitree Go2 模型、相同 domain randomization 和相同部署接口下比较 SHAC/JAVE 与 RSL-RL PPO,记录训练时间、显存、环境步数、实机速度 RMSE、跌倒率和重新调参次数,验证“样本效率高”是否真正转化为工程效率。

  3. Coding Agent 共享工作区门禁

    在现有 Codex/Claude Code 工作流中加入文件 revision token、写前比较、三方合并和 targeted-test 自动生成;用 SWE-Touch 的 Counter-Edit 思路构造内部回归集,评估 Agent 是否静默覆盖用户修改。

参考资料

  1. TANGO-VIO
    • 论文:https://arxiv.org/abs/2608.02079
    • 项目页:https://tango-vio.github.io/
    • OpenVINS:https://github.com/rpng/open_vins
  2. Stipple
    • 论文:https://arxiv.org/abs/2608.00931
    • Basalt:https://github.com/VladyslavUsenko/basalt
    • Brush:https://github.com/ArthurBrussee/brush
  3. Residual-Based Adaptive Kalman Filtering for Legged Robot State Estimation
    • 论文:https://arxiv.org/abs/2608.02316
  4. Open-DiffLoco
    • 论文:https://arxiv.org/abs/2608.02069
    • 项目页:https://diffloco.martin-opat.com/
    • 代码:https://github.com/MartinOpat/open-diffloco
  5. FlowPilot
    • 论文:https://arxiv.org/abs/2608.00635
  6. Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training
    • 论文:https://arxiv.org/abs/2608.02545
  7. SWE-Touch
    • 论文:https://arxiv.org/abs/2608.02499
    • 代码:https://github.com/Trae1ounG/SWE-Touch
  8. MSCKF
    • 原始论文信息:https://experts.umn.edu/en/publications/a-multi-state-constraint-kalman-filter-for-vision-aided-inertial-/
    • DOI:https://doi.org/10.1109/ROBOT.2007.364024
    • OpenVINS:https://github.com/rpng/open_vins
  9. arXiv 最新列表
    • Robotics:https://arxiv.org/list/cs.RO/recent
    • Software Engineering:https://arxiv.org/list/cs.SE/recent