技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-22
摘要
arXiv Robotics 在 7 月 21 日公开了 91 项最新条目,Software Engineering 同日新增 62 项。今天值得关注的核心不是另一套全面替代传统几何系统的端到端方案,而是四类更务实的进展:学习只负责产生更好的视觉测量,几何继续负责验证;先验地图开始针对边缘设备进行多分辨率压缩;规划器根据实际扰动和感知偏差动态调整安全裕度;机器人基础模型开始同时提供原生三维定位、接触点预测和跨本体动作表示。
AI Coding 侧出现两个相互呼应的结论:Agent 的搜索轨迹会把临时修改残留在最终代码中,而 Agent 生成的 PR 又经常缺乏真正覆盖变更代码的测试。模型侧,Google 正式发布 Gemini 3.6 Flash,并同步进入 GitHub Copilot,重点提升编码、长程 Agent 任务和单位任务成本。
1. Geometry-Verified VIO:学习只负责提出匹配,几何负责决定能不能相信
《Does Robust VIO Need More Learning?》提出一套“最小学习化”双目 VIO:SEA-RAFT 只用于生成稠密双目对应和不确定度;时间跟踪仍使用 KLT;匹配随后经过不确定度过滤、极线一致性检查,并以协方差加权重投影因子进入滑窗双目惯性估计器。其不确定度还会通过三角化传播到各向异性 3D Gaussian 建图。
这项工作的核心结论不是“SEA-RAFT 比传统特征更强”,而是单独替换学习式光流并不足以提升鲁棒性。消融中,原始 flow 配置在 EuRoC 和 4Seasons 上的平均误差分别为 0.078 和 98.7;逐步加入不确定度过滤、极线验证和协方差加权后,降低至 0.046 和 22.1。时间方向使用 KLT、双目方向使用 SEA-RAFT 的混合方案,也明显优于让网络同时承担时间和双目关联。
为什么重要
许多学习 VIO 在训练分布内表现很好,但遇到雨天反光、动态车辆、镜头污染、室内外切换或强光变化时,学习到的几何先验可能失效。该工作保留显式状态估计和几何拒绝机制,学习模块即使产生错误候选,也不会无条件进入后端。
适合谁关注
适合无人机 VIO、双目机器狗、室内外跨场景机器人,以及正在考虑用 XFeat、ALIKED、SuperPoint 或稠密光流改造传统前端的团队。
工程落地启发
建议不要一次性替换整个 VIO:
- 保留现有 KLT 时间跟踪和 IMU 滑窗后端;
- 只将双目匹配替换为学习式稠密对应;
- 让网络同时输出匹配不确定度;
- 对匹配执行极线、左右一致性和多帧几何检查;
- 将不确定度映射成因子协方差,而不是简单阈值剔除;
- 网络超时或输出异常时回退传统双目匹配。
风险与可复现性
作者计划在论文接收后开放代码和配置,目前还不是直接可编译的工程包。SEA-RAFT 的推理延迟和显存也需要在 Jetson 等边缘设备上重新测试。
工程判断:这是今天最值得关注的 VIO 工作,其价值主要在架构边界,而不是某个单独网络。
2. MR-Voxel-SVIO:先验 LiDAR 地图压缩到每体素一个代表点,面向云边协同定位
MR-Voxel-SVIO 将先验 LiDAR 地图构造成多分辨率体素层,每个体素只保留一个具有高强度梯度和结构显著性的代表点。在线阶段,根据双目特征的估计深度计算其实际空间 footprint,动态选择合适体素分辨率,再用 3D-DDA 沿视线查询对应地图点。后端基于 MSCKF,先用查询到的地图点粗更新状态,再用已注册地图点的多帧重投影约束进一步精化。
其通信设计非常具体:单个查询上行约 32 字节,下行返回三维点约 12 字节;按每帧最多 200 个特征计算,双向数据量约 0.0084 MB/帧。在 1.66 MB/s 带宽假设下,最大查询传输延迟约 5.1 ms。代码已经公开。
在 EuRoC 的多个序列中,其 ATE RMSE 约为 0.042–0.113 米;KAIST 长距离序列上约为 6.47–10.57 米,并在多数测试中优于对比的 Voxel-SVIO、OpenVINS 和 VINS-Fusion 配置。需要注意的是,其初始化后使用带噪全局位置辅助先验地图查询,而且不包含完整重定位问题。
为什么重要
传统先验地图定位要么把局部点云或 mesh 传到边缘端,占用大量带宽;要么只传低频全局位姿,无法持续利用地图结构改善 VIO。MR-Voxel-SVIO 将地图约束压缩成少量射线查询和代表点,适合机器人端算力有限、地图保存在服务器或局域网节点的场景。
工程落地启发
可以迁移到已有 LiDAR 地图和双目相机系统:
- 离线建立多分辨率点云索引;
- 代表点优先选择几何边缘、反射强度梯度或稳定语义结构;
- 边缘端只上传射线与深度范围;
- 服务器返回少量候选三维点及匹配置信度;
- 本地后端继续完成状态融合,不能依赖网络维持惯性传播;
- 网络断开时自动退化为普通 VIO。
风险
系统高度依赖先验地图与当前环境的一致性;地图陈旧、动态设施、相机—LiDAR 外参漂移和错误初始位置都可能造成错误 2D–3D 对应。机器人部署时必须加入地图变化检测和地图因子开关。
工程判断:代码开放、带宽指标明确,适合做云边协同视觉定位实验。
3. Disturbance-Aware Flight:窄通道规划不能只看几何距离,还要看气动扰动
该工作提出 DAPCF 窄空间飞行框架:双环观测器根据里程计和电机转速实时估计六自由度外力与外力矩;规划器利用扰动风险函数动态调整参考速度;底层使用包含电机动力学和扰动补偿的非线性 MPC 跟踪轨迹。
实验平台对角尺寸约 0.39 米,在宽、高仅 0.6 米的直线、斜坡和弯曲隧道中完成自主飞行,最高速度分别约为 0.93、1.05 和 0.72 m/s。系统在三类隧道的多次测试中没有出现失败,并根据扰动强弱自动降低或恢复速度。
在贴近地面和天花板的悬停测试中,仅用 MDNMPC 时平均位置误差为 0.042、0.014 和 0.020 米;加入扰动观测与补偿后降至 0.013、0.008 和 0.012 米。圆形轨迹误差下降约 43%,带风扰的复杂轨迹误差下降约 41%。
为什么重要
窄通道中的主要危险不只是几何碰撞。侧壁、地面和天花板会改变下洗和气流,距离越小,气动力越强;如果规划器仍按固定最高速度飞行,即使轨迹几何上无碰撞,控制器也可能跟不上。
对 MID360 无人机的启发
可以在现有局部规划器中加入“扰动风险层”:
- 用控制输入、IMU、里程计残差估计外力;
- 将贴墙、贴地和狭窄度作为风险先验;
- 扰动增大时降低局部速度、加速度和轨迹曲率;
- 扰动回落后缓慢恢复速度,避免频繁跳变;
- 将预测—执行残差写入 MPC 或 MPPI 代价;
- 飞控姿态环继续独立运行,规划器不能直接控制电机。
主要风险
该系统使用电机转速和特定动力学模型,换桨叶、机架、载荷或飞控后需要重新标定。对外力估计错误时,速度调度可能过度保守或错误加速。
工程判断:非常适合你关注的窄通道飞行问题,比单纯更换飞控更值得研究。
4. Adaptive Safety Critic:固定膨胀半径正在被场景相关安全裕度取代
该工作针对扩散式视觉导航的候选轨迹选择问题。固定安全距离过大时会产生绕路和超时,过小时又容易在感知存在偏差时贴边穿行。作者训练一个场景相关 critic,其评分由三部分构成:
- 安全项:净空预算惩罚和逐 waypoint、逐 transition 的 CBF 残差;
- 效率项:平滑度和受安全条件控制的绕行比例;
- 平衡项:让预测安全预算与 ESDF 中真实净空匹配,防止安全距离坍缩。
训练时使用仿真中的 ESDF 特权信息生成 teacher critic,再蒸馏成仅从 RGB-D 判断候选轨迹的 student。该方法在 HM3D 和 MP3D 的域内及跨数据集 PointGoal 测试中获得最高 SR 和 SPL,并零样本部署到配备 RealSense D435i 的 Unitree G1,在走廊、公寓和拥挤实验室中完成导航。
为什么重要
机器人所需的安全距离并不是常数。直线通过开阔走廊时可以缩小余量;急转弯、视觉模糊、控制频率下降或 footprint 较大时则需要扩大。让学习模型预测安全预算,比让其直接输出最终控制量更容易被传统规划器约束。
工程落地启发
不必使用完整扩散策略,也可以把 critic 独立接入 Nav2、TEB 或 MPPI:
- 输入局部地图、速度、曲率、控制延迟和定位置信度;
- 输出当前轨迹段所需安全距离;
- 对急转、窄门、低频控制或定位不确定区域自动扩大 margin;
- 设置人工定义的最小和最大值;
- 最终碰撞检查仍由 ESDF、costmap 或 CBF 完成;
- critic 失效时退回保守固定值。
风险
模型在仿真中使用高质量 ESDF 监督,现实中的深度空洞、玻璃、动态人员和机身摆动可能改变最优安全预算。论文摘要未给出实体 G1 各场景的具体成功率,部署前仍需独立测试。
工程判断:这是一种很合理的“学习调参数、传统系统守底线”架构。
5. Patch Policy:不需要十亿参数 VLA,也能利用 ViT 的稠密 patch 表征
Patch Policy 直接消费预训练 ViT 的稠密 patch token,而不是把每帧压缩成一个全局视觉 token。它通过 block-causal attention mask,在保留时间因果性的同时,让策略访问每帧的局部空间特征和机器人状态,不需要引入完整 VLM 或大型语言主干。
在四组仿真和三组真实环境中,Patch Policy 相对使用先进全局池化视觉表示的策略获得约 40% 相对提升;它还比微调后的 OpenVLA-OFT 高 18%,但参数量只有后者的约 0.7%。
为什么重要
很多操作任务的困难来自局部空间细节,例如插孔、物体边缘、夹爪与目标的相对位置。全局 token 会丢失这些信息;完整 VLA 虽然保留 patch,但模型过大、延迟高,不适合高频反应控制。
适合谁关注
适合 diffusion policy、ACT、机器人视觉伺服、低成本机械臂,以及希望利用 DINO、DINOv2 或其他 ViT 表征但不需要语言推理的任务。
工程落地启发
- 冻结预训练视觉编码器,先只训练轻量策略头;
- 保留多尺度 patch,而不是只取 CLS token;
- 用状态 token 表示关节、末端位姿和夹爪状态;
- 通过 causal mask 避免未来信息泄漏;
- 对插入、抓取和近距离操作保留更高分辨率 ROI;
- 底层阻抗、力控和碰撞限制保持独立。
风险
稠密 patch 数量会随图像分辨率快速增加,仍需测试边缘设备显存和注意力开销。它也不具备语言规划、长期任务记忆或复杂语义理解,不能替代完整 VLA 的所有能力。
工程判断:对于不需要复杂语言推理的机器人任务,它可能比追求大型 VLA 更实用。
6. FM-VLA:用力历史记住“按了几次、擦了几次、是否真正接触”
FM-VLA 将一段力传感器时间序列通过 VAE 压缩成紧凑 force-memory token,再与短期机器人状态一同输入 VLA 的 action expert。其目标是解决视觉难以区分的非马尔可夫接触事件,例如按钮已经被按了几次、擦拭动作完成了多少轮、物体是否在遮挡下被触碰或移动。
论文在寻找隐藏积木、按按钮和按指定次数擦盘子三类记忆任务上取得超过 80% 成功率,并称额外推理开销很低。
为什么重要
图像历史既昂贵,也未必能识别微小接触事件。按钮按压前后画面可能几乎相同,但力曲线中会留下明显脉冲;擦拭次数也更容易从周期性力变化中统计。
工程落地启发
- 将六维力或关节力矩以高频采样写入环形缓冲区;
- 用小型 VAE/TCN 压缩为固定长度 token;
- 为力 token 添加时间和接触阶段编码;
- 视觉负责对象和目标,力记忆负责历史接触事件;
- 超过硬力阈值时由独立控制器撤退;
- force memory 每个任务开始时重置,避免跨任务污染。
风险
力记忆只在传感器标定稳定时有效;机械振动、工具重量、摩擦变化和不同物体材质都会改变力分布。超过 80% 的三任务成绩也不能直接代表开放世界接触操作能力。
工程判断:对接触型操作,加入小型力记忆模块通常比继续堆图像历史更划算。
7. RynnBrain 1.1:原生三维定位、接触点预测和跨本体动作空间进入同一模型家族
阿里达摩院发布 RynnBrain 1.1,包含 2B、9B 和 122B-A10B 三个规模。模型采用统一的时空和物理 grounding 训练框架,支持具身感知、空间推理、定位和规划;新增全系列接触点预测,并为 2B、9B 模型加入原生三维 grounding。
其 VLA 版本采用统一跨本体动作空间和本体专用 mask,并部署在 Unitree G1、Astribot-S1 和天机—悟机等不同机器人上。官方已开放 GitHub 项目以及 2B、9B、122B-A10B 检查点。
为什么重要
许多通用 VLM 只会输出二维框或文字,而机器人真正需要的是:
- 目标在度量三维空间中的位置;
- 应该接触物体的哪个局部区域;
- 不同机器人动作维度和关节定义如何统一;
- 语义规划如何转换成具体机器人技能。
RynnBrain 1.1 将三维 grounding 和接触点预测放进基础模型预训练,理论上比下游再拼接独立检测器更有利于操作任务。
工程落地建议
小团队更适合从 2B 或 9B 模型开始:
- 先评估三维指点、接触点和局部规划,不急于运行完整 VLA;
- 使用自己的 RGB-D、点云和相机外参测试度量误差;
- 将模型输出转换为抓取候选或局部 waypoint;
- MoveIt、MPC 或厂商控制器继续负责执行;
- 不同本体使用显式 action mask 和单位转换;
- 对三维位置和接触点设置传统几何验证。
风险
122B-A10B 模型部署门槛较高,官方 benchmark 也需要第三方复现。跨本体动作空间只能缓解接口差异,不能消除动力学、控制频率、夹爪结构和安全限制的差异。
工程判断:资源开放程度较好,2B/9B 的三维 grounding 能力比直接部署超大 VLA 更值得优先测试。
8. AI Coding:应同时减少 Agent 残留代码,并把测试覆盖写入强制门禁
TRIM:从 Agent 搜索轨迹中删除无效残留
TRIM 将 Agent 在反复尝试中留下的推测性修改、废弃方案和临时代码定义为 CodeSlop。它不直接对最终代码做普通清理,而是分析 Agent 的完整修改轨迹,识别哪些变化并非最终有效方案所必需。实验中,TRIM 将 CodeSlop 减少 17.9%–32.9%,性能基本不下降,验证成本约为 Delta Debugging 等算法基线的一半。
这意味着 Coding Agent 通过测试后不应立即提交。系统应保留每轮 diff,并做一次“最小化重放”:从最终补丁中移除中间试验残留,再重新运行测试。
Agentic PR 的测试覆盖仍然不足
另一项研究分析了五种 Coding Agent 生成的 4,882 个 PR。只有 49.6% 的相关 PR 同时修改了测试;已有测试仅覆盖 Agent 修改的 61.5% Java 可执行行和 27.0% Python 可执行行。64.8% 的 Python PR 中,没有任何被修改行被现有测试执行。异常处理代码尤其薄弱,Java 和 Python 的漏测率分别达到 86% 和 81%。
因此,“CI 绿色”并不能证明 Agent 修改被测试过。CI 应增加 changed-line coverage,并对 catch/except、重试、超时、回滚和资源清理路径设置更高覆盖要求。
Gemini 3.6 Flash:新模型重点是减少 Agent 循环和单位任务成本
Google 于 7 月 21 日发布 Gemini 3.6 Flash。官方定价为每百万 token 输入 1.50 美元、输出 7.50 美元,并称其相较 3.5 Flash 在 Artificial Analysis Index 上少用约 17% 输出 token;官方评测中,DeepSWE 从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%,OSWorld-Verified 从 78.4% 提升到 83.0%。这些均为厂商公布结果,需要在自己的仓库和 Agent Harness 中复测。
Gemini 3.6 Flash 已逐步进入 GitHub Copilot 的 VS Code、Visual Studio、CLI、Cloud Agent、JetBrains、Xcode 和 Eclipse 等入口,支持可配置推理强度和并行工具调用;企业管理员需要显式启用 Preview 策略。
推荐研发门禁
真实 Coding Agent 流程建议固定为:
- 一个任务一个独立 worktree;
- 保留完整修改轨迹;
- 最终补丁执行 TRIM 类最小化;
- 统计 changed-line coverage;
- 对异常路径生成故障注入测试;
- 比较修改前后的行为差异;
- 运行静态分析、依赖和密钥扫描;
- 只有最小化补丁和新增测试均通过后才能进入人工 Review。
工程判断:新模型可以降低成本,但代码质量提升主要依赖轨迹最小化和测试门禁,而不是模型自动“更谨慎”。
今日结论
今天最明确的趋势是:学习模块正在被限制在更明确、可验证的位置。
- 学习式光流只负责提出 VIO 测量,几何负责验证和加权;
- 多分辨率地图只提供紧凑先验点,状态估计仍由 MSCKF 完成;
- 窄通道规划根据真实扰动调速,NMPC 负责可执行性;
- 学习 critic 调节安全距离,ESDF/CBF 继续守住碰撞边界;
- 稠密 ViT 特征服务轻量控制,而不必绑定大型语言模型;
- 力记忆补充视觉无法观察的接触历史;
- 具身基础模型输出三维位置和接触点,传统规划器负责验证;
- Coding Agent 生成候选修改,轨迹最小化和测试覆盖决定能否合并。
共同原则是:
模型负责生成更好的测量、候选和先验;几何、优化、控制与测试负责决定这些结果是否可信。
最值得深入研究或尝试复现的 3 个方向
方向一:双目 VIO 的学习测量 + 几何验证前端
优先级最高。
在现有 VIO 中:
- 保留 KLT 时间跟踪;
- 引入 SEA-RAFT/XFeat 等生成双目对应;
- 输出并校准匹配不确定度;
- 加入极线和左右一致性检查;
- 将不确定度写入重投影协方差;
- 对比纯传统、纯学习和混合前端在运动模糊、动态人员、雨天反光下的表现。
重点指标是跟踪失败率和 OOD 稳定性,而不仅是平均 ATE。
方向二:窄通道无人机的扰动自适应速度规划
在不更换飞控的前提下:
- 计算模型预测与真实 IMU/里程计残差;
- 估计侧壁、地面和天花板引起的外扰强度;
- 将扰动转成速度和加速度上限;
- 在弯道、贴墙和控制误差增大时自动减速;
- 扰动回落后平滑恢复;
- 记录最小间距、跟踪误差、飞行时间和失败率。
方向三:Coding Agent 的补丁最小化与 changed-line coverage
为 Codex、Claude Code 或 Copilot 任务保存每轮 diff:
- 构建完整修改轨迹;
- 自动识别被废弃方案留下的代码;
- 尝试移除后重新运行验证;
- 统计变更行是否真正被测试执行;
- 强制覆盖异常处理和回滚路径;
- 将“补丁大小、人工修改量、变更行覆盖率”写入 PR 门禁。
这一流程与使用哪一种模型无关,却能直接改善长期仓库可维护性。
参考资料
- Geometry-Verified VIO
- MR-Voxel-SVIO
- Disturbance-Aware Flight
- Adaptive Safety Critic
- Patch Policy
- FM-VLA
- RynnBrain 1.1
- AI Coding
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。