摘要

arXiv 在 7 月 23 日公开了 34 项 Robotics 条目和 15 项 Software Engineering 条目。过去 24 小时没有出现一套足以重新排序 FAST-LIO2、LIO-SAM、ORB-SLAM3 等成熟系统的新通用 SLAM,但出现了几条很有工程价值的支线:无位姿标签的 IMU 自监督里程计、显式考虑机器人尺寸的跨本体导航、MPC 与 CBF 分层的多机器人安全控制,以及用谱约束改善 LiDAR 无人机世界模型长程预测。

控制方向的共同趋势是:学习模型负责适配、预测和抽象,几何、动力学与安全过滤器保留最终执行权。AI Coding 方向则进一步说明,代码优化 Agent 不能只依赖计时和测试通过,还需要 profiler、行为验证、许可证来源追踪和明确的审批边界。

1. DINS-IO:不依赖位置真值,用可微捷联惯导约束训练 IMU 里程计

DINS-IO 尝试解决学习式惯性里程计的数据瓶颈。传统方法通常需要动捕、VIO 或 SLAM 提供高频精确位姿标签;DINS-IO 只使用原始 IMU 流进行预训练。它让网络以 IMU 频率预测机体系速度,并要求旋转到导航系后的速度变化,与比力积分结果在未知初速度和恒定加速度计偏置下保持一致。该约束被写成滑窗最小二乘问题,解析求解后将残差反向传播给网络。

自监督阶段只能学到运动一致性,不能自动确定完整度量尺度,因此作者再使用少量带标签轨迹,通过 LoRA 仅适配少量参数。论文称,小比例标签微调后可达到或超过完全监督的惯性里程计基线。

为什么重要

这类方法最适合把大量机器人日常运行日志变成训练数据。机器狗、无人机或车辆每天都能记录 IMU,但高质量位姿真值往往只有少数测试路段具备。

工程落地启发

不建议用 DINS-IO 单独替代 LIO/VIO,更适合承担三种角色:

LiDAR、视觉短时失效时的速度先验; LIO/VIO 后端中的学习式惯性辅助因子; 退化检测:网络速度与传统 INS、轮速或 LIO 差异持续增大时,触发传感器健康检查。

可先用全部无标签 IMU 日志自监督预训练,再选少量 RTK、动捕或高质量 LIO 轨迹进行 LoRA 校准。

风险与可复现性

恒定加速度计偏置和滑窗一致性属于简化假设,温漂、振动、传感器安装松动和强非平稳偏置可能导致误差。论文页面目前未列出公开代码,因此短期更适合复现损失函数,而不是直接替换生产定位模块。

工程判断:适合作为 LIO/VIO 的退化辅助链路,价值高于把它当成独立导航定位源。

2. EA-Nav:导航策略必须知道机器人自身尺寸和运动能力

EA-Nav 研究跨本体视觉导航:相同画面对于小型轮式机器人、宽体机器人和人形机器人,可能对应完全不同的安全动作。它在预训练阶段从互联网视频构建跨本体导航数据,并将机器人几何作为条件 token;微调时再把空间感知与风险修正解耦,通过轨迹增强生成高风险样本。

公开结果显示,引入 embodiment-aware Spatial Perception 和 Risk-Aware Correction 后,平均表现提高约 31%,在更拥挤的场景中收益更大。

为什么重要

当前很多视觉导航策略只输入相机图像和目标,却没有显式输入:

机器人宽度、高度和碰撞包络; 传感器相对机身的位置; 最小转弯半径; 制动距离和速度上限; 机器人运动时 footprint 的变化。

因此同一策略换到底盘、机器狗或人形机器人后,视觉理解可能仍然正确,但动作已经不安全。

工程落地启发

对你的机器狗或无人机,可以将以下参数编码成固定条件:

机身尺寸和传感器外参; 当前模式,如平地、登梯或轮式; 最大横向速度、角速度和制动能力; 当前载荷和控制延迟; 局部可通行高度和宽度。

模型输出最好是风险图、允许速度区域或短轨迹,而不是直接输出未经约束的 vx/vy/vw。

风险

论文主要证明了跨本体条件建模的有效性,未说明其能否覆盖传感器外参错误、机身摆动和真实地面滑移。生产系统仍需独立 costmap、停止距离和姿态安全限制。

工程判断:值得把“机器人本体参数 token”加入现有学习导航器,改造成本通常低于重新训练每个平台的独立策略。

3. 分布式 MPC + CBF:多机器人规划与安全过滤应分成两层

这项工作面向可重构机器人船,由各机器人通过 ADMM 分布式求解局部 MPC,协调完成目标形状和任务分配;在高频执行层,再使用分布式 CBF 过滤器保证机器人之间不碰撞。系统在最多 25 个仿真 Agent 和 4 台实体机器人上进行验证。

为什么重要

单独使用分布式 MPC 会遇到非凸优化、局部最优和有限迭代时间问题;单独使用 CBF 又只能做局部安全修正,缺乏长时域协同能力。两者组合后:

MPC 负责队形、目标和长期轨迹; ADMM 负责分散计算与交换邻居信息; CBF 在每个控制周期修正可能碰撞的动作。

工程落地启发

这个架构可迁移到无人机编队或多机器狗协同:

低频分布式规划器计算目标与参考轨迹; 每台机器人只和邻居交换必要状态; 高频安全层独立计算最小动作修正; 通信丢失时继续保证本机碰撞安全; ADMM 未收敛时仍允许执行经过 CBF 过滤的保守动作。

风险

CBF 的安全保证依赖邻居状态、动力学和控制周期准确;高速 Agent、通信延迟和突然出现的障碍物会削弱保证。多机器人数量增加后,ADMM 通信轮数也可能成为实时瓶颈。

工程判断:比端到端多 Agent RL 更适合安全关键协同系统,尤其适合已有 MPC 基础的团队。

4. Koopman Dreamer:通过谱约束抑制世界模型长程想象漂移

Koopman Dreamer 将 Dreamer 的潜在动力学替换为受谱约束的结构化模型。其核心使用二维旋转—缩放块表示阻尼、旋转和近周期模态,并限制谱半径;线性和低秩双线性项负责表达动作的全局及状态相关影响。

在 UAV-LiDAR 森林导航实验的 240 个闭环 episode 中,Koopman Dreamer 成功率达到 73.8%,DreamerV3 为 53.8%,D4PG 为 15.8%。在 64 步开环预测中,它也显著降低了 LiDAR、速度、潜在状态和奖励预测误差。

为什么重要

普通世界模型的状态转移网络可能在训练短 rollout 时表现正常,但长程想象会出现:

速度或位置逐渐爆炸; 障碍物信息被遗忘; 周期运动快速衰减; policy 在错误想象中获得虚高奖励。

谱半径约束允许工程师直接限制内部动力学的增长速度,比完全黑盒 transition 更容易控制长程误差。

对 LiDAR 无人机的启发

不一定需要完整复现 Dreamer。可以先将结构化动力学用于:

预测局部 occupancy 或 LiDAR latent; 评估候选速度在未来 1–3 秒的碰撞风险; 给 MPPI/MPC 提供 warm start; 在网络预测发散时退回恒速或传统动力学模型。

风险

结果来自仿真森林环境,尚不能代表真实 MID360 的噪声、遮挡、风扰和状态估计跳变。谱稳定也只保证模型不会任意放大内部状态,并不保证地图、奖励或动作语义正确。

工程判断:这是本期最值得关注的强化学习控制工作,适合研究“世界模型 + 传统安全规划”的混合架构。

5. Extreme-RGMT:持续学习新动态技能,同时保护已经掌握的基础运动

Extreme-RGMT 首先使用多源运动数据训练通用人形动作跟踪器,再将动作按跟踪难度分为已掌握和高难度集合。第二阶段对高动态片段进行强化训练,同时通过非对称技能获取与能力巩固机制限制基础策略漂移,并使用难度感知采样和基于优势的轨迹重采样,增加关键失败片段的训练比例。

为什么重要

训练跳跃、翻滚等专项技能时,策略经常会遗忘站立、行走和普通跟踪能力。该工作把“学习新技能”和“保护旧技能”作为两个独立目标,而不是把全部数据混合后继续训练。

工程落地启发

即使没有关节级控制权限,也可以把这个思路用于上层技能选择:

保存平地、登梯、转角、下梯等已验证技能的回归集; 新增跨越或绕障能力时,只重点采样困难片段; 每次训练后必须重新执行全部旧技能测试; 对旧技能性能下降设置发布阻断阈值; 失败轨迹按严重程度和信息量重新采样。

风险

论文强调高动态人形跟踪,但当前摘要未提供明确实体平台成功率、控制频率或完整开放代码。对商用机器狗更适合借鉴持续学习和回归验证方法,而非复制底层网络。

工程判断:对长期迭代机器人策略很有价值,核心是“能力回归测试集”,不是单一 RL 算法。

6. Contact-Persistent Full Actuation:无人机能悬停,不代表接触后仍有控制余量

传统全驱动无人机通常通过控制分配矩阵满秩来证明可以产生六维 wrench。但在推墙、拉门或持续接触时,一部分推力已经被任务力占用,剩余控制余量可能不足以稳定姿态或抵抗扰动。

该工作将执行器约束下的可行 wrench 表示成多面体,定义任务载荷后的残余 wrench 集合。其主要结论是:只有任务 wrench 位于可行多面体内部时,系统才保有非零六维残余控制权;安全余量等于任务 wrench 到多面体边界的距离。

为什么重要

这意味着无人机即使自由飞行控制良好,在接触任务中也可能因为:

横向推力不足; 悬停余量被耗尽; 某个电机接近饱和; 倾转角度过大或过小

而突然失去姿态或扰动抑制能力。

工程落地启发

对空中操作或贴墙作业,可在任务规划前计算残余 authority margin:

小于阈值时禁止进入接触; 接触力增大时自动降低姿态、速度和附加运动要求; 控制分配器优先最大化剩余余量; 将余量作为 MPC/CBF 的安全约束; 电池电压下降或电机异常时重新计算可行 wrench 集。

风险

当前主要是理论和数值验证,尚未提供实体 UAV 接触实验。真实系统还需考虑倾转舵机动态、电机响应延迟和气动耦合。

工程判断:对空中消防、按压、擦拭、开门等任务非常关键,应在设计阶段就计算,而不是接触失稳后再调 PID。

7. LENS:让 LLM 简化环境,而不是让 LLM 直接规划动作

LENS 面向多物体杂乱操作。它由 LLM 根据当前任务动态生成抽象场景,例如把堆叠物体合并成一个整体、移除远离任务区域的干扰物,或在任务进展后重新更新抽象。这个简化后的场景再交给现有经典规划器、模型控制器或 VLA。

为什么重要

杂乱场景的复杂度常来自大量无关对象和接触组合。让 LLM 直接输出机器人动作风险很高,但让它只决定“规划器现在需要考虑哪些实体”,输出更容易验证,也能明显降低碰撞检测和搜索复杂度。

工程落地启发

可把 LENS 思路迁移到点云规划:

LLM/VLM 只输出对象分组、任务相关性和抽象层级; 几何模块决定哪些点云真正可以合并或删除; 被忽略对象仍保留在紧急碰撞地图; 规划失败后恢复更完整场景重新计算; 所有抽象带版本和可撤销记录。

风险

语义上不重要的物体仍可能形成真实碰撞,例如桌边、电线和透明障碍物。LLM 只能简化规划模型,不能删除底层传感器检测到的安全障碍。

工程判断:这是 LLM 接入传统机器人技术栈的合理位置,比直接生成控制指令更容易工程化。

8. AI Coding 与模型动态:Profiler、许可证来源和审批语义成为新门禁

PerfAgent:性能优化必须由 profiler 驱动

PerfAgent 将 profiler 和 verifier 加入 Coding Agent 循环,让 Agent 根据真实热点继续迭代,而不是生成一个测试通过、仅有浅层提速的补丁后停止。在 GSO 上,达到专家级性能的补丁比例从 19.6% 提高到 39.2%;在 SWE-efficiency-Lite 上从 26% 提升到 74%。

对 C++、SLAM 或视频系统,这意味着性能 Agent 应固定读取:

CPU flame graph; GPU kernel 时间; 内存分配和 cache miss; ROS 2 回调延迟; 优化前后的正确性与性能回归测试。

只比较总耗时容易把缓存、测试数据变化或功能缺失误当成优化。

AI 供应链的许可证标签并不可靠

一项对 232,270 条 dataset→model→application 链路的研究发现,62.3% 的链路至少经过一个未声明许可证的工件;带明确义务的许可证类别端到端保留率均低于 7%,而宽松许可证标签保留率达到 95.1%。这说明下游仓库标记为 MIT、Apache 或“可商用”,并不能证明上游数据和权重允许这样使用。

工程上应为模型和数据建立类似 SBOM 的清单,记录上游数据集、基础权重、微调数据、许可证原文、版本和下载哈希,而不能只读取最终模型卡中的一行标签。

GitHub Issues 增加 Agent 审批、置信度和理由

GitHub 在 7 月 23 日为 Issue 自动化加入建议审批、置信度和操作理由,可让中低置信度的标签、分配、关闭等修改等待人工确认。但 GitHub 明确指出,这种审批是工作流便利功能,不是服务器侧安全边界;拥有修改权限的 Agent 仍可选择直接应用操作。

因此真正的安全控制仍应依赖最小权限 token、分支保护、外部 effect gate 和不可绕过的 CI 规则。

最新模型状态

本期未发现过去 24 小时内新的通用旗舰模型发布。当前近期重要通用模型仍包括 GPT‑5.6 系列;官方将 Sol、Terra、Luna分别定位为旗舰、平衡和低成本模型,并提供 Programmatic Tool Calling、多 Agent beta 及分层价格。

工程判断:模型选择固然重要,但 profiler、供应链来源和不可绕过的执行门,对真实研发可靠性的影响更直接。

今日结论

今天最明确的技术趋势是:系统正在把学习模型放进更小、更明确的职责边界中。

DINS-IO 用物理一致性约束学习 IMU 速度,但不取代完整状态估计;EA-Nav 让策略理解机器人尺寸,但最终安全仍由几何限制;Koopman Dreamer改善世界模型长程预测,但真实轨迹仍需规划器验证;LENS 只简化场景,不直接控制机器人;PerfAgent 用 profiler 指导优化,而不是让模型凭直觉猜热点。

共同原则是:

让学习模型提出测量、先验和候选,让物理、几何、优化器和验证器决定它们能否进入真实系统。

最值得深入研究或尝试复现的 3 个方向

方向一:用无标签 IMU 日志训练退化辅助里程计

采集机器狗或无人机的大量原始 IMU,复现 DINS-IO 的滑窗可微 INS 一致性损失;仅使用少量 RTK/LIO 高质量轨迹做 LoRA 校准。先将输出用于速度异常检测和 LIO 退化辅助,不直接输出最终位置。

方向二:给 LiDAR 无人机世界模型加入谱稳定约束

在现有 occupancy/latent dynamics 网络中限制状态转移谱半径,比较普通 MLP、GRU 与 Koopman 结构在 32–128 步开环预测中的 LiDAR、速度和碰撞风险漂移,再将其用于 MPPI 候选轨迹评分。

方向三:为 Coding Agent 建立 profiler + verifier + 许可证门禁

每次优化任务固定执行:基准冻结、profiler 定位热点、补丁正确性验证、性能统计显著性检查、上游依赖许可证追踪。Agent 只有在行为一致、性能真实改善且供应链来源明确时才能提交 PR。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。