技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-12
摘要
由于今天是周日,arXiv Robotics 最新公开批次仍是 7 月 10 日的 38 条论文,过去 24 小时内没有新的工作日批次。本期因此在避免重复昨日内容的前提下,从最新批次及近 72 小时官方更新中筛选增量信息。
今天最值得关注的技术趋势有四点:
- 多机器人定位正在从“共享最终位姿”转向共享预积分里程计和必要状态,同时显式维持估计一致性。
- 安全控制开始把执行器饱和直接纳入可验证安全管道,而不是在规划完成后简单裁剪控制量。
- 事件相机 SLAM 和控制获得了更实用的 Isaac Sim 数据生成工具,降低特定机器人数据采集成本。
- 机器人学习的重点从单纯模仿轨迹转向接触状态、世界变化和执行扰动下的闭环鲁棒性。
1. D-CLIPSE:多机器人定位不只共享位姿,还要共享“估计形成过程”
D-CLIPSE 是一个分布式一致性定位框架。每台机器人维护自身和邻居状态估计,通过通信共享预积分里程计以及与共同状态相关的信息。作者在仿真和硬件实验中报告,其精度与一致性能够接近集中式方法,并优于对比的去中心化方案。
为什么重要
很多多机器人定位系统只交换当前位置、协方差或局部子地图。这样虽然通信简单,但容易重复使用相关信息,导致协方差过度乐观,即所谓估计不一致。D-CLIPSE 的价值在于把“里程计如何累积到当前状态”也作为分布式融合的一部分。
对于无人机集群、机器狗协同巡检或多车建图,定位一致性往往比单次 ATE 更重要。一个看似精确但协方差错误的定位结果,会让后续编队控制、相对避障和地图融合做出过于激进的决策。
工程落地启发
可将现有多机器人系统拆成三层:
- 每台机器人继续运行本地 LIO、VIO 或轮速—IMU 前端;
- 机器人间只传输关键时段的预积分量、相关状态和必要协方差;
- 中低频共识滤波负责修正机器人间的相对漂移。
工程实现时应记录通信数据的时间区间和来源,防止同一份观测经不同机器人转发后被重复融合。
传感器与实时性假设
论文依赖每台机器人能够提供连续里程计,并存在机器人间可用的共享状态或协作观测。摘要未公布具体定位频率、带宽占用和通信丢包极限,因此暂时不能判断其是否适合高动态无人机。
可复现性与风险
目前 arXiv 页面没有提供公开代码仓库。真正落地时需要重点验证:
- 网络延迟和乱序数据;
- 机器人时钟不同步;
- 邻居频繁上下线;
- 预积分噪声模型不一致;
- 错误机器人间数据关联。
2. Input-Constrained STT:把执行器饱和纳入安全导航的可验证条件
这项工作针对未知 Euler–Lagrange 动力学系统,提出带输入约束的时空安全管道。其目标是在动态环境中满足有限时间的“到达—避障—保持”要求,同时保证控制输出不超过执行器能力。论文给出了可离线检查的可行性条件,并在移动机器人硬件以及四旋翼、航天器仿真中进行了验证。
为什么重要
许多安全控制或控制屏障函数方法默认控制器拥有足够大的控制权限。但真实机器人会受到:
- 电机最大电流;
- 最大转矩和加速度;
- 舵机速度;
- 无人机最大推力;
- 制动距离;
- 电池电压下降
等约束。
如果规划器给出的安全动作超过执行器极限,随后再简单做饱和裁剪,原有安全证明通常不再成立。这篇工作的核心价值,就是在设计安全管道时提前确认机器人是否拥有足够的控制能力。
工程落地启发
这类方法非常适合作为 MPC、MPPI 或强化学习策略之外的安全外壳:
- 上层规划器提供目标轨迹或安全通道;
- STT 层根据动力学不确定性和输入上限计算可执行管道;
- 管道不可行时,不继续追踪原目标,而是主动减速、悬停或进入安全状态;
- 底层控制器只在已确认可行的区域内工作。
对于无人机,应把最大水平加速度、推重比、姿态角限制和控制延迟都计入控制权限;对于轮式机器人,则需要加入制动距离、轮胎附着和转向速率。
实时性与鲁棒性
作者称该方法不需要在线优化,并具备实时实现能力。相比每周期求解大型非线性优化问题,这对嵌入式平台更有吸引力。
落地风险
最大风险是动力学不确定性界限设置。界限过小会破坏安全性,过大则会让可行管道过度保守。动态障碍的未来运动也必须有合理界限,否则静态安全证明不能直接覆盖突然加速的行人或车辆。
3. EVIS:事件相机 SLAM 获得可直接接入 Isaac Sim 的数据生成插件
EVIS 是面向 NVIDIA Isaac Sim / Isaac Lab 的事件相机插件。它实现了基于对数亮度变化的事件生成模型和逐像素异步参考更新,可从普通 RGB 相机配置迁移到事件相机配置。插件还支持利用双向运动矢量插值,只渲染稀疏关键帧并合成中间时刻,从而在单 GPU 上实现实时事件流生成;同时可加入传感器噪声和运动模糊。论文已提供代码仓库。
为什么重要
事件相机很适合高速运动、强光暗变化和低延迟控制,但其工程门槛一直很高:
- 特定机器人和场景数据难采;
- 真值位姿、深度和光流很难同步;
- 真实设备参数差异较大;
- 事件数据的可视化和调试不如帧相机直观。
EVIS 可以在同一个 Isaac Sim 场景中同时输出事件、位姿、深度、光流、语义和物理真值,适合开发 event VIO、event SLAM、快速避障和高速无人机控制。
工程落地启发
建议搭建以下 sim-to-real 流程:
- 在 Isaac Sim 中导入真实机器人 URDF/USD 和相机外参;
- 随机化事件阈值、噪声、曝光、运动模糊和场景光照;
- 联合输出事件流、IMU、RGB 和深度;
- 训练事件特征、深度或光流模块;
- 在真实事件相机上做少量校准和微调;
- 最终仍使用真实数据验证时间戳、延迟和事件密度分布。
实时性与可复现性
这是今天可复现性较好的一项工作:摘要明确给出公开代码,并说明可接入现有 Isaac Sim / Isaac Lab 场景。单 GPU 实时生成也使其具备批量强化学习或大规模数据生成的可能。
落地风险
运动矢量插值可能不能完全复现高速旋转、反射、LED 闪烁和复杂遮挡下的真实事件;真实相机还存在像素阈值不一致、热噪声、背景活动和时间戳抖动。因此仿真结果不能替代真实设备回放测试。
4. Shift & Drift:规划器不能只在训练分布里跑得好,还必须能从执行偏差中恢复
Shift & Drift 提供了两个面向闭环运动规划的压力测试轨道:
- Semantic Shift:把新的城市道路、交通结构和密集行人骑行者场景转换到 nuPlan 仿真框架中,共包含 1,182 个场景;
- State-Distribution Drift:向自车动力学连续注入随机且时间相关的执行扰动,测试规划器能否从自身误差中恢复。
论文发现,模仿学习规划器在分布内基准中表现很好,但面对新城市拓扑、密集行人和连续执行误差时明显退化;所测试的强化学习规划器表现出更平缓的性能下降。
为什么重要
很多端到端规划论文只在固定数据集回放或理想闭环中评估。真实机器人则会不断偏离训练轨迹:
- 控制器不能精确跟踪规划轨迹;
- 轮胎或足端发生滑移;
- 定位产生小幅跳变;
- 动态障碍行为与预测不同;
- 上一个错误动作改变了下一时刻的数据分布。
这会产生典型的闭环分布漂移。一个离线预测误差很低的策略,不一定能够从自身造成的偏差中恢复。
工程落地启发
无论做无人车、机器狗还是无人机,都应给规划器增加两类测试:
环境变化测试
- 换地图结构;
- 换道路或走廊宽度;
- 增加未见过的动态障碍组合;
- 改变传感器视角和地图风格。
执行漂移测试
- 注入定位偏移;
- 注入控制延迟;
- 注入相关而非独立的转向或速度误差;
- 模拟持续打滑和载荷变化;
- 检查策略是否能主动恢复,而不是持续积累误差。
落地风险
该基准主要面向自动驾驶,其结论不能直接等同于四足机器人或无人机。但“语义分布变化 + 状态分布漂移”的评测框架可以直接迁移到其他机器人控制系统。
5. ContactMimic:姿态正确不代表交互正确,接触必须成为独立控制变量
ContactMimic 面向人形机器人的物体交互动作。传统动作模仿主要跟踪人体或机器人关键点,但机器人即使到达正确姿态,也可能没有真正坐到椅子上、擦到黑板或推动家具。
该方法除关键点轨迹外,还显式跟踪身体部位与物体之间的二值接触指令,并使用接触奖励和轨迹增强,打破关键点几何与接触标签之间的伪相关。系统在 10 类仿真动作和 5 类真实机器人动作上验证了可控制接触行为。
为什么重要
机器人控制经常把“末端位置到达目标”当作任务完成,但接触任务真正关心的是:
- 是否接触;
- 哪个部位接触;
- 接触何时发生;
- 接触是否持续;
- 是否应避免接触。
这对人形全身操作、机械臂擦拭、推拉、倚靠和支撑动作都非常关键。
工程落地启发
在现有模仿学习或强化学习策略中,可以把接触单独编码为任务条件:
- 指定手、脚、膝、躯干或工具端是否应该接触;
- 关键点轨迹负责几何动作;
- 接触目标负责动作功能;
- 底层力控或阻抗控制负责控制实际接触力。
这样同一条动作轨迹可以根据任务要求产生“接触”和“不接触”两个版本。
Sim-to-real 与风险
论文证明了有限数量动作的真实部署,但二值接触只能表示“有或没有”,不能描述接触力大小、摩擦方向、滑动状态和稳定性。实际机器人仍需要六维力传感器、关节力矩估计或触觉传感器作为安全闭环。
6. EgoWAM:机器人从人类视频中学习时,预测“世界如何变化”比预测像素更有用
EgoWAM 研究如何利用大量第一视角人类视频训练机器人。作者固定策略骨干、动作头和数据配比,仅改变世界预测目标,比较原始像素、DINO 特征和三维运动流。
在三个真实双臂任务中,加入世界预测后,人类第一视角数据比单纯行为克隆更有效。其中像素预测迁移能力较弱;DINO 特征目标在分布外物体和场景泛化上最高带来约 4 倍提升,三维运动流则使分布内性能提升约 20%–30%。
为什么重要
人类视频与机器人数据存在明显差异:
- 人的手臂形态与机器人不同;
- 头部运动会带来剧烈相机运动;
- 人类动作风格不能直接复制;
- 视频中通常没有机器人关节动作标签。
但物体被推动、抓取、翻转后,世界发生的物理变化具有更强的主体无关性。EgoWAM 的结果说明,让模型学习“动作会导致什么环境变化”,可能比直接模仿人类运动更容易迁移到机器人。
工程落地启发
采集机器人数据时可额外训练以下辅助目标:
- 下一时刻 DINO 或自监督视觉特征;
- 三维场景流;
- 物体姿态变化;
- 接触前后局部几何变化;
- 可见区域与遮挡区域变化。
动作策略仍输出机器人动作,但共享编码器同时被要求理解动作的物理结果。
可复现性与风险
论文提供了项目页面,但大规模人类视频处理、三维运动估计和双臂数据采集仍可能有较高复现成本。DINO 特征虽然比像素更抽象,但不一定包含接触力、摩擦和精细几何信息。
7. FabriVLA:1B 级 VLM 也能构建多任务 VLA,但仿真成绩不能直接代表真实部署
FabriVLA 采用约 1B 规模的 InternVL3.5 视觉语言骨干,并加入 flow-matching 动作头。动作 token 之间使用门控自注意力,同时从较浅层 VLM 特征中融合空间信息。模型通过单阶段联合训练,在 Meta-World MT50 的 50 个操作任务上报告了 90.0% 的分层平均成功率。
为什么重要
目前不少 VLA 系统依赖数十亿甚至更大规模的模型,导致:
- 推理频率低;
- GPU 成本高;
- 难以在机器人端侧部署;
- 多机器人并行成本过高。
FabriVLA 说明,在任务结构明确、动作头设计合理的情况下,较小视觉语言骨干也可能获得较强多任务能力。
工程落地启发
对真实机器人,轻量 VLA 比追求最大模型更容易形成闭环:
- VLM 负责语言、物体和任务上下文;
- flow-matching head 输出短动作序列;
- 每执行少量动作后重新观测;
- MPC、MoveIt、阻抗控制负责约束和执行;
- 失败检测模块决定何时截断动作块。
实时性、复现性与风险
摘要没有公布真实机器人测试、控制频率、显卡配置或端侧部署数据,arXiv 页面也未显示代码仓库。因此目前更适合作为“轻量 VLA 架构方向”的证据,而不是可直接部署的机器人基础模型。
Meta-World 成功率无法覆盖真实世界中的相机标定误差、执行器迟滞、物体材质变化、接触力和安全约束。
8. Codex 并入 ChatGPT 桌面端:AI Coding 正从单一代码 Agent 转向统一工作环境
OpenAI 最新官方更新显示,原 Codex 桌面应用已在 7 月 9 日并入新版 ChatGPT macOS 和 Windows 桌面应用。Codex 仍保留专用编码界面,并增加或整合了差异视图内编辑、侧边栏 PR Review、更快的 Computer Use 和多仓库项目;桌面项目也能够从移动端访问。
为什么重要
这不是单纯的 UI 合并。统一桌面环境意味着代码 Agent 可以更自然地获得:
- 多仓库上下文;
- 文档和文件上下文;
- 浏览器和桌面应用状态;
- PR、diff 和测试结果;
- 研究、编码与交付物之间的连续任务上下文。
对于 vibe coding,真正的工程价值正在从“生成代码片段”转向“理解需求—修改多仓库—运行验证—检查界面—审查 diff”的完整链路。
是否适合接入真实研发流程
适合用于:
- 多仓库接口联调;
- 前端实现和视觉验收;
- 小型重构;
- PR 初步审查;
- 文档、测试和代码同步更新。
不应直接给予生产系统、部署凭据或无限制 shell 权限。
推荐安全治理
统一工作环境扩大了 Agent 的权限面,因此建议:
- 每个任务使用独立 worktree;
- 默认只允许访问当前项目目录;
- 浏览器、MCP 和桌面应用按域名或应用白名单授权;
- 安装依赖、读取密钥和网络上传必须人工批准;
- 自动记录 shell 命令、修改文件、浏览器操作和测试证据;
- PR 合并和生产部署始终保留人工确认。
今日工程判断
今天没有出现能够直接替代成熟 LIO、VIO 或图优化后端的新型通用 SLAM 系统。更具落地价值的是围绕现有机器人栈补齐薄弱环节:
- 用一致性分布式滤波解决多机器人状态共享;
- 用显式输入约束提升安全导航的可执行性;
- 用 EVIS 降低事件相机算法的数据与仿真门槛;
- 用分布漂移测试替代只看离线误差的规划器评估;
- 将接触、世界变化和执行恢复加入机器人学习目标。
机器人学习方向也表现出一个明确趋势:模型不再只学习“动作长什么样”,而开始学习动作是否产生正确接触、环境如何变化,以及偏离训练状态后如何恢复。
最值得深入研究或尝试复现的 3 个方向
1. 搭建 Event Camera + IMU 的 Isaac Sim 数据链路
使用 EVIS 输出事件流、IMU、深度和真值位姿,先验证现有 event VIO 或事件光流网络。重点比较:
- 不同事件阈值;
- 运动模糊;
- 高速旋转;
- 强光暗切换;
- 仿真与真实事件密度差异。
这是今天最容易快速形成工程实验的方向。
2. 给现有 MPC / MPPI 增加“控制权限可行性检查”
在优化器运行前,根据最大转矩、最大加速度、延迟和不确定性判断当前安全通道是否可执行。不可执行时主动降低速度或切换安全状态,而不是等控制输出超过限制后再裁剪。
对于无人机和机器狗,这比继续微调碰撞代价权重更有实际价值。
3. 构建带持续误差的闭环规划回归测试
参考 Shift & Drift,在现有仿真环境中加入:
- 连续定位偏差;
- 100–300 毫秒控制延迟;
- 持续转向偏差;
- 轮滑或足端滑移;
- 动态障碍预测错误。
测试指标除了成功率,还应记录恢复时间、最小障碍距离、连续失败长度和是否能够主动减速或重规划。
参考资料
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。