摘要

arXiv Robotics 最新批次为 2026 年 7 月 24 日,共列出 58 项,其中 30 项为新投稿。今天没有出现一套足以重新排序 FAST-LIO2、LIO-SAM、ORB-SLAM3 等成熟系统的新通用 SLAM 前端;更值得关注的是玻璃场景深度修复、跨本体可通行性、CBF 强化学习、多机器人生成式轨迹优化,以及控制策略与底层柔顺控制的联合设计。

机器人基础模型侧,单目 RGB 导航正在尝试跨轮式、足式和无人机共享图像空间动作接口;AI Coding 侧则出现了两个明显信号:恶意 Issue 能穿透现有 Agent 防护,而长期任务记忆不能继续依赖模型主动读写文档。模型发布方面,Anthropic 于 7 月 24 日正式发布 Claude Opus 5,并同步进入 GitHub Copilot。

1. GlassRecon:用深度基础模型修补玻璃造成的 RGB-D 地图空洞

《Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation》针对玻璃表面导致 RGB-D、结构光和 ToF 深度异常的问题,提出一种无需额外训练的融合框架。系统使用 Depth Anything 3 提供结构深度先验,再通过局部 RANSAC 将相对深度与原始传感器的有效区域对齐,恢复度量尺度,同时避免玻璃区域中的错误深度污染标定。作者还构建了带玻璃区域几何真值的 GlassRecon 数据集,论文已被 IROS 2026 接收,代码和数据计划公开。

为什么重要

玻璃门、落地窗和反光隔断是室内机器人最常见的地图漏洞之一。只依靠深度相机时,玻璃可能被识别成自由空间;只依靠单目基础模型时,又缺乏可靠尺度。该方法的价值在于让基础模型只补结构,真实传感器仍负责度量尺度。

适合关注

RGB-D SLAM、视觉 SLAM、服务机器人、室内机器狗、玻璃幕墙巡检和低成本避障。

工程落地启发

  • 原始深度先经过有效性与时间一致性检查
  • 仅在空洞、异常跳变或疑似玻璃掩膜内调用单目深度先验
  • 使用多个非玻璃局部区域估计尺度,而不是整幅图一次对齐
  • 修复深度进入导航地图前应做保守膨胀
  • LiDAR 能看到的结构应优先于生成深度
  • 保存“测量深度”和“推断深度”两套置信度,避免后端把它们等权处理。

风险

深度基础模型可能把真实开口、镜面反射或透明通道补成实体。该结果适合作为候选表面,不应无条件写入紧急碰撞地图。

2. CAT:让可通行性模型显式理解机器人自身能力

Capability-Aware Traversability 将机器人尺寸、运动能力和物理限制直接编码进空间特征,而不是先预测一个通用地形分数,再在规划末端过滤。系统利用机器人真实轨迹生成稠密监督掩膜,并通过 SPADE 模块,用机器人专属 traversability vector 调制语义地形图。论文在真实执行轨迹上的 AUROC 相对强基线提高 11.0%,在人类轨迹上的 AUPRC 提高 15.8%;系统已部署到四足机器人和滑移转向机器人,并在嵌入式硬件上以约 4.8 Hz 运行。

为什么重要

同一片碎石、台阶或斜坡,对轮式机器人、轮足机器狗和纯足式机器人可能具有完全不同的可通行性。把机器人能力放到表示层,比最后简单调整 costmap 膨胀半径更合理。

适合关注

机器狗、轮足机器人、户外巡检、楼梯与非结构化地形导航。

工程落地启发

  • 输入机器人宽度、离地间隙、最大台阶高度和坡度
  • 把当前模式——轮式、足式、登梯——作为条件向量
  • 从实际通过、打滑、急停和人工接管记录中生成监督
  • 输出 traversability cost,而不是直接输出速度
  • Nav2、A*、MPPI 或现有厂商控制器继续负责路径和执行
  • 模型低置信时回退到人工标定的保守阈值。

风险

4.8 Hz 只适合中低频地形评价,不能独立承担高速近障控制。机器人换轮胎、载荷或控制器后,能力向量和监督数据也需要重新校准。

3. CBF 强化学习:多无人机吊载实现跨队伍规模零样本迁移

该工作针对多无人机通过绳索共同搬运载荷的耦合控制问题,使用一个保留无人机—载荷关键耦合关系的二维简化模型进行训练。策略采用 Discrete Graph Control Barrier Function PPO,并对队伍数量、物理参数等进行域随机化,最终得到完全分布式策略。论文报告同一策略能够在不同无人机数量和任务配置下零样本迁移到真实硬件,多组无人机同时运行时,其他队伍还可作为动态障碍物处理。

为什么重要

这代表较务实的 Safe RL 路线:训练阶段允许学习复杂协调行为,但安全结构由图 CBF 提供,不把全部安全责任交给奖励函数。

适合关注

无人机编队、多机器人协作、安全强化学习、sim-to-real。

工程落地启发

  • 使用最小但保留关键耦合的模型训练策略
  • 策略只输出高层协同控制或参考量
  • 每台无人机本地运行安全过滤和底层姿态控制
  • 队伍数量作为图结构变化处理,而非为每种规模训练独立策略
  • 通信中断时至少保证局部碰撞和绳索安全
  • 真实部署前单独测试 CBF 不可行和执行器饱和情况。

风险

二维抽象可能忽略摆动、绳索松弛、气流和三维缠绕。零样本迁移成功不代表所有载荷、绳长和高速动作均安全。

4. URF:策略同时预测动作、刚度和阻抗—导纳切换比例

URF 将学习策略与底层柔顺控制统一起来。模型不仅预测虚拟目标,还预测刚度矩阵和 impedance-admittance switch ratio:需要准确跟踪和顺应外力时偏向导纳控制;进入刚性接触、可能快速积累作用力时则增加阻抗控制成分。由于示范数据没有环境刚度真值,作者从实测接触力中构造切换比例标签。箱体翻转和压线任务中,URF 提高了成功率,并减少了力快速上升、振荡、工具损坏和机器人安全停机等问题。

为什么重要

机器人策略输出同一条末端轨迹,在不同底层控制器下可能表现完全不同。把控制模式留给固定参数,容易导致策略和执行器之间不匹配。

适合关注

接触操作、插装、打磨、开门、擦拭、力控机械臂和 VLA 执行层。

工程落地启发

  • 策略输出末端目标、刚度和柔顺模式
  • 硬力上限仍由独立控制器执行
  • 切换比例设置变化率限制,避免控制模式跳变
  • 接触前使用低刚度,稳定接触后再渐进调整
  • 力传感器异常时回退到保守阻抗模式
  • VLA 只给语义动作,URF 类控制层负责接触执行。

风险

接触力推导出的标签未必能区分材料刚度、摩擦、几何卡住和传感器偏置。策略不能拥有提高硬力上限的权限。

5. DMBD:把多机器人扩散轨迹优化拆成局部去噪过程

Distributed Model-Based Diffusion 将集中式多机器人扩散优化拆成多个局部条件反向扩散过程。每台机器人只在自身控制空间内去噪,同时接收服务器聚合的其他机器人当前轨迹估计。论文在目标互换、多楼层覆盖、停车和高密度通行场景中进行仿真,报告能在亚秒级解决多种复杂协调任务,并在扩展性上优于比较基线。

为什么重要

集中式扩散规划随着机器人数量增加,会迅速遇到维数灾难;完全独立规划又难以处理机器人之间的耦合。DMBD 选择共享轨迹估计,而不是共享全部动力学和代价函数。

适合关注

多机器人轨迹优化、仓储机器人、无人机群和大规模任务协调。

工程落地启发

  • 每台机器人维护本地动力学和障碍约束
  • 服务器仅聚合轨迹预测和冲突信息
  • 使用固定轮数去噪,保证最坏情况延迟
  • 最终轨迹仍经过本地碰撞检查和 MPC
  • 通信延迟时扩大其他机器人轨迹的不确定区域
  • 服务器失效时回退到分布式避碰或停车模式。

风险

当前结论来自仿真。亚秒级对仓储调度可能可用,对无人机高速闭环仍偏慢,且服务器仍是潜在单点故障。

6. Robostral Navigate 与 MoE VLA:机器人模型开始统一接口,同时保留技能模块化

Robostral Navigate 是一款 8B 视觉语言导航模型,仅使用单目 RGB 图像流,在当前画面中“指向”下一个目标位置。由于动作位于图像空间而非机器人专属坐标系,模型可以跨轮式、足式和无人机使用。其训练数据包括 35 万个仿真场景中的 240 万条轨迹;prefix-caching 训练方式把训练 token 降低约 22 倍。论文报告 R2R-CE 成功率为 77.4%,RxR-CE 为 75.1%。

同期的 MoE VLA 研究则发现,简化的 Mixture-of-Experts 动作头可在没有人工指定技能层级的情况下,自发形成被多个任务复用的低层行为专家;路由器承担高层技能排序,而不同专家对应不同动作原语,整体任务性能与单体基线相当。

为什么重要

两项工作指向互补路线:

  • 图像空间 waypoint 降低跨本体接口成本;
  • MoE 动作头降低一个巨大单体策略内部的技能干扰。

工程落地启发

  • 基础模型只输出画面目标点或短 waypoint
  • 用深度、LiDAR 和相机标定将其转换到机器人坐标系
  • 传统规划器验证可达性和障碍净空
  • 平地、登梯、绕障等执行能力可映射到不同专家或厂商技能
  • 高层模型不直接输出关节或电机命令
  • 专家路由异常时退回显式行为树。

风险

纯 RGB 导航仍可能在玻璃、弱光、楼梯边缘和动态障碍中失效。图像空间统一并不自动解决不同机器人的动力学和尺寸差异。

7. Coding Agent:恶意 Issue 能穿透防线,长期记忆必须由 Harness 主动投递

IssueTrojanBench 使用恶意 Issue、PDF、评论等六类投递载体,对 Cursor、Claude Code 和 Codex Desktop 等实际 Coding Agent 进行测试。恶意任务覆盖四种攻击类别;实验中 66.5% 的恶意 Issue 穿透了模型与 Agent 两层防线。拒绝主要来自模型本身,Agent Harness 提供的额外保护非常有限。

另一项研究指出,Coding Agent 的关键工作记忆不应依赖模型主动写入和检索文件。在一次 114 轮真实任务中,即使预置了 memory store,Agent 的主动 memory 操作为 0;上下文压缩后,10 条只存在于对话中的事实在第一次摘要时便消失,并在 108 次压缩中的 106 次保持缺失。由 Harness 根据路径、符号、事件和时间触发条件确定性注入记忆,则能让信息跨 138 次恢复持续送达。

工程落地启发

  • Issue、README、PDF 和评论全部视为不可信输入
  • 不可信文本无权决定 shell、网络、密钥和部署操作
  • 高风险动作经过模型外部的 effect gate
  • 记忆由 Harness 根据文件、符号和事件自动注入
  • 压缩后重新读取结构化证据,而不是相信摘要
  • 每条记忆包含来源、有效范围、版本和失效条件
  • Agent 无权自行修改安全门和记忆触发规则。

工程判断:真实 vibe coding 的核心竞争力已经不只是模型,而是 Harness 的权限、记忆和执行语义。

8. Claude Opus 5:面向长程 Coding Agent 的新 Opus,已进入 Copilot

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。官方将其定位为日常复杂 Agent 与专业工作的主力模型,价格为每百万 token 输入 5 美元、输出 25 美元,与 Opus 4.8 相同;Fast mode 约为默认速度的 2.5 倍,但价格翻倍。Anthropic 表示,Opus 5 在 Frontier-Bench 和 CursorBench 等软件工程评测中显著优于 Opus 4.8,并在验证工作、根因分析和长程多工具任务上有所加强。上述基准主要来自厂商或合作方测试,仍需要在自己的仓库中复测。

同日,Claude Opus 5 开始进入 GitHub Copilot,可用于 VS Code、Visual Studio、Copilot CLI、Cloud Agent、Copilot App、GitHub 网页与移动端、JetBrains、Xcode 和 Eclipse。Business 与 Enterprise 管理员需要显式开启模型策略,使用量按模型提供商的 API 列表价格计费。

是否适合真实研发流程

适合:

  • 跨模块或跨仓库重构
  • 疑难 C++、并发和构建问题
  • 长时间根因分析
  • 需要浏览器、终端和测试协调的任务
  • 高价值 PR 的二次审查。

不适合默认用于:

  • 大批量代码搜索和格式修复
  • 简单测试生成
  • 可由低成本模型并行完成的小任务。

推荐路由:低成本模型负责搜索、分类和机械修改;Opus 5 只处理高复杂度任务,并通过“每个成功 PR 的总成本、人工返工时间和缺陷逃逸率”判断是否真正划算。

今日结论

今天最明确的趋势是:学习模型的职责继续收缩到候选、参数与中间表示,确定性模块负责安全和执行。

  • 深度基础模型修补玻璃几何,但真实传感器提供尺度;
  • CAT 学习机器人能力差异,但规划器负责最终路径;
  • CBF-RL 学习多机协作,但安全结构不依赖奖励;
  • URF 预测控制模式,但硬力上限保持独立;
  • DMBD 生成多机器人候选轨迹,本地控制器负责执行;
  • Robostral 统一图像空间接口,传统几何负责坐标与可达性;
  • Coding Agent 生成代码和计划,Harness 决定记忆、权限和副作用。

这类混合架构比“一个大模型直接包办感知、规划、控制和执行”更容易复现、调试和部署。

最值得深入研究或尝试复现的 3 个方向

方向一:玻璃感知修复接入现有 RGB-D / LiDAR 地图

  • 检测原始深度空洞和异常跳变
  • 使用 Depth Anything 类模型生成结构先验
  • 通过局部非玻璃区域恢复尺度
  • 与 LiDAR、历史地图和多帧观测交叉验证
  • 为推断深度设置独立置信度
  • 比较玻璃门漏检率、误占用率和地图完整度。

方向二:能力条件化的机器狗可通行性地图

  • 输入机身宽度、离地间隙和最大台阶高度
  • 将轮式、足式、登梯模式作为条件
  • 使用实际通过、打滑和人工接管数据训练
  • 输出 costmap 层,不直接输出速度
  • 与 Nav2、MPPI 和厂商 SDK 组合
  • 对新机器人或载荷变化保留保守回退。

方向三:Coding Agent 的恶意 Issue 回归集与 Harness 记忆层

  • 构造 Issue、README、PDF 和评论中的提示注入
  • 所有副作用经过模型外部准入门
  • 记忆通过路径、符号和事件条件自动投递
  • 测试上下文压缩后是否丢失关键事实
  • 对不同模型与 Agent Harness 的组合分别评估
  • 以危险操作拦截率和任务成功率共同作为上线指标。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。