技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-26
摘要
今天是周日,arXiv 没有新的工作日批次;最新 Robotics 批次仍是 7 月 24 日公开的 35 项条目,Software Engineering 同日有 19 项。本期避免重复昨天已经介绍过的玻璃深度修复、能力条件化导航和 CBF 多无人机控制,重点筛选大场景 Gaussian SLAM、拓扑地图、机器人数据引擎、接触失败恢复、可解释视觉策略,以及 Agent 测试与 MCP 工程更新。
今天的核心趋势可以概括为:
- Gaussian SLAM 开始通过空间分解和稀疏锚点解决长序列显存增长问题;
- 机器人学习的竞争逐渐转向可持续增长的数据工程与固定评测协议;
- 接触操作中,LLM 更适合分配力预算、选择恢复技能,而不是直接控制力;
- 模仿学习策略开始暴露可查看、可人工修正的中间注意力;
- AI Coding 正从“让模型写测试”转向“先生成合法状态空间,再让模型具体化代码”;
- MCP 即将采用无状态核心,对自建 Agent 工具服务的扩缩容和兼容性有直接影响。
1. GLAM-SLAM:面向长距离户外场景的实时 Gaussian SLAM
GLAM-SLAM 针对现有单目 3D Gaussian Splatting SLAM 的三个问题:通常只适合短序列、难以实时运行,以及 Gaussian 数量增长造成过高 GPU 显存占用。系统保留鲁棒的特征式 SLAM 前端承担轻量跟踪,地图端则采用稀疏锚点网格、极线几何引导的光流稠密化,以及空间分区的局部 Gaussian 生成。
它把长距离地图视为多个局部场景,而不是让一个全局网络或一组不断增长的 Gaussian 同时覆盖整条路线。论文在 KITTI Odometry、Oxford RobotCar 和 Málaga 长序列上评估,报告重建质量相较次优方法提升约 15%,同时维持实时处理和长序列扩展能力。
为什么重要
多数 Gaussian SLAM 演示在室内短序列中效果很好,但机器人真正部署时会遇到:
- 地图跨度从几十米扩大到数公里;
- 路线经过大量重复道路和无纹理区域;
- Gaussian 数量持续增长;
- 回环后局部地图需要重新对齐;
- SLAM、检测和规划共享同一块 GPU。
GLAM-SLAM 的空间分解思路比单纯压缩 Gaussian 参数更接近实际系统设计。
适合谁关注
适合单目视觉 SLAM、户外巡检、低成本三维重建、道路采集和需要稠密可视化地图的机器人团队。
工程落地启发
建议将其定位为重建后端,而不是替换现有定位与安全地图:
- ORB-SLAM3、VIO 或 LIO 提供实时关键帧位姿;
- 按轨迹距离或空间区域划分局部 Gaussian 子地图;
- 仅在新区域创建新的局部生成器;
- 回环后只调整受影响的子地图位姿;
- Gaussian 地图用于可视化、语义查询和表面重建;
- ESDF、体素或点云地图继续负责碰撞检测。
可复现性与风险
论文提供了代码链接,但当前 GitHub 仓库仍非常早期,仅显示一次提交和基础 README,距离成熟工程包尚有差距。
另外,特征前端跟踪正确并不代表 Gaussian 几何足够保守;动态车辆、树叶和曝光变化仍可能产生漂浮物或残影。
工程判断:架构值得借鉴,代码成熟前不建议直接替换现有地图后端。
2. HGeo-TopoMap:用显式道路几何先验增强拓扑地图生成
HGeo-TopoMap 面向自动驾驶拓扑地图,目标是同时识别道路中心线、车道片段、交通标志及其连接关系。现实道路中心线往往没有直接可见的标线,因此系统先通过逆透视变换生成道路结构图,再用几何自适应模块编码语义和空间信息,并通过 prior-mask attention 重点关注有意义区域。
第二阶段通过几何一致性学习,将方向和空间关系相似的中心线实例在特征空间中对齐。论文在 OpenLane-V2 的中心线、车道段和鲁棒性测试中优于比较方法,并计划公开代码和权重。
为什么重要
这项工作虽然不是完整 SLAM,但体现了一个值得迁移的思路:拓扑地图不能只靠像素检测,必须显式利用结构关系。
对机器人而言,类似的结构包括:
- 走廊主方向;
- 门洞与房间的连接;
- 楼梯与平台的上下关系;
- 道路、通道和作业区域的连通性;
- 同一条通路在不同视角下的几何一致性。
工程落地启发
在现有点云或栅格地图上,可以增加轻量拓扑层:
- 从几何地图提取走廊骨架、门洞、路口和楼梯;
- 使用显式几何先验构建候选节点和连接;
- 学习模型只负责补充难以规则化的连接概率;
- 每条拓扑边保留净空、宽度、坡度和可通行模式;
- 拓扑规划后仍由局部地图验证真实可通行性。
风险
该工作针对道路数据和固定相机几何,不代表能直接迁移到机器狗、室内建筑或三维楼梯环境。代码目前尚未正式释放。
工程判断:适合借鉴“显式几何先验 + 学习连接关系”的地图分层方式,而非直接复用模型。
3. AXIS:浏览器遥操作、自动清洗和固定评测组成可增长机器人数据引擎
AXIS 不只是一个数据集,而是一条可持续增长的数据管线。用户无需本地 GPU 或真实机器人,可通过浏览器中的 MuJoCo-WASM 操作 Franka 机械臂;后台负责成功验证、失败过滤、去除犹豫和抖动、轨迹平滑与重采样,再通过 Isaac Sim 进行视觉和物理增强。
论文冻结版本包含 207 项任务、5 万余条轨迹和 6 万余任务/场景变体。每条数据保存语言指令、机器人和物体状态、动作、多视角 RGB-D、成功标签及元数据。持续预训练后,π0.5 在 LIBERO-Plus 的总体成功率由 83.9 提升至 88.8,提升最明显的项目是相机变化和传感器噪声。
AXIS 网站还显示实时增长的数据统计,但这些在线数字与论文固定快照不是同一个评测版本,不能直接混用。
为什么重要
机器人数据管线真正难的不是“采到一条成功轨迹”,而是:
- 不同操作者采集习惯不同;
- 原始遥操作含停顿、抖动和无效动作;
- 仿真版本或任务定义持续变化;
- 数据规模增加后评测条件也跟着变化;
- 无法区分数据量增长与评测泄漏带来的收益。
AXIS 用任务快照和固定 held-out 协议解决了部分问题。
工程落地启发
小团队可以复制其流程,而不需要复制其规模:
- 浏览器或 Android 端只承担低延迟遥操作;
- 后端统一保存任务定义、传感器、动作和成功判据;
- 自动删除停顿、动作尖峰和不可重放轨迹;
- 平滑后必须重新回放验证,不能只看曲线更漂亮;
- 不同数据版本使用固定测试集;
- 每轮训练单独记录相机、噪声、布局和语言变化下的表现。
值得注意的是,AXIS 的平滑和重采样会降低平均加速度与 jerk,但重放成功率也会下降,说明数据清洗不能只追求平滑。
风险
当前数据主要围绕 Franka 平行夹爪和桌面操作;浏览器仿真数据与真实接触、摩擦和执行器迟滞仍存在差距。
工程判断:本期机器人学习方向最值得借鉴的是数据生命周期,而不是特定 VLA 模型。
4. FORGE-plus:LLM 分配力预算与恢复策略,底层控制器守住硬限制
FORGE-plus 面向紧配合装配和易碎物体操作。冻结的纯文本 LLM 在执行前为每类物体分配力上限,并根据压入力曲线的紧凑文本摘要,从固定恢复动作菜单中选择下一步操作。
关键安全设计是:
- LLM 从不直接控制作用力;
- 低层控制器强制执行力上限;
- 恢复策略无权提高力上限;
- 真实破坏阈值对策略不可见。
在仿真中的易碎瓶放置和 0.4 毫米直径间隙齿轮插入任务里,同一策略完成 256/256 轮评估且没有破坏物体,完整取放—插入流程的平均峰值力为 5.4 N。存在夹持滑移时,力特征恢复策略在两种夹爪上分别处理了 40% 和 64% 的失败。
为什么重要
这提供了比“LLM 直接控制机械臂”更合理的分工:
- LLM 根据物体语义选择保守程度;
- 力控制器执行不可突破的边界;
- RL 或技能策略负责局部接触动作;
- 失败恢复只从已验证动作集合中选择。
工程落地启发
可将类似结构用于插装、开门、夹取易碎物和消防设备操作:
- 每个对象类别配置默认力预算;
- LLM 只能在批准区间内选择预算;
- 接触曲线压缩成峰值、斜率、振荡、卡滞和滑移等结构化特征;
- 恢复技能采用白名单,例如后退、旋转搜索、重新抓取;
- 所有技能都不能提高硬力限制;
- 超过重试次数后撤退或请求人工处理。
风险
全部实验都在刚体仿真中完成,论文明确不声称 sim-to-real;PPO 在严格力约束下失败等负结果也说明真实接触探索仍然困难。
工程判断:系统分层非常正确,但实体机械臂落地前必须重新验证力传感器、柔顺性和材料破坏模型。
5. PhysCoRe:解析物理负责主体演化,网络只学习材料与模型残差
PhysCoRe 面向软体和可变形物体操作,将可微 Material Point Method 模拟器与两个前馈网络结合:
- Material from Motion:从视觉运动估计每个粒子的弹性参数;
- Residual from Dynamics:补偿解析模拟器内部动力学与现实之间的系统偏差。
与纯数据驱动 world model 相比,它保留基本物理结构;与每个物体单独做慢速参数优化相比,它能从有限交互中快速估计材料,并对新物体进行在线识别。模型的不确定度还能指导机器人优先探索尚未确定的区域。
为什么重要
纯神经世界模型常出现:
- 软体形变不守体积或连续性;
- 训练物体上很好,换材料后快速崩溃;
- 长期 rollout 误差不断积累;
- 无法区分参数未知和模型结构错误。
PhysCoRe 分别用材料估计和残差修正处理这两个问题。
工程落地启发
该架构也可迁移到其他控制系统:
- 无人机:解析气动模型 + 学习侧风/下洗残差;
- 机器狗:刚体动力学 + 学习地面摩擦和沉陷;
- 轮式机器人:车辆模型 + 学习轮胎滑移残差;
- 机械臂:刚体模型 + 学习摩擦、柔性和负载残差。
学习模块最好只输出受限的参数或残差,且保留解析模型回退。
风险
可微 MPM 的计算成本、网格分辨率和材料模型限制仍可能阻碍高频闭环;论文页面也未显示成熟代码入口。
工程判断:很有方法论价值,更适合做世界模型或 MPC 预测模型,不适合直接替代实时底层控制器。
6. GuidedAttention:把视觉策略的关注点变成可查看、可一次修正的中间接口
GuidedAttention 在图像与 diffusion action policy 之间增加显式注意力关键点。策略先从相机图像预测任务相关位置,再以这些关键点为条件生成动作。操作者可以在 rollout 开始时查看并修改错误关键点,后续跟踪模块会自动传播修正结果。
论文在仿真和实体机器人中验证,尤其在目标位置变化和外观变化等 OOD 条件下,显式注意力与人工修正能够改善模仿学习表现。
为什么重要
端到端视觉策略失败时,通常很难判断原因究竟是:
- 关注了错误物体;
- 目标位置预测错误;
- 动作模型本身错误;
- 相机视角发生变化。
把关注点暴露出来后,操作者可以用很低成本修复第一类和第二类问题,而不用重新采集完整示范。
工程落地启发
类似接口可加入视觉伺服或 VLA 系统:
- 模型输出目标关键点、抓取点或接触点;
- UI 在执行前叠加显示;
- 人工只修正一次目标位置;
- 跟踪器负责短时间传播;
- 几何模块将像素点转换为三维位姿;
- MoveIt、MPC 或厂商控制器继续负责执行。
风险
关键点正确不代表动作轨迹安全;跟踪器在遮挡、反光和快速运动下也可能漂移。论文当前没有明确的开源代码链接。
工程判断:非常适合需要人工监督的小批量工业操作,比直接修改自然语言提示更可控。
7. AI Coding:先形式化合法状态,再让 LLM 生成测试代码
最新 Rust 测试生成工作使用 Colored Petri Net 描述 API 资源、生命周期、所有权和并发因果关系,再从模型中导出合法深状态、接近合法状态及偏序并发场景,最后让 LLM 将这些中间场景具体化为可执行 Rust 测试。
这解决了 LLM 直接生成并发 API 测试的典型问题:
- 违反 API 前置条件;
- 只生成浅层 happy path;
- 表面使用线程,实质仍是顺序执行;
- 无法判断是测试生成失败,还是库本身违反语义。
系统还加入结构修复循环、并发调度塑形和分层 oracle,把“测试代码编译失败”与“目标 API 行为错误”分开。
Infrastructure-as-Code 方向也得到类似结论:Terraform 生成不能只检查语法,需要依次经过 terraform validate、terraform plan 和 OPA/Rego 策略验证。Verifier 反馈迭代能显著提升通过率,而大量剩余策略失败实际来自 Agent 无法看到组织策略文本。
工程落地启发
对于 C++、ROS 2 或后台系统,可以复制“形式化场景 → LLM 具体化”的模式:
- 用状态机/Petri Net 表示设备、连接和资源生命周期;
- 自动生成合法、边界和冲突场景;
- LLM 只负责把场景翻译成测试代码;
- 编译、运行时和语义 oracle 分层判断;
- 失败时先修复测试,再判断产品代码;
- CI 中的 verifier 不允许由 Agent 修改或跳过。
工程判断:AI 测试生成最可靠的路线不是更长提示词,而是提供强约束的中间表示和确定性验证器。
8. MCP 与最新模型:无状态协议降低扩缩容成本,旗舰更新仍是 Opus 5
GitHub MCP Server 已提前支持计划于 2026 年 7 月 28 日正式发布的新 MCP 规范。新版本移除 session 和 initialize 状态,允许客户端并行握手,并让远程服务更容易横向扩展;GitHub 的实现也去掉了 Redis 会话读写。新规范同时加入官方 conformance tests,方便验证自建 MCP Client、Server 和 SDK 是否符合协议。
对自建 Agent 工具链的影响
- MCP Server 不应再把关键授权状态只放在会话内存;
- 每次工具调用都需要独立携带身份、权限和审计信息;
- 幂等性、重试和副作用去重需要显式实现;
- 升级前应同时测试旧客户端和新客户端;
- 使用官方 conformance suite 作为 CI 门禁;
- “无状态”不等于“无权限状态”,高风险授权仍应存放在模型外部安全系统。
模型侧,过去 24 小时没有新的通用旗舰正式发布。当前最近的旗舰更新仍是 Anthropic 于 7 月 24 日发布的 Claude Opus 5;它已进入 GitHub Copilot 的 VS Code、Visual Studio、CLI、Cloud Agent、JetBrains 等入口,定位复杂长程编码、多工具协调和回归验证。企业管理员需要显式启用,费用按模型提供商列表价计费。
工程判断
Opus 5 更适合跨模块重构、复杂根因分析和高价值 PR 审查,不适合作为搜索、格式修改等低价值任务的统一默认模型。应通过自己仓库上的成功率、人工返工和每个合并 PR 总成本决定路由,而不是只依赖厂商基准。
今日结论
今天各项工作共同指向一个明确方向:模型负责提供稠密表示、候选和高层判断,确定性系统负责状态、约束和执行。
- GLAM-SLAM 用学习和 Gaussian 提升重建,但特征前端维持位姿;
- HGeo-TopoMap 用网络补充拓扑关系,但显式几何提供结构;
- AXIS 用社区扩展数据,但成功验证和固定协议保证质量;
- FORGE-plus 让 LLM 选择力预算与恢复动作,低层控制器强制安全上限;
- PhysCoRe 让网络修正物理,而不是抛弃物理;
- GuidedAttention 暴露视觉中间状态,允许人类低成本修正;
- AI Coding 用 Petri Net 和 verifier 约束模型生成;
- MCP 无状态化改善基础设施,但权限与副作用仍必须由模型外系统治理。
最值得深入研究或复现的 3 个方向
方向一:LIO/VIO 前端 + 空间分区 Gaussian 地图后端
- 保留现有定位前端;
- 按空间切分局部 Gaussian 子图;
- 只对当前子图运行稠密化和优化;
- 记录每个子图的显存、Gaussian 数量和重建质量;
- 回环时只修正相关子图;
- 比较全局 Gaussian、分区 Gaussian 和 voxel/TSDF 的地图大小与更新延迟。
方向二:给机器人数据管线增加“平滑后回放验证”
- 自动删除停顿、抖动和无效段;
- 平滑并重采样到统一频率;
- 在原环境重新播放动作;
- 只有任务仍成功的数据才进入训练集;
- 同时记录 jerk 改善与成功率损失;
- 固定 held-out 场景评估数据规模收益。
方向三:用状态机或 Petri Net 生成并发与设备生命周期测试
- 建模连接、初始化、启动、停止、重连和销毁状态;
- 自动生成合法与近合法序列;
- 加入并发调用和故障注入;
- 让 LLM 生成 GoogleTest、pytest 或 Rust 测试代码;
- 编译、运行和语义检查分层处理;
- 验证器与状态模型不允许由 Agent 修改。
参考资料
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。