机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-08-03

日期:2026-08-03

摘要

截至 8 月 3 日早间,过去 24 小时内没有出现足够数量、且已经能够从原始论文或官方页面完整核验的新常规机器人论文批次。本期因此不重复前几天已经分析过的 RaDiVe、X-NavDP、PAC-MAN、FA-RDP 等工作,而是从近期公开成果中补充七项此前尚未展开、但很适合工程团队关注的方向。

定位与规划方面,D-CLIPSE 通过共享预积分里程计和相关状态,使每台机器人在没有中央服务器的情况下同时估计自己与邻居,并接近集中式滤波的一致性;ROP-RAS3 则将快速采样式运动规划生成的宏动作接入在线 POMDP,在最长 3000 步、最高 35 维状态空间中处理长时域部分可观测规划。

机器人基础模型方面,XS-VLA 说明轻量模型的核心短板并不只是参数少,而是缺乏空间理解;HandITL 用平滑的人机干预解决灵巧手接管瞬间的姿态跳变;Mem-World 使用以腕部视角为中心的 4D surfel 记忆,缓解遮挡和快速相机运动造成的世界模型遗忘。

AI Coding 方面,Agentic Harness Engineering 和 Harness-Bench 都指向同一结论:Agent 能力应按“模型 + Harness”评估,工具、中间件、长期记忆、状态恢复和验证器往往比继续堆叠系统提示词更重要。平台侧,GitHub Copilot Billing Preview 应用于今天退役;Gemini 2.5 Pro 与 Gemini 3 Flash 已从 Copilot 淘汰,npm v12 也开始默认关闭依赖安装脚本和远程依赖。当前可核验的 OpenAI 与 Anthropic 官方发布页没有显示过去 24 小时出现新的同级通用旗舰模型。

1. D-CLIPSE:共享预积分里程计和相关状态,逼近集中式多机器人定位

D-CLIPSE 全称为 Distributed Consensus-based Localization with Passive Listening on Shared State Exchange。它针对多机器人定位中的经典矛盾:集中式滤波能够利用团队全部测量,通常精度最好,但要求稳定通信、中央计算节点和全局数据汇聚;完全去中心化方案更容易部署,却容易因为重复利用相关信息而变得过度自信。

D-CLIPSE 让通信机器人交换预积分里程计和与共同状态相关的信息。每台机器人维护自己的状态以及邻居状态估计,并通过共识式更新和被动监听共享状态交换,降低跨机器人相关性处理不当造成的一致性问题。论文在仿真与实验场景中报告,其精度和一致性接近集中式方案,并优于对比的去中心化方法。

为什么重要

多机器人系统真正困难的不是让两台机器人交换一次相对位姿,而是长期避免信息重复计数。例如 A 把自身估计发给 B,B 融合后再发回 A,如果系统不知道这些信息具有共同来源,就可能把同一证据当成两次独立测量,协方差越来越小,但真实误差并没有下降。

对于无人机集群、机器狗协同巡检或多车建图,一致性通常比短时间内更低的均方误差更重要。一个略保守但可信的估计,往往比数值看起来更精确、实际已经过度自信的估计更适合进入避碰和任务分配。

算法模块

  • 单机器人预积分里程计;
  • 邻居状态及其相关信息维护;
  • 机器人间相对观测;
  • 共享状态交换与被动监听;
  • 共识式分布式滤波;
  • 协方差一致性评估。

传感器、通信与实时性

方法本身不限定某一种里程计,可由 VIO、LIO、轮速—IMU 或其他局部估计器提供预积分增量。系统仍需要机器人间相对观测或共享状态,并假设通信拓扑在一段时间内能够传播必要信息。

论文强调通信效率,但摘要没有给出适用于所有平台的固定带宽或控制频率。实际性能取决于机器人数量、状态维度、通信频率和邻接图密度。相比传输完整点云或图像,预积分里程计和低维状态通常更适合低带宽链路。

工程落地启发

可以将 D-CLIPSE 类模块放在现有单机器人 LIO/VIO 之上:

  1. 每台机器人独立维持高频本地状态,断网时仍能运行;
  2. 只交换时间段预积分、协方差、关键状态和相对观测;
  3. 对消息附加机器人 ID、时间范围、序列号和状态版本;
  4. 丢包时不阻塞本地传播,恢复通信后再处理有效时间窗;
  5. 全局地图融合与紧急避碰继续独立,不让单次邻居更新直接重写局部安全地图。

风险与可复现性

真实无线网络会出现乱序、重传、长尾延迟和时钟漂移,论文中的一致性结论不能自动覆盖这些故障。若相对观测来自视觉或点云匹配,还需要处理错误闭环和重复场景。当前论文页面没有提供明显的完整代码仓库,工程团队需要自行实现或等待作者开放。

2. ROP-RAS3:用快速状态采样生成宏动作,把在线 POMDP 推到 3000 步前视

ROP-RAS3 的完整名称是 Reference-Based Online POMDP Planning via Rapid State Space Sampling。POMDP 能统一描述状态不确定性、观测不确定性和动作后果,但在线求解时动作空间和信念树会快速爆炸,因此传统方法通常只能处理较短规划时域。

ROP-RAS3 使用极快的采样式运动规划,在状态空间中在线生成一组多样化宏动作,再利用这些动作引导信念空间采样,而不是枚举全部低层控制序列。其收敛速度主要与采样动作数量相关,而不直接取决于完整动作空间大小。

论文在最长 3000 步前视、最高 35 维状态空间的任务上评估,状态、动作与观测可以是连续、离散或混合形式,并提供了实体机器人演示和公开代码。

为什么重要

机器人在迷宫搜索、狭窄空间穿越、长期探索或动态目标跟踪中,真正困难的是当前观测不足以确定世界状态。普通 MPC 通常围绕单一状态估计进行短时优化,而 POMDP 会显式考虑“执行动作后能获得什么信息”。

ROP-RAS3 的关键并不是把低层控制器一次规划 3000 个控制周期,而是用宏动作压缩决策树,例如“沿左侧通道探索到下一个可观测点”“后退到宽阔区域重新定位”或“绕到目标另一侧获取视角”。

算法模块

  • 状态与信念表示;
  • 快速采样式状态空间探索;
  • 多样化宏动作生成;
  • 参考解或参考策略;
  • 宏动作引导的信念树搜索;
  • 在线重规划与观测更新。

实时性与可复现性

代码已经公开,适合从论文示例开始复现。其在线速度来自减少动作分支,而不是消除 POMDP 计算。实际机器人能否实时运行,仍取决于状态转移、观测模型和碰撞检测成本。复杂三维点云环境若每个候选都调用昂贵仿真,规划速度仍可能不足。

工程落地启发

对楼梯机器狗或窄通道无人机,可采用两级规划:

  • ROP-RAS3 负责选择探索、绕行、回退、重新观察和阶段目标;
  • 局部 MPC、轨迹优化器或厂商控制器负责几秒内的可执行轨迹;
  • SLAM 输出信念或多假设位置,而不是只给单个位姿;
  • 宏动作必须包含终止条件、超时、可观测性收益和安全回退;
  • 任何宏动作在执行前仍需经过局部地图和动力学约束检查。

风险

参考式近似解不一定等于全局最优 POMDP 解。宏动作集合如果遗漏关键恢复行为,规划器会在一个看似很深、实际不完整的搜索空间中做决定。实体部署时还需要对模型失配、地图变化和传感器故障设置保守分支。

3. XS-VLA:把大模型的空间知识蒸馏给 0.25B 模型,再用潜在 Flow Matching 生成动作

XS-VLA 针对轻量 VLA 的“空间盲区”。大型视觉语言模型具备较强的空间理解与指代能力,但难以高频部署;小模型推理快,却经常不能稳定理解物体相对位置、接近方向和操作关系。

该方法分为两个阶段。第一阶段把 Qwen3-VL-4B 的粗粒度空间语义蒸馏到 SmolVLM2-0.25B,使轻量骨干先具备基本空间表征。第二阶段用该骨干条件化潜在 Flow Matching 策略,并结合 CVAE 对多模态动作分布建模,避免把同一任务的多种合理演示强行平均成单一路径。

在 LIBERO 上,XS-VLA 相比 SmolVLA 0.25B 平均成功率最高提高 7.2 个百分点,其中 LIBERO-Long 提高 23 个百分点,并超过参数量约 2.2B 的普通 SmolVLA;相对之前的轻量 Flow Matching 策略,任务执行速度提高约 3.2 倍。

为什么重要

边缘部署并不是简单量化一个大型 VLA。小模型失败往往源于能力结构不完整,而不是只有精度下降。若模型不知道“杯子在盘子左后方”“抓手应从把手外侧接近”,再快的动作头也无法弥补空间表征错误。

XS-VLA 提供了更实际的压缩路线:先蒸馏与控制直接相关的空间能力,再训练动作生成,而不是复制教师模型的全部语言知识。

算法模块

  • 大型视觉语言教师;
  • 粗粒度空间描述数据;
  • 0.25B 视觉语言学生骨干;
  • CVAE 潜在动作表示;
  • Flow Matching 动作生成;
  • 多种合理演示的分布建模。

适合谁关注

适合希望将 VLA 部署到单卡工作站、边缘 GPU 或成本受限机器人上的团队,也适合作为机器人基础模型的中层策略,而不是直接接管关节力矩。

工程落地启发

  • 先建立与自身任务相关的空间描述数据,而不是蒸馏通用对话能力;
  • 对抓取、插接和移动导航分别定义空间词汇与坐标关系;
  • 动作头输出短 action chunk 或局部轨迹;
  • 底层阻抗控制、MPC、碰撞检测和限位继续独立;
  • 在 Jetson 或目标设备上测端到端延迟,而不只引用 RTX 4090 上的网络前向时间。

可复现性与风险

论文公开了模型结构和基准结果,但本次核验未发现完整、成熟的一键部署仓库。LIBERO 成功率不能代表真实相机噪声、动态障碍和接触误差。空间蒸馏数据如果过于模板化,也可能让模型只记住语言模式而没有真正形成几何能力。

4. HandITL:人类接管时不再让灵巧手姿态突然跳变

Hand-in-the-Loop 面向双臂灵巧操作中的人机干预。传统交互式模仿学习在机器人出错时由人类直接接管,但高自由度机械手的遥操作命令与当前策略状态往往不一致,接管瞬间会出现明显的手型跳变,导致物体掉落或接触状态破坏。

HandITL 不直接把控制权从策略硬切换给人,而是将人的纠正意图与自主策略平滑混合,使机器人逐渐进入人工期望的动作。论文报告,与直接遥操作接管相比,接管抖动降低 99.8%,抓取失败降低 87.5%,平均任务时间降低 19.1%。使用这些干预数据重新训练策略后,在三项长时域灵巧任务上平均提高 19%。

为什么重要

真实机器人数据闭环的瓶颈不是收集成功演示,而是如何高效收集失败附近的纠正数据。人工重新从任务起点演示,成本高且大量数据与当前策略已经掌握的部分重复;直接接管又会引入不连续动作和非自然状态。

平滑干预可以保留策略已经完成的前半段,只采集真正需要纠正的局部片段,并把“人为什么接管、接管后如何恢复”变成训练数据。

算法与系统模块

  • 自主 VLA 或模仿学习策略;
  • 人类手臂与手部遥操作输入;
  • 自主动作和人工纠正的连续混合;
  • 接管与归还控制权状态机;
  • 干预轨迹记录;
  • 基于纠正数据的策略再训练。

工程落地启发

该思路也适用于无人机和机器狗:

  • 人类接管时不要直接覆盖当前速度或姿态命令;
  • 先根据风险设置混合权重和过渡时间;
  • 记录接管前观察、策略动作、人工纠正和恢复结果;
  • 将首次偏离点作为重点训练样本;
  • 安全急停属于独立通道,不能为了平滑而延迟。

风险

动作混合只在两个命令都相对合理时有效。若自主策略已经发出危险动作,继续混合可能延迟人工控制;若人工输入噪声大,也会污染数据。必须区分“纠正模式”和“紧急接管模式”,后者应立即抢占。

5. Mem-World:用 4D surfel 记忆解决腕部相机遮挡和长期遗忘

动作条件世界模型可以根据当前观察和未来动作生成机器人执行后的视觉结果,用于策略评估、规划和合成训练数据。但在机械臂操作中,腕部相机会快速移动,夹爪和物体又频繁遮挡视野,仅依赖当前帧的模型很容易忘记此前看见的对象,或在长时 rollout 中凭空改变场景。

Mem-World 引入 W-VMem:以腕部视角为中心、由 4D surfel 索引的记忆。每个表面元素不仅保存几何位置和法向,还关联时间及任务相关属性。系统根据未来动作和相机姿态渲染、评分历史 surfel,从过去观察中选择真正与未来视角相关的帧,而不是按固定时间间隔机械抽取历史。

实验显示,Mem-World 相比 Ctrl-World 将世界模型评估结果与真实策略表现之间的 Pearson 相关性提高 14.5%,并利用生成数据将长时域任务成功率从 58% 提高到 72%。

为什么重要

世界模型最危险的错误不是图像模糊,而是场景记忆不一致。杯子被夹爪遮挡后消失、抽屉位置突然变化或操作对象在新视角中重生,都会让基于想象的规划器选择错误动作。

Mem-World 将历史检索从纯时间相似度转为几何可见性问题,更接近三维地图和视频生成的结合。

算法模块

  • 多视角动作条件视频世界模型;
  • 腕部相机位姿与正向运动学;
  • 4D surfel 地图;
  • 历史观察的几何可见性评分;
  • 任务相关表面元素加权;
  • Top-K 历史帧检索;
  • 预测结果回写记忆。

工程落地启发

可以将类似记忆放在 VLA 之外:

  1. 使用 RGB-D 或多视角重建短期对象地图;
  2. 为每个对象保存最近可信观察、可见视角和时间;
  3. 世界模型只检索与候选动作未来视角相关的历史;
  4. 几何地图用于检查对象是否真的存在,而不是完全相信生成图像;
  5. 真实观察与记忆冲突时,优先重新感知并停止长动作块。

实时性与风险

论文中的世界模型训练和生成需要较高 GPU 资源,W-VMem 还依赖深度、相机位姿和表面融合质量。机器人和物体运动会让 surfel 关联失效;预测帧回写记忆也可能积累模型幻觉。生产系统应区分真实观测记忆与生成记忆,并给生成内容更低信任权重。

6. Agentic Harness Engineering + Harness-Bench:模型不是完整 Agent,Harness 才决定执行质量

Agentic Harness Engineering 将 Coding Agent 的 Harness 视为可以持续演化的工程对象。Harness 包括上下文组织、工具定义、中间件、状态管理、长期记忆、失败恢复和验证器,而不是只有一段 system prompt。

AHE 建立三类可观测性:组件可观测性让每个可编辑组件都以文件级形式表示并可回滚;经验可观测性把数百万 token 的轨迹压缩成可逐层查看的证据;决策可观测性要求每次修改先声明预期效果,再由下一轮任务结果验证。十轮演化后,Terminal-Bench 2 的 pass@1 从 69.7% 提升到 77.0%,超过对照中的 Codex-CLI 71.9%;冻结后的 Harness 在其他模型家族上仍带来 5.1–10.1 个百分点提升。消融结果显示,主要收益来自工具、中间件和长期记忆,而不是系统提示词。

Harness-Bench 则提供 106 个离线沙盒任务、八类工作流和 5194 条执行轨迹,在共享任务、预算和超时条件下比较模型—Harness 配对。它不仅检查最终文件,还记录工具轨迹、使用量和验证器结果,揭示“推理听起来合理,但已经脱离工具反馈、工作区状态或输出契约”的执行错位。

为什么重要

同一个模型放入不同 Harness,完成率、成本和安全性可能完全不同。只宣传模型在某个 Agent 上的分数,却不公布工具、权限、上下文、重试和验证协议,很难说明真实能力。

对软件团队而言,继续堆提示词的边际收益正在下降。更值得投资的是:让每个动作可观察、可验证、可回滚,并用真实任务轨迹改进 Harness。

工程落地启发

  • 将提示、工具 schema、中间件、记忆和验证器分别版本化;
  • 每次 Harness 修改记录假设、任务集、成本和结果;
  • 使用固定模型与固定任务集做 A/B 测试;
  • 将最终成功定义为外部验证器通过,而非 Agent 自述;
  • 保存失败轨迹,并按检索错误、工具错误、状态过期、权限错误和验证遗漏分类;
  • 报告“模型 + Harness + 权限 + 预算”组合,而不是只报告模型名称。

适合接入真实研发流程吗

适合,而且比单纯更换模型更值得优先建设。AHE 的自动演化目前仍是研究系统,但三类可观测性可以直接落地。Harness-Bench 的 106 项任务不可能覆盖所有私有仓库,因此企业应从自己的历史 issue、事故和 PR 构造内部任务集。

风险

自动演化 Harness 可能在基准上过拟合,也可能通过放宽权限或减少验证获得表面提升。所有变更必须设置不可修改的安全边界,并由独立指标检查权限、网络访问、测试覆盖和错误恢复,而不能只看任务完成率。

7. 今日平台变化:Copilot 旧计费应用退役,旧 Gemini 型号淘汰,npm 安装默认更保守

GitHub Copilot Billing Preview 应用于 2026 年 8 月 3 日退役。GitHub 建议改用 Billing Settings 中的 AI usage 页面、预算、用户级预算、使用报告和 Billing API。对于运行大量 Coding Agent 的团队,这意味着成本监控不应继续依赖旧应用,而应直接从官方用量与预算接口建立组织级仪表盘。

Gemini 2.5 Pro 和 Gemini 3 Flash 已于 7 月 31 日从全部 GitHub Copilot 体验中淘汰。GitHub 建议分别迁移到受支持的新版本;管理员还需确认替代模型已在 Copilot 模型策略中启用。任何在脚本、策略或评测配置里固定旧模型 ID 的工作流都应尽快检查。

npm v12 已把多项安装期行为改为显式允许:依赖生命周期脚本默认不运行,Git 依赖和远程 URL 依赖默认不解析。GitHub 同时计划在 8 月上旬限制 bypass-2FA Granular Access Token 对敏感账户、包和组织管理操作的访问,并建议自动发布逐步迁移到 OIDC Trusted Publishing 或需要人工批准的 staged publishing。

本次核验的 OpenAI 官方产品页最新主要模型仍是 7 月 9 日发布的 GPT-5.6;Anthropic 官方新闻页也没有显示过去 24 小时发布新的同级通用旗舰模型。因此今天更值得投入的是迁移、权限、成本和供应链治理,而不是再次为了模型名称调整全部 Agent 架构。

为什么重要

Agent 工作流常同时持有代码仓库、包管理器和云服务权限。模型变化通常只影响质量,计费接口、模型 ID、安装脚本和发布令牌变化则可能直接让 CI 失败,或扩大供应链攻击面。

工程落地启发

  • 搜索组织内是否仍调用 Copilot Billing Preview 或旧导出接口;
  • 将 AI 成本按用户、仓库、Agent 类型和任务成功结果关联;
  • 在模型配置中加入可用性检查和明确失败,不要静默换模型;
  • npm 项目升级 v12 前生成并审查允许执行的安装脚本列表;
  • 不让 Coding Agent 自行批准新的依赖安装脚本;
  • 包发布优先使用短期 OIDC 凭据,而不是长期可发布 token;
  • 将模型路由、Harness、权限和供应链策略相互解耦。

风险

更严格的安装默认值可能破坏依赖原生编译或代码生成脚本,迁移前需要在隔离 CI 中验证。自动模型回退可能引入能力、成本和数据处理政策差异,企业环境应由管理员显式批准。

今日结论

今天七项内容共同说明,机器人和 Coding Agent 的可靠性正在从“单个算法更强”转向“系统如何管理不确定性与执行过程”。

D-CLIPSE 不只追求多机器人定位精度,还处理共享信息带来的相关性和一致性;ROP-RAS3 不枚举全部低层动作,而是用宏动作把长期信息采集纳入在线规划;XS-VLA 先补齐轻量模型的空间能力,再生成多模态动作;HandITL 将人工纠正变成连续、安全且可学习的数据;Mem-World 使用几何记忆约束世界模型的长期一致性。

Coding Agent 侧的结论同样明确:模型只负责认知和候选生成,Harness 负责工具、状态、权限、验证和恢复。今天生效或刚刚完成的平台变化进一步说明,模型 ID、计费、依赖安装和发布凭据都必须由外部工程系统治理,而不能依赖 Agent 临场判断。

最值得深入研究或尝试复现的方向

方向一:在丢包与异步时钟环境中复现 D-CLIPSE 式分布式定位

使用两至三台仿真机器人,分别接入 VIO/LIO 预积分和相对位姿观测,对比集中式滤波、简单状态广播和一致性分布式滤波。主动加入 5%–30% 丢包、100–500 毫秒延迟、消息乱序和时钟偏差,重点统计 ATE、NEES、一致性、带宽和断网恢复时间。

方向二:将 ROP-RAS3 作为高层不确定规划器,底层继续使用 MPC 或厂商控制器

选择死胡同、长墙绕行、楼梯平台转向或窄通道重新观察任务。高层只输出有限宏动作,底层负责动力学与碰撞约束。比较普通目标驱动规划、固定恢复状态机和 POMDP 宏动作规划在卡死率、恢复时间、额外路径长度和计算成本上的差异。

方向三:为现有 Coding Agent 建立模型—Harness 配对基准

从真实仓库中选择 30–100 个可重复任务,固定容器、预算、超时和验证器,同时比较不同模型与不同 Harness。除完成率外,记录测试通过、工具循环、无效修改、人工返工、token、费用、权限拒绝和状态过期次数。任何 Harness 变化都必须附带预期结果与回归报告。

参考资料