摘要

最新公开的 arXiv Robotics 批次为 2026 年 7 月 17 日,共 58 项;Software Engineering 同日新增 38 项。本期筛选 7 组最有工程价值的动态,优先关注长期地图、轻量三维重建、MPPI、安全强化学习、长上下文机器人策略、实时 VLA,以及 Coding Agent 的供应链安全。

今天的关键判断是:

  1. 长期 SLAM 的重点正在从“每次都重建一张静态地图”,转向维护对象级时间状态,显式表示出现、消失、移动和未知。
  2. Gaussian 地图开始出现真正适合移动平台的轻量几何方案,但仍主要是重建后端,不能替代定位、回环和保守碰撞地图。
  3. MPPI 与 Safe RL 的工程化方向不是扩大网络,而是在线调节采样退火,并在执行层加入确定性的 CBF-QP 安全过滤。
  4. RoboTTT 表明,机器人基础模型可能出现新的 Scaling Law:除了参数、数据和算力,闭环历史长度也会持续提升能力。
  5. VLA 的实时性正在快速改善,但 BadWAM 证明“模型想象的未来合理”不等于实际动作安全。
  6. Coding Agent 最危险的阶段可能不是写代码,而是按照 README、Makefile 或依赖文件执行环境安装。

1. OASIS-Map:长期地图开始显式维护对象的“时间状态”

OASIS-Map 面向机器人重复访问半静态环境时的地图维护问题。传统静态地图很难处理车辆更换、货物移动、设施拆除或新增设备;系统如果直接覆盖旧地图,又会丢失历史信息。

其前端首先使用 RGB-LiDAR 或 RGB-D 构建几何地图和对象地图,后端再在不同访问会话的图像之间建立密集语义对应。低匹配置信度用于定位变化区域,高置信度用于确认持续存在的对象,并在多次访问中保持对象身份一致。系统最终输出二维变化图、时空一致的对象地图,以及标记静态、出现和消失区域的三维变化图。

在停车场车辆替换场景中,论文报告变化检测 F1 为 0.783;在 3RScan 室内数据中,移动对象关联 F1 为 0.667。系统还测试了室外市场的大规模场景变化。

为什么重要

长期运行机器人最需要的往往不是更稠密的地图,而是回答:

  • 这个物体是新出现的,还是以前地图中的同一物体?
  • 原来的障碍物是暂时被遮挡,还是已经消失?
  • 车辆、货箱和设备虽然类别相同,是否发生了替换?
  • 哪些几何可以用于长期定位,哪些只能作为当前会话障碍物?

OASIS-Map 将对象状态区分为 Appear、Disappear、Static、Moved 和 Unknown。其中 Unknown 很重要:物体没有被看到时,不应立即判定它已经消失。

工程落地方式

建议在现有 LIO/VIO 系统之外增加独立的长期地图层:

几何定位层继续保存墙面、立柱和地面等稳定结构,服务 NDT、GICP 或因子图定位。

当前障碍层保存本次会话中检测到的全部障碍,用于局部规划和避障。

对象时间层维护对象 ID、类别、三维包围体、首次和最后观测时间、状态及置信度。

地图更新时不要立即删除旧对象。只有经过多个视角或多次会话确认后,才把对象由 Unknown 更新为 Disappeared。对移动对象则保留历史轨迹,而不是把新旧点云同时合并成“双影”。

传感器与实时性

室外实验使用 RGB-LiDAR,室内实验使用 RGB-D,因此该系统通常应建立在可靠的 VIO、LIO 或多传感器位姿之上。语义对应与跨会话对象关联更适合后台异步运行,不应阻塞高频定位和局部避障。

可复现性与风险

项目页面已经公开,但代码仍标记为 Code Soon。主要风险包括实例分割不稳定、相似对象错误关联、视角遮挡,以及语义基础模型在工业环境中的域偏移。

工程判断

适合用于长期巡检地图和变化检测;不应让对象语义层直接修改底层安全占用地图。


2. G²SR:203 MB 显存的轻量 Gaussian 几何重建后端

G²SR 面向少视角 Gaussian 表面重建。与使用大型 Transformer 直接回归三维 Gaussian 不同,它把问题拆成:

  1. 轻量神经前端在不同图像中检测和追踪二维 Gaussian splat;
  2. 通过跨视角二维对应建立关联;
  3. 解析多视图几何后端将二维 splat 三角化为具有真实尺度的三维 Gaussian。

这种设计将学习模块限制在较难手工建模的二维检测与对应部分,而把三维几何恢复交给解析三角化。

在 ScanNet、Replica 和 DTU 上,作者称其几何精度达到或超过所比较的端到端方案。针对分辨率 384×512 的两视图和三视图输入,处理吞吐量为每秒 69–89 次重建,GPU 显存约 203 MB,比部分端到端方法减少约 5–107 倍。

为什么重要

大多数 3DGS 系统的障碍不是渲染速度,而是:

  • 初始化依赖大量视角;
  • 几何容易产生漂浮物;
  • 模型和中间特征占用大量显存;
  • 与 SLAM、检测和规划共享 GPU 时难以部署。

G²SR 更接近移动机器人所需的轻量后端,尤其适合从相邻关键帧快速生成局部表面。

传感器和算法假设

它需要已经获得位姿的 RGB 图像,因此本身不是 SLAM 前端,也不解决尺度漂移、回环或相机跟踪。输入位姿可以来自 VIO、RGB-D SLAM 或 LIO—相机外参融合。

论文中的“69–89 次每秒”指少视角重建吞吐量,不等同于完整机器人 SLAM 在包含图像采集、位姿估计、回环和地图管理后的系统帧率。

工程落地方式

可以构建如下双地图:

  • FAST-LIO2、LIO-SAM 或 VIO 提供关键帧位姿;
  • 每 2–3 个关键帧运行一次 G²SR 类局部重建;
  • 生成的 Gaussian 用于稠密可视化、表面测量和语义查询;
  • 再将可信表面转换为 TSDF、mesh 或稀疏占用体素;
  • 碰撞检测仍使用保守膨胀后的几何地图;
  • 回环发生后只重建受影响子图,不全局同步更新全部 Gaussian。

局限和风险

该方法目前没有在论文页面提供正式代码。它也没有显式处理动态物体、曝光差异和错误位姿。跨视角对应一旦错误,解析三角化会稳定地生成错误几何,而不是自动修复。

工程判断

适合做轻量局部三维重建后端,但不能替代 SLAM、回环和导航地图。


3. ITAC-MPPI:用重要性权重熵在线调节采样温度

确定性 MPPI 要逐步降低温度参数,才能使采样分布从广泛探索收缩到最优轨迹附近。但固定温度或预设退火曲线无法判断当前采样到底是过散还是已经过早坍缩。

Information-Theoretic Adaptive Cooling 使用重要性权重的 Shannon 熵作为反馈信号:

  • 权重仍较分散时,允许更快推动优化;
  • 少数轨迹权重过度集中时,减缓降温;
  • 利用临界熵阈值形成平滑屏障,防止采样过早退化;
  • 理论上保持向确定性最优解的渐近收敛。

论文在包含非光滑 Signal Temporal Logic 约束的运动规划任务中,报告了比现有退火方案更高的采样效率和更快收敛。

为什么重要

MPPI 的温度经常由工程师凭经验设置。同一参数在不同场景中的表现可能完全不同:

  • 开阔区域需要快速收敛到低代价轨迹;
  • 狭窄通道需要保留多个候选;
  • 障碍物突然出现时需要重新扩大探索;
  • 模型失配时,过度集中的采样会不断重复错误预测。

熵反馈比简单按迭代次数降温更能反映当前 rollout 的实际状态。

工程落地方式

可以在现有 MPPI 中增加三个观测量:

权重熵衡量轨迹权重是否过度集中。

有效样本数 ESS判断多少条 rollout 真正参与了控制更新。

最优与中位代价差判断当前是否已经找到明显优势轨迹。

温度更新应设置上下限和变化速率限制。环境发生突变、轨迹执行残差增大或有效样本数骤降时,可以暂时升高温度重新探索。

实时性和风险

熵计算本身开销很低,主要算力仍来自 rollout。该论文当前以仿真和理论分析为主,没有真实机器人实验,也没有直接解决模型误差、动态障碍预测错误或传感器不确定性。

此外,降低温度得到的只是当前模型和代价函数下的最优解;如果碰撞代价、动力学模型或地图本身错误,优化得更快反而可能更危险。

工程判断

很适合加入现有 MPPI 作为温度自适应模块,但必须与执行残差和安全约束共同使用。


4. Acc-CBF-QP:不重训 RL,也能在执行阶段统一限制位置、速度、力矩和碰撞

Acc-CBF-QP 是一个基于加速度层的 CBF-QP 安全过滤器,可直接包裹已有 RL 或 Safe RL 策略,不需要修改原策略训练过程。

它在同一个二次规划中处理:

  • 关节位置限制;
  • 关节速度限制;
  • 力矩限制;
  • 机器人自碰撞和环境碰撞约束。

系统还提出 TorqueTask 和 Forward Dynamics Task,分别控制安全修正后力矩与原策略力矩的偏差,以及修正后加速度与原策略期望加速度的偏差。

在实体 Unitree H1 上,单独运行 Safe-RL 策略时平均出现 10.04 次约束违反/秒;加入 Acc-CBF-QP 后下降至 0.80 次/秒,减少约 92%。在 Kinova Gen3 实验中,约束违反被完全消除。作者表示完整管线已开源。

为什么重要

Safe RL 的“安全”通常只针对训练时定义的奖励或约束分布。部署后遇到速度指令突变、载荷变化、状态估计噪声或未见姿态时,策略仍可能超过硬件限制。

执行时 QP 的优势在于:

  • 与原策略解耦;
  • 可应用于不同 RL 算法;
  • 约束具有明确物理含义;
  • 正常状态下尽量保持原策略输出;
  • 接近安全边界时才进行最小必要修正。

工程落地启发

对于拥有完整关节控制接口的机器狗或人形机器人,可直接在加速度或力矩层构建安全 QP。

如果只能控制厂商提供的 vx、vy、vw,仍可构建简化版本:

  • 将速度命令转换为受限加速度;
  • 对倾角、停止距离、障碍距离和横向滑移建立 CBF;
  • 在楼梯边缘、转角和障碍物附近限制速度变化率;
  • 当 QP 无可行解时,进入停止或厂商安全模式;
  • 不允许高层 VLA、RL 或行为树绕过这一层。

主要风险

CBF 的安全保证依赖动力学、Jacobian、碰撞距离和控制周期足够准确。接触切换、足端打滑、软体碰撞和执行器延迟可能破坏模型假设。QP 还必须有严格的超时和不可行处理策略,不能因为求解器卡住而阻塞底层控制。

工程判断

本期最值得直接复现的安全控制工作,尤其适合在现有 RL 策略外增加确定性安全层。


5. RoboTTT:将机器人闭环历史扩展到 8K 时间步,且推理成本不随上下文增长

RoboTTT 将 Test-Time Training 引入 VLA。它不保存不断增长的历史 token KV Cache,而是把历史压缩进一组在运行过程中持续更新的 fast weights

每个新观测都会执行一次小规模自监督梯度更新,将当前信息写入 fast weights;随后模型利用更新后的参数生成动作。由于 fast weights 大小固定,历史长度增加不会持续增加推理缓存。

RoboTTT 将视觉—动作上下文扩展到 8K 时间步,约相当于 30 Hz 下 5 分钟历史。训练使用 Sequence Action Forcing 和 Truncated Backpropagation Through Time,使模型在固定显存预算下处理长序列。

在真实双臂装配任务中,论文报告:

  • 相比单步上下文基线,整体表现提升 87%;
  • 完成了基线从未完整完成的五分钟、十阶段装配任务;
  • 8K 上下文模型比同架构 1K 上下文模型高 62%;
  • 可从一条放在上下文中的人类视频模仿未见过的装配配置;
  • 零件被人为移除后,可以根据自身历史返回并重新安装。

为什么重要

当前多数机器人策略仅观察当前帧或少量历史,因此无法可靠判断:

  • 某个动作是否已经执行;
  • 之前抓取失败的原因;
  • 物体被遮挡前的位置;
  • 哪个子任务已经完成;
  • 外界是否改变了机器人刚刚完成的工作。

RoboTTT 表明,闭环历史长度可能成为机器人基础模型新的 Scaling Axis,而不仅仅是增加模型参数。

工程落地启发

生产系统不宜让整个 VLA 在运行时任意修改。更安全的实现是:

  • 仅允许 LoRA、Adapter 或独立 fast-weight 模块更新;
  • 每个任务开始时从可信初始权重重置;
  • 对更新步长、梯度范数和参数漂移设置硬限制;
  • 将 fast weights 与具体任务、机器人和时间戳绑定;
  • 在后台影子模型中验证更新后的策略;
  • 发生异常动作、碰撞或状态冲突时回滚;
  • 安全过滤器始终使用不可在线修改的代码和参数。

可复现性和风险

NVIDIA 已公开项目页面和完整方法说明,但页面当前主要提供论文和演示,没有明显的完整训练代码入口。该方法还引入了新的安全风险:恶意或异常观测可能被持续写入 fast weights,使后续动作逐渐偏离。

工程判断

研究突破性很高,但短期更适合学习其长时记忆结构,不建议直接允许生产机器人在线更新主策略。


6. Reflex + BadWAM:VLA 能跑到 50 Hz,但“想象正确”仍不能证明动作正确

Reflex:流式推理解决 Flow-Matching VLA 的 KV Cache 问题

Flow-Matching VLA 通常需要多轮去噪,而全局 timestep 会使普通 KV Cache 失效。Reflex 将上下文拆成静态区、滑动区和动态区,使视觉感知部分可以增量缓存,而动作去噪部分只更新必要状态。

其主要优化包括:

  • 利用感知编码器不依赖去噪阶段的 Timestep-Invariance;
  • 实现 O(1) 的增量 Cache 更新;
  • 使用 AdaRMSNorm 防止 BF16 在连续推理中数值坍缩;
  • 将视觉编码和动作生成异步流水化;
  • 通过算子融合减少 GPU kernel 开销。

在 LIBERO 和 Kinetix 上,作者报告推理速度提高 2.58 倍,稳定达到 50 Hz,反应延迟最多降低 54%,并已公开代码仓库。

BadWAM:模型可以预测一个合理未来,却执行完全不同的危险动作

BadWAM 研究 World-Action Model 的动作和世界预测分支之间是否真的保持一致。其攻击通过很小的视觉扰动,破坏模型“想象”与“执行”之间的同步关系。

在 Action-Only Attack 下,模型任务成功率从 96.5% 降到 43.1%。更危险的 Imagination-Preserving Attack 可以让模型未来预测仍接近正常结果,但实际动作已经显著偏离。

综合工程判断

Reflex 解决的是性能问题,BadWAM 揭示的是验证问题。即使 VLA 达到 50 Hz,也不能直接进入安全关键控制环;即使其生成的未来视频看起来合理,也不能把该视频当作动作安全证明。

推荐的真实部署结构是:

  1. VLA 输出短 action chunk 或末端轨迹;
  2. 独立动力学模型检查速度、加速度和可执行性;
  3. 碰撞检测、CBF-QP 或 MPC 对轨迹进行硬约束;
  4. 执行过程中比较真实观测与预测未来;
  5. 两者偏差超阈值时立即截断剩余动作;
  6. 对相机噪声、颜色变化、贴纸和小区域扰动做对抗回归测试;
  7. VLA 推理进程无权关闭底层安全层。

风险

Reflex 的 50 Hz 指基准环境中的模型流式推理,不等同于完整实体机器人闭环频率。BadWAM 当前主要是研究性攻击框架,也尚不能证明所有 WAM 都存在相同强度的真实物理攻击面。

工程判断

Reflex 值得用于提升 VLA 推理效率;BadWAM 应直接转化为上线前的鲁棒性测试集。


7. Coding Agent:README 和安装脚本已经成为新的供应链执行入口

最新研究发现,Coding Agent 通常会直接读取 README、requirements、Makefile 等项目文件,并按其中说明安装依赖,却不会系统验证包名、下载源和版本安全性。

攻击者只需修改普通项目说明,即可诱导 Agent:

  • 从不可信 Registry 安装依赖;
  • 安装已知存在漏洞的旧版本;
  • 安装看似合理的错拼包名;
  • 通过 Makefile 或 Setup 步骤执行代码。

研究测试了 5 类攻击、12 个场景和多个生产级 Agent Harness。结果显示,同一模型在一种 Harness 中可以识别攻击,在另一种 Harness 中却会直接安装,说明安全性取决于 模型与 Harness 的组合,不能只看模型能力。

明显的 typosquat 比较容易被发现,但类似 azurecoreazure-core 的分隔符混淆会显著降低检测率。Registry 重定向攻击在 npm 和 Cargo 等生态中也经常被忽略。研究表明,在安装前增加确定性的包名、来源和版本验证,可以关闭大部分攻击入口。

GitHub 7 月 17 日更新带来的新信任边界

GitHub Copilot Code Review 现在可以:

  • 从 PR 的 head branch 读取 AGENTS.mdCLAUDE.mdGEMINI.mdREVIEW.md 等指令;
  • 根据仓库中的 copilot-code-review.yml 执行自定义环境准备步骤;
  • 默认在防火墙后运行,并允许单独配置网络访问;
  • 独立配置 Code Review 与 Cloud Agent 的 Runner。

但 GitHub 同时说明,自托管 Runner 当前不支持该防火墙。

结合安装攻击研究,可以得到一个重要的工程推论:来自 PR 分支的 Agent 指令和 Setup 文件必须与代码同等级审查,不能因其被称为“说明文件”就视为可信。 这并不意味着 GitHub 当前功能存在已证实漏洞,而是说明 Agent 工作流增加了新的供应链信任边界。

推荐的确定性安装门

Agent 不应直接运行 pip installnpm installcargo build 或未知 Makefile。应先经过独立 Wrapper:

  • Registry 必须在白名单;
  • 包名必须与 lockfile 或批准清单一致;
  • 禁止依赖文件临时指定外部源;
  • 新增包必须检查名称相似度和发布者;
  • 安装前查询漏洞和撤回状态;
  • 默认禁用安装脚本、postinstall 和 build hook;
  • 安装阶段不注入生产密钥;
  • 网络访问仅允许指定 Registry;
  • 下载包应固定哈希;
  • 来自外部 PR 的 Agent 只能在一次性容器中运行。

Agent 成本与价值评估

GitHub 同日把 Copilot App 纳入企业 Usage Metrics API,可统计活跃用户、会话数、请求数、Prompt 数和输入输出 token。

OpenAI 在 7 月 17 日发布的评估框架也强调,应衡量“每个成功任务的完整成本”,而不是只比较每 token 价格;完整成本还包括重试、人工审核、返工和失败任务。

因此团队应把 Agent 指标从“用了多少 token”升级为:

  • 一次完成率;
  • 测试通过率;
  • 人工修改时间;
  • 缺陷逃逸率;
  • 失败和循环比例;
  • 每个成功 PR 的完整费用;
  • 因安全审查阻止的危险操作数量。

最新大模型发布状态

在本次核查的主要官方渠道中,过去 24 小时没有出现新的通用旗舰、代码旗舰或端侧模型正式发布。最新主要通用模型仍包括此前发布的 GPT-5.6 系列和 Claude Sonnet 5;本期新增内容主要是工程评估、审查配置和使用量治理,而不是新的模型代际。

工程判断

Coding Agent 已经可以进入日常开发,但环境安装必须从模型自由操作改为确定性策略引擎审批。


今日结论

今天最值得关注的不是某个模型分数刷新,而是机器人和 Agent 系统正在重新建立明确边界。

地图边界: OASIS-Map 将稳定几何、当前障碍物和对象时间状态分开,避免长期地图被动态变化逐渐污染。

学习与几何边界: G²SR 让神经网络负责二维对应,让解析几何负责三维恢复,以更低显存获得度量表面。

策略与安全边界: ITAC 改善 MPPI 的搜索效率,Acc-CBF-QP 则保证无论 RL 策略如何输出,最终命令仍要满足物理约束。

历史与参数边界: RoboTTT 把长历史写进 fast weights,但在线可学习参数必须具备限幅、重置、验证和回滚机制。

想象与执行边界: Reflex 可以提升 VLA 频率,BadWAM 则说明世界预测分支不能替代独立的动作安全检查。

文档与代码边界: 对于 Coding Agent,README、Agent 指令和 Setup 文件已经具有代码执行能力,必须被纳入供应链安全审查。


最值得深入研究或复现的 3 个方向

方向一:在现有长期地图中加入对象时间状态

建议优先级最高。

先不重做 SLAM 前端,在现有点云地图上增加:

  • 对象 ID 和三维包围体;
  • 首次、最后观测时间;
  • Static、Moved、Appeared、Disappeared、Unknown 状态;
  • 多会话对象关联置信度;
  • 当前障碍层与长期定位层分离;
  • 只有经过多次确认的变化才写入长期地图。

可先在停车场、仓库货箱或设备巡检场景验证。

方向二:为现有 RL 或厂商技能控制增加 CBF-QP 外壳

如果拥有完整关节接口,优先复现 Acc-CBF-QP 的位置、速度、力矩和碰撞约束。

如果只有 vx、vy、vw,则实现命令空间版本:

  • 速度和加速度限制;
  • 障碍物停止距离;
  • 楼梯边缘和平台边界;
  • 倾角与侧滑限制;
  • QP 不可行时强制停车;
  • 高频安全层独立于上层 RL、VLA 和行为树运行。

方向三:为 Coding Agent 构建依赖安装代理

拦截所有包管理器和构建工具调用:

  • 解析 Agent 请求安装的包名、版本和源;
  • 与 lockfile、SBOM 和批准清单比较;
  • 检测名称混淆与 Registry 重定向;
  • 禁止未知安装脚本;
  • 在一次性无密钥容器中完成安装;
  • 输出结构化审批结果;
  • Agent 只能使用审核后的安装命令,不能自行绕过。

这项改造与具体模型无关,却能显著降低 Codex、Claude Code、Copilot 或自建 Agent 的供应链风险。

主要来源

  • arXiv Robotics 与 Software Engineering 最新列表。
  • OASIS-Map 论文与项目页面。
  • G²SR。
  • Information-Theoretic Adaptive Cooling for MPPI。
  • Acc-CBF-QP。
  • RoboTTT 论文与 NVIDIA 项目页面。
  • Reflex 与 BadWAM。
  • Coding Agent 安装供应链攻击。
  • GitHub Copilot Code Review 与 Usage Metrics 更新。
  • OpenAI AI 工作评估框架。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。