摘要

过去 24 小时可验证的机器人技术增量,主要来自 arXiv Robotics 在 7 月 15 日公开的 41 项新工作。本期筛选 8 条,优先保留具有明确算法结构、真实性能指标或可复现代码的内容。

今天最值得关注的趋势有四条:

  1. 雷达 SLAM 开始绕过传统离散热力图匹配,直接在可微雷达信号模型上联合优化位姿与地图。
  2. 安全强化学习和扩散规划正在重新引入方向约束、动力学模型、CBF 与显式冲突搜索,避免让神经策略独自承担安全责任。
  3. VLA 端侧部署的关键问题从模型压缩转向“推理期间机器人仍在运动”造成的时序错位。
  4. Coding Agent 的工程重点转向开放 Agent Harness、机器人技能契约和自动化提示注入红队测试,而不是继续只比较代码榜单。

1. DiffRadar:直接在雷达信号域优化位姿和 Gaussian 地图

DiffRadar 是一套仅依赖 FMCW 雷达的实时 SLAM 系统。它不再把雷达数据离散成二维热力图后进行扫描匹配,而是把场景表示为各向异性的 Gaussian primitives,并建立可微雷达前向模型,在 距离—方位角多普勒—方位角空间中渲染预测观测,从而直接联合优化机器人位姿和场景结构。

作者在普通 FMCW 雷达硬件、Radarize 数据集及专门设计的压力测试中验证了该方法。测试覆盖长走廊退化、运动模式切换、动态杂波和长时间回环。论文报告系统维持约 70 FPS,地图一致性提升超过一倍,并在缺少显著几何特征的走廊运动中取得较明显的轨迹误差改善。

为什么重要

传统雷达 SLAM 通常会经历阈值检测、极坐标栅格化、点提取和 ICP/NDT 匹配。每一步都会损失雷达的连续信号结构,也难以正确表达:

  • 一个反射体在多个距离和角度单元中的扩散;
  • 多普勒对自运动和动态目标的约束;
  • 天线方向图、测距不确定性和角分辨率;
  • 走廊中沿主方向运动的几何退化。

DiffRadar 的核心价值是让雷达传感模型本身参与优化,而不是把雷达强行转换成低质量 LiDAR。

适合谁关注

适合雨雾、粉尘、黑暗、玻璃和隐私敏感环境中的移动机器人,也适合已经拥有 FMCW、SDR、雷达信号处理能力,希望进入全天候定位产品的团队。

工程落地启发

可将其作为低成本雷达 SLAM 原型的参考架构:

  • 前端保留 IMU 或轮速预积分,提供短时间运动初值;
  • 地图使用局部 Gaussian 子图,避免全局联合优化过重;
  • 同时利用静态距离—方位图和多普勒观测;
  • 对连续多帧存在非零相对速度的 Gaussian 降权;
  • 回环确认后再进行较大范围的地图优化;
  • 输出轨迹可继续与 LiDAR、RTK 或视觉因子融合。

实时性、可复现性与风险

论文页面尚未给出公开代码。70 FPS 是作者系统指标,迁移到其他雷达时仍需重新建模天线、角分辨率、测距噪声和多普勒特性。最大的工程风险是多径和动态目标被错误吸收到静态 Gaussian 地图中。

工程成熟度:中期值得复现,短期应先验证单帧可微雷达渲染和局部位姿优化。


2. PixelLoop:回环不只修正轨迹,还可以直接改变拓扑规划连通性

PixelLoop 面向纯视觉拓扑导航。传统 SLAM 回环通常是在位姿图中加入边并修正坐标;PixelLoop 则将回环加入密集像素级拓扑,使原本分属不同图像的重叠区域直接形成规划捷径。

系统建立在 MASt3R-Nav 的相对三维拓扑表示上。它使用 SeqVLAD 寻找时间上相距较远的候选序列,再通过 UniFlowMatch 进行双向共视验证,最后在两幅图像的对应三维像素节点间加入零代价连接。

在 73 个仿真起终点任务中,使用 SeqVLAD 与像素回环后,PixelLoop 的成功率达到 68.49%,无回环版本为 35.62%;论文也展示了真实移动机器人部署。项目代码和数据目前仍标记为“即将发布”。

为什么重要

在拓扑导航中,回环的意义不仅是“我回到了以前的位置”,还意味着:

  • 两段独立探索路径可能存在更短连接;
  • 规划代价需要在新连通区域重新传播;
  • 任意像素级起点和终点可以跨越原始示教轨迹;
  • 机器人不必严格沿第一次采集的路径返回。

这比传统 teach-and-repeat 更适合无精确度量地图的室内机器人。

工程落地启发

实际机器人可以采用双层地图:

  • LIO、VIO 或二维 SLAM 继续承担高精度定位和碰撞检测;
  • PixelLoop 类拓扑层记录关键帧、可视连通区域和跨路线捷径;
  • 全局规划先在拓扑图中选路;
  • 局部规划继续使用点云或栅格地图;
  • 像素回环只在几何共视、时间一致和导航可通行性均通过后加入。

这对大楼、地下空间、重复走廊和长期巡检尤其有价值。

主要风险

像素共视不等于物理可通行。玻璃、楼层上下重叠、窄门、临时障碍和相似走廊都可能产生危险捷径。零代价边还可能让单次误回环严重改变全局路径,因此生产系统应设置可撤销边、置信度和多次验证机制。

工程成熟度:架构价值较高,但需等待代码并增加度量几何安全检查。


3. Flatness-Preserving Residual Learning:用不到 30 秒数据补偿无人机编队下洗

紧密四旋翼编队会产生明显的下洗和气动耦合。该工作学习未建模气动力的残差,但对残差结构进行约束,使多机联合动力学仍然保持微分平坦性。

保留平坦性后,系统无需运行复杂 NMPC,而可以使用计算量较低的反馈线性化控制器,并通过学习残差提供前馈气动补偿。硬件实验报告平均轨迹误差相对标称模型下降 31%,效果接近先进 NMPC,但计算量降低约一个数量级。训练数据少于 30 秒,控制周期约为 5 ms

为什么重要

普通残差神经网络虽然能拟合下洗,但可能破坏原系统的可控结构,导致:

  • 控制器无法继续使用解析前馈;
  • 需要在线非线性优化;
  • 网络输出异常时缺少稳定回退;
  • 模型更换后必须重新设计整套控制器。

这项工作的工程思想是:只学习未知物理,但保留已知控制结构。

适合谁关注

适合无人机编队、机体贴近墙面或地面飞行、带吊载无人机,以及需要在飞控算力受限条件下补偿气动误差的团队。

工程落地启发

可以将同一思路扩展到:

  • 无人机桨叶下洗和侧风;
  • 机器狗足端滑移残差;
  • 轮式机器人轮胎侧偏;
  • 机械臂减速器摩擦和柔性;
  • 水下机器人局部流体阻力。

关键不是训练任意黑盒网络,而是限制网络只输出不会破坏原控制器结构的残差项。网络失效时,系统仍能退回标称模型控制。

主要风险

不到 30 秒数据只覆盖实验中的特定编队间距、速度、载荷和桨叶配置。脱离训练范围后,残差补偿可能反而放大误差。生产部署需要输出限幅、置信度判断和标称控制器回退。

工程成熟度:本期控制方向中最具真实硬件价值的工作。


4. ATACOM-DC:只在动作朝危险边界移动时激活安全约束

ATACOM-DC 是对 ATACOM 安全层的方向性扩展。传统安全层通常只根据机器人是否接近约束边界决定介入,容易在机器人已经远离危险时仍持续限制动作,导致学习速度慢、策略过度保守。

ATACOM-DC 同时判断状态与动作的方向:当动作继续逼近约束边界时增强约束;当动作正在离开边界时允许更自由的探索。该安全层可以与现有强化学习算法结合,约束既可以来自系统先验,也可以从数据中学习。作者在多项仿真机器人控制任务中报告了更好的安全—性能折中,并开放了项目材料。

为什么重要

很多 Safe RL 策略失败并不是不安全,而是“安全得什么都做不了”。例如机械臂靠近关节极限后,即便动作方向是返回安全区,传统投影仍可能削弱该动作。

方向约束能够区分:

  • 状态危险且动作更危险;
  • 状态危险但动作正在恢复;
  • 状态安全但动作即将进入危险区;
  • 状态和动作均安全。

工程落地启发

可把这一思想用于 RL、MPC 或 VLA 动作过滤:

  1. 为碰撞距离、倾角、关节极限、接触力等定义约束函数;
  2. 计算动作对约束变化趋势的影响;
  3. 只投影会让安全裕度继续下降的动作;
  4. 允许恢复动作保持较大控制权限;
  5. 约束模型不确定时,切换到保守的全方向限制;
  6. 所有硬件限位仍在独立控制层执行。

主要风险

当前验证以仿真为主。方向判断依赖足够准确的局部动力学或约束梯度,在接触切换、地面滑移和高速碰撞前状态下可能不可靠。它也不能替代急停、力矩限制和硬件安全回路。

工程成熟度:适合先在现有 RL 策略外围实现动作安全投影。


5. MDOC:不依赖示范数据的扩散式多机器人最优控制

Model-Based Diffusion Optimal Control(MDOC)把多机器人连续轨迹规划建模为扩散采样,但不训练模仿数据驱动的 score model,而是直接使用已知动力学和代价函数生成轨迹。

其安全机制由动力学模型、Control Barrier Function 约束投影和 Conflict-Based Search 组合而成:扩散过程生成候选轨迹,CBF 投影保证局部动力学和安全约束,CBS 处理机器人之间的冲突。论文在仿真中报告其在成功率、轨迹平滑度、样本效率和计算时间方面优于所比较的规划器,并输出无碰撞轨迹。

为什么重要

学习式扩散规划器通常存在两个问题:

  • 需要大量专家轨迹;
  • 扩散采样结果不天然满足动力学和硬碰撞约束。

MDOC 的意义是把扩散模型重新变成一种优化采样工具,而不是不可验证的端到端策略。

适合谁关注

适合多机器人仓储、无人机集群、狭窄空间交叉通行和需要生成多种可行轨迹的系统。

工程落地启发

可以把它理解为“随机轨迹优化 + 安全投影 + 显式冲突搜索”:

  • 扩散采样负责探索多峰轨迹空间;
  • 动力学投影消除不可执行轨迹;
  • CBF 负责局部安全修正;
  • CBS 将复杂多机器人联合问题拆成单机器人规划和冲突约束;
  • 最终轨迹仍交给 MPC 或传统跟踪器执行。

在生产系统中,扩散规划可作为传统规划失败后的候选生成器,而不必立即替代现有 CBS、TEB 或 MPC。

主要风险

目前只有仿真验证且未公开成熟代码。CBF 局部可行不代表一定存在全局可行轨迹;机器人密度较高时,CBS 节点数量仍可能快速增长。模型误差、通信延迟和动态障碍也未被完全覆盖。

工程成熟度:研究价值高,短期适合作为离线规划基线。


6. Jetson-PI:解决异步 VLA 推理中的“看到的是过去,执行的是未来”

在 Jetson Orin 等端侧设备上,VLA 一次推理可能需要较长时间。简单异步化可以让机器人在模型推理时继续执行上一段动作,但新推理所依据的图像对应过去状态,等结果生成时机器人已经运动到了新位置。

Jetson-PI 通过 Foresight-Aligned Asynchronous Correction 处理这一错位:

  • 轻量未来修正模块根据当前表示和已提交动作,预测动作执行后的未来环境表示;
  • action expert 直接基于未来时间点生成下一段动作;
  • 置信度调度器动态决定何时调用较慢的 VLM、何时只调用动作专家;
  • 系统层使用 CUDA Graph、GPU 常驻中间缓存和 flow unrolling 降低额外开销。

论文报告,在 Jetson Orin 上相对朴素 PyTorch 推理和 vla.cpp,控制频率分别提高 8.66 倍5.41 倍;在 LIBERO 上,平均成功率相对 VLASH 提高 14.8%。

官方已开放基于 π₀.₅ 的 LIBERO 训练与评估代码,以及单独的 llama.cpp 端侧推理引擎。当前训练配置建议至少 48 GB 显存,仓库仍处于早期阶段。

为什么重要

VLA 端侧部署的真正瓶颈不只是每秒 token 数,而是:

  • 观测、推理和动作执行是否处于同一时间;
  • action chunk 执行期间环境是否发生变化;
  • 什么时候必须重新调用视觉语言主干;
  • 推理抖动是否会造成动作衔接中断;
  • 异步线程是否产生过时动作。

Jetson-PI 针对的是闭环时序问题,而不仅是模型量化。

工程落地启发

即使不使用 π₀.₅,也可以复用其系统架构:

  • 将 VLM 与动作头分成不同频率;
  • 记录正在执行但尚未结束的 committed actions;
  • 利用轻量状态预测器把观测向前对齐;
  • 每个动作块附带过期时间和适用状态区间;
  • 视觉变化超过阈值时立即丢弃旧动作;
  • 底层 MPC、阻抗控制或速度控制继续承担硬约束。

主要风险

主要指标来自 LIBERO,真实机器人演示不足以证明复杂动态环境下的稳定性。未来表示预测错误可能使动作专家基于不存在的场景决策。代码训练成本也不低,现阶段更适合先复现评估和端侧推理,而不是从头训练。

工程成熟度:端侧 VLA 部署方向中非常值得跟进,但必须保留传统控制安全层。


7. Contract-Grounded BT:Coding Agent 通过 MCP 读取机器人技能契约后再生成行为树

该工作提出机器人侧 MCP 服务。Coding Agent 在生成行为树前,先查询一份明确的机器可读契约,内容包含:

  • 机器人可执行的技能库;
  • 每个技能允许的参数;
  • 合法的行为树运算符;
  • 可选的行为树组合模板;
  • 运行时结构和类型限制。

生成结果必须通过机器人运行时验证门,才能执行。作者使用 Sonnet 4.6 和 Gemma4 31B,在 PyRoboSim 的 110 个任务及 Husarion Panther 实体机器人的 14 个任务上测试,结果显示契约约束能带来接近完整的行为树结构验证通过率,并能连接 Agent 不预先了解的 Nav2 栈。

为什么重要

让 LLM 直接生成机器人程序的主要风险不是语法错误,而是它会凭空假设机器人具备某个能力,例如:

  • 调用不存在的抓取或登梯接口;
  • 给速度接口传入错误坐标系;
  • 在未定位时执行导航;
  • 忽略技能的前置条件和退出条件;
  • 生成运行时不支持的行为树节点。

契约机制把“机器人到底能做什么”从提示词中的自然语言说明升级为可验证接口。

工程落地启发

可为现有机器狗或移动机器人构建一个轻量版本:

  • 使用 JSON Schema 描述每个技能的输入、输出、前置条件和超时;
  • MCP 仅暴露查询技能和生成候选计划,不直接开放任意 shell;
  • Agent 生成行为树 XML/JSON;
  • 本地验证器检查节点白名单、参数范围和状态转换;
  • BT 执行器调用 ROS 2 Action、Service 或厂商 SDK;
  • 安全状态机拥有比 BT 更高的优先级,可随时中断。

对于登梯功能,可将“进入登梯模式、检测楼梯、速度控制、台阶计数、平台检测、障碍绕行、退出登梯模式”定义成契约化技能,再让 Agent 负责组合,而不是让 Agent 直接控制 vx/vy/vw

主要风险

契约只能保证调用合法,不能保证任务一定安全或可完成。MCP 返回内容本身也可能被提示注入污染,因此契约应来自签名的本地配置,而不是网页或非可信文档。

工程成熟度:很适合快速工程化,是 Coding Agent 接机器人栈的正确边界设计。


8. AI Coding 与模型动态:Grok Build 开源,GPT-Red 将提示注入红队纳入模型训练

Grok Build 开源 Agent Harness

SpaceXAI 在 7 月 15 日开放了 Grok Build 的编码 Agent 和终端界面源码。开放内容包括 Agent 循环、上下文装配、模型响应解析、工具调度、文件编辑和命令工具、终端 UI,以及 skills、plugins、hooks、MCP server 和 subagent 扩展系统。

它也支持本地优先运行:自行编译后可连接本地推理服务,并通过 config.toml 配置。

这次开源的价值不只在于多了一个终端 Agent,而在于可以直接审计:

  • 上下文如何裁剪和压缩;
  • 工具调用如何授权;
  • 子 Agent 如何继承权限;
  • MCP 内容如何进入提示;
  • hook 在什么阶段运行;
  • diff 和计划审查如何实现。

对于自建 Codex、Claude Code 或 OpenCode 工作流,Grok Build 可作为可阅读的 Harness 参考,不必绑定 Grok 模型。

GPT-Red:自动生成针对 Agent 的提示注入攻击

OpenAI 同日在官方研究中公布 GPT-Red,这是一套通过自博弈强化学习训练的内部自动红队模型。攻击模型与防御模型共同进化,攻击环境覆盖网页、邮件、文件和工具输出中的恶意指令。

OpenAI 报告,在其复现的间接提示注入测试中,GPT-Red 在 84% 的场景中找到有效攻击,而人类红队为 13%;GPT-Red 还被用于攻击真实 Agent 和 Codex CLI 数据外泄任务。生成的攻击样本被用于训练 GPT-5.6,使 GPT-5.6 Sol 在官方最困难的直接提示注入基准上,相对四个月前的生产模型减少约 6 倍失败。以上均为 OpenAI 官方评估,尚需独立第三方验证。

对真实研发流程的启发

Coding Agent 安全测试不应只扫描生成代码,还应主动构造恶意上下文:

  • 在 README、Issue、网页和测试日志中放置伪系统指令;
  • 构造要求上传密钥或执行外部脚本的工具返回;
  • 检查 Agent 是否会把仓库内容错误当成高优先级指令;
  • 对 shell、网络、密钥、部署和外部上传使用独立权限;
  • 日志中记录“哪段上下文触发了哪次工具调用”;
  • 定期用红队任务回归测试不同模型和 Harness 版本。

最新模型判断

本期核查未发现过去 24 小时内新的通用旗舰模型正式发布。主要厂商当前最新的重要发布仍包括 7 月 9 日的 GPT-5.6、7 月 9 日的 Muse Spark 1.1,以及 7 月 8 日的 Grok 4.5。今天的真正增量是 Agent Harness 开放和提示注入安全训练,而不是新的模型代际。

工程成熟度:Grok Build 值得用于 Harness 架构研究;GPT-Red 的方法应转化为企业自己的 Agent 红队测试集。


今日结论

今天的技术主线不是让学习模型接管完整机器人系统,而是重新加强模型与物理、几何、时序和接口约束之间的连接:

  • DiffRadar 把雷达信号模型放回 SLAM 优化;
  • PixelLoop 让回环直接影响规划连通性;
  • 四旋翼残差学习在保留微分平坦性的条件下补偿未知气动;
  • ATACOM-DC 只阻止真正朝危险方向移动的动作;
  • MDOC 用动力学、CBF 和 CBS 约束扩散轨迹;
  • Jetson-PI 修复异步推理造成的观测—执行时序错位;
  • Contract-Grounded BT 用机器人技能契约限制 Coding Agent;
  • GPT-Red 则说明 Agent 安全需要主动生成对抗上下文,而不能只依靠静态规则。

共同工程原则是:

让模型负责搜索、预测和补偿,让确定性的几何、动力学、接口契约和安全状态机负责最终边界。

最值得深入研究或尝试复现的 3 个方向

方向一:微分平坦结构约束下的无人机残差动力学

优先级最高。

先不做多机紧密编队,可以在单机上采集:

  • 不同载荷;
  • 靠墙、贴地和穿门;
  • 不同速度和姿态;
  • 风扇模拟侧风;
  • 标称动力学预测与真实状态之间的残差。

训练轻量残差网络,但限制其输出形式不破坏现有几何控制器或平坦性轨迹生成。比较标称控制、任意残差网络、结构化残差网络和 NMPC 的误差、延迟与失稳率。

方向二:Jetson 上的异步感知—动作时间对齐层

不必先部署完整 VLA,可以先对现有视觉避障或策略网络实现:

  • 推理开始时记录状态时间戳;
  • 记录推理期间已执行的速度或轨迹;
  • 用轻量运动模型预测结果返回时的未来状态;
  • 将网络输出转换到未来状态坐标系;
  • 设置动作过期时间;
  • 图像变化或定位残差过大时丢弃输出。

这一机制同样适合端到端无人机控制、机器狗避障和低频视觉规划。

方向三:机器人技能契约 + MCP + 行为树验证器

为机器人现有 SDK 建立机器可读技能表:

  • 技能名称与版本;
  • 输入参数和单位;
  • 前置状态;
  • 成功、失败和超时条件;
  • 是否允许并行;
  • 可被哪些安全事件中断;
  • 对应 ROS 2 Action、Service 或 SDK 函数。

Coding Agent 只能生成经过 schema 验证的行为树,不能直接执行任意代码。先在仿真和回放环境运行,再连接实体机器人。

主要来源

  • arXiv Robotics 2026 年 7 月 15 日公开批次。
  • DiffRadar。
  • PixelLoop。
  • Flatness-Preserving Residual Learning。
  • ATACOM-DC。
  • Model-Based Diffusion Optimal Control。
  • Jetson-PI 论文与开源仓库。
  • Contract-Grounded Behavior Tree Synthesis。
  • Grok Build 开源与 GPT-Red。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。