技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-16
摘要
过去 24 小时可验证的机器人技术增量,主要来自 arXiv Robotics 在 7 月 15 日公开的 41 项新工作。本期筛选 8 条,优先保留具有明确算法结构、真实性能指标或可复现代码的内容。
今天最值得关注的趋势有四条:
- 雷达 SLAM 开始绕过传统离散热力图匹配,直接在可微雷达信号模型上联合优化位姿与地图。
- 安全强化学习和扩散规划正在重新引入方向约束、动力学模型、CBF 与显式冲突搜索,避免让神经策略独自承担安全责任。
- VLA 端侧部署的关键问题从模型压缩转向“推理期间机器人仍在运动”造成的时序错位。
- Coding Agent 的工程重点转向开放 Agent Harness、机器人技能契约和自动化提示注入红队测试,而不是继续只比较代码榜单。
1. DiffRadar:直接在雷达信号域优化位姿和 Gaussian 地图
DiffRadar 是一套仅依赖 FMCW 雷达的实时 SLAM 系统。它不再把雷达数据离散成二维热力图后进行扫描匹配,而是把场景表示为各向异性的 Gaussian primitives,并建立可微雷达前向模型,在 距离—方位角和多普勒—方位角空间中渲染预测观测,从而直接联合优化机器人位姿和场景结构。
作者在普通 FMCW 雷达硬件、Radarize 数据集及专门设计的压力测试中验证了该方法。测试覆盖长走廊退化、运动模式切换、动态杂波和长时间回环。论文报告系统维持约 70 FPS,地图一致性提升超过一倍,并在缺少显著几何特征的走廊运动中取得较明显的轨迹误差改善。
为什么重要
传统雷达 SLAM 通常会经历阈值检测、极坐标栅格化、点提取和 ICP/NDT 匹配。每一步都会损失雷达的连续信号结构,也难以正确表达:
- 一个反射体在多个距离和角度单元中的扩散;
- 多普勒对自运动和动态目标的约束;
- 天线方向图、测距不确定性和角分辨率;
- 走廊中沿主方向运动的几何退化。
DiffRadar 的核心价值是让雷达传感模型本身参与优化,而不是把雷达强行转换成低质量 LiDAR。
适合谁关注
适合雨雾、粉尘、黑暗、玻璃和隐私敏感环境中的移动机器人,也适合已经拥有 FMCW、SDR、雷达信号处理能力,希望进入全天候定位产品的团队。
工程落地启发
可将其作为低成本雷达 SLAM 原型的参考架构:
- 前端保留 IMU 或轮速预积分,提供短时间运动初值;
- 地图使用局部 Gaussian 子图,避免全局联合优化过重;
- 同时利用静态距离—方位图和多普勒观测;
- 对连续多帧存在非零相对速度的 Gaussian 降权;
- 回环确认后再进行较大范围的地图优化;
- 输出轨迹可继续与 LiDAR、RTK 或视觉因子融合。
实时性、可复现性与风险
论文页面尚未给出公开代码。70 FPS 是作者系统指标,迁移到其他雷达时仍需重新建模天线、角分辨率、测距噪声和多普勒特性。最大的工程风险是多径和动态目标被错误吸收到静态 Gaussian 地图中。
工程成熟度:中期值得复现,短期应先验证单帧可微雷达渲染和局部位姿优化。
2. PixelLoop:回环不只修正轨迹,还可以直接改变拓扑规划连通性
PixelLoop 面向纯视觉拓扑导航。传统 SLAM 回环通常是在位姿图中加入边并修正坐标;PixelLoop 则将回环加入密集像素级拓扑,使原本分属不同图像的重叠区域直接形成规划捷径。
系统建立在 MASt3R-Nav 的相对三维拓扑表示上。它使用 SeqVLAD 寻找时间上相距较远的候选序列,再通过 UniFlowMatch 进行双向共视验证,最后在两幅图像的对应三维像素节点间加入零代价连接。
在 73 个仿真起终点任务中,使用 SeqVLAD 与像素回环后,PixelLoop 的成功率达到 68.49%,无回环版本为 35.62%;论文也展示了真实移动机器人部署。项目代码和数据目前仍标记为“即将发布”。
为什么重要
在拓扑导航中,回环的意义不仅是“我回到了以前的位置”,还意味着:
- 两段独立探索路径可能存在更短连接;
- 规划代价需要在新连通区域重新传播;
- 任意像素级起点和终点可以跨越原始示教轨迹;
- 机器人不必严格沿第一次采集的路径返回。
这比传统 teach-and-repeat 更适合无精确度量地图的室内机器人。
工程落地启发
实际机器人可以采用双层地图:
- LIO、VIO 或二维 SLAM 继续承担高精度定位和碰撞检测;
- PixelLoop 类拓扑层记录关键帧、可视连通区域和跨路线捷径;
- 全局规划先在拓扑图中选路;
- 局部规划继续使用点云或栅格地图;
- 像素回环只在几何共视、时间一致和导航可通行性均通过后加入。
这对大楼、地下空间、重复走廊和长期巡检尤其有价值。
主要风险
像素共视不等于物理可通行。玻璃、楼层上下重叠、窄门、临时障碍和相似走廊都可能产生危险捷径。零代价边还可能让单次误回环严重改变全局路径,因此生产系统应设置可撤销边、置信度和多次验证机制。
工程成熟度:架构价值较高,但需等待代码并增加度量几何安全检查。
3. Flatness-Preserving Residual Learning:用不到 30 秒数据补偿无人机编队下洗
紧密四旋翼编队会产生明显的下洗和气动耦合。该工作学习未建模气动力的残差,但对残差结构进行约束,使多机联合动力学仍然保持微分平坦性。
保留平坦性后,系统无需运行复杂 NMPC,而可以使用计算量较低的反馈线性化控制器,并通过学习残差提供前馈气动补偿。硬件实验报告平均轨迹误差相对标称模型下降 31%,效果接近先进 NMPC,但计算量降低约一个数量级。训练数据少于 30 秒,控制周期约为 5 ms。
为什么重要
普通残差神经网络虽然能拟合下洗,但可能破坏原系统的可控结构,导致:
- 控制器无法继续使用解析前馈;
- 需要在线非线性优化;
- 网络输出异常时缺少稳定回退;
- 模型更换后必须重新设计整套控制器。
这项工作的工程思想是:只学习未知物理,但保留已知控制结构。
适合谁关注
适合无人机编队、机体贴近墙面或地面飞行、带吊载无人机,以及需要在飞控算力受限条件下补偿气动误差的团队。
工程落地启发
可以将同一思路扩展到:
- 无人机桨叶下洗和侧风;
- 机器狗足端滑移残差;
- 轮式机器人轮胎侧偏;
- 机械臂减速器摩擦和柔性;
- 水下机器人局部流体阻力。
关键不是训练任意黑盒网络,而是限制网络只输出不会破坏原控制器结构的残差项。网络失效时,系统仍能退回标称模型控制。
主要风险
不到 30 秒数据只覆盖实验中的特定编队间距、速度、载荷和桨叶配置。脱离训练范围后,残差补偿可能反而放大误差。生产部署需要输出限幅、置信度判断和标称控制器回退。
工程成熟度:本期控制方向中最具真实硬件价值的工作。
4. ATACOM-DC:只在动作朝危险边界移动时激活安全约束
ATACOM-DC 是对 ATACOM 安全层的方向性扩展。传统安全层通常只根据机器人是否接近约束边界决定介入,容易在机器人已经远离危险时仍持续限制动作,导致学习速度慢、策略过度保守。
ATACOM-DC 同时判断状态与动作的方向:当动作继续逼近约束边界时增强约束;当动作正在离开边界时允许更自由的探索。该安全层可以与现有强化学习算法结合,约束既可以来自系统先验,也可以从数据中学习。作者在多项仿真机器人控制任务中报告了更好的安全—性能折中,并开放了项目材料。
为什么重要
很多 Safe RL 策略失败并不是不安全,而是“安全得什么都做不了”。例如机械臂靠近关节极限后,即便动作方向是返回安全区,传统投影仍可能削弱该动作。
方向约束能够区分:
- 状态危险且动作更危险;
- 状态危险但动作正在恢复;
- 状态安全但动作即将进入危险区;
- 状态和动作均安全。
工程落地启发
可把这一思想用于 RL、MPC 或 VLA 动作过滤:
- 为碰撞距离、倾角、关节极限、接触力等定义约束函数;
- 计算动作对约束变化趋势的影响;
- 只投影会让安全裕度继续下降的动作;
- 允许恢复动作保持较大控制权限;
- 约束模型不确定时,切换到保守的全方向限制;
- 所有硬件限位仍在独立控制层执行。
主要风险
当前验证以仿真为主。方向判断依赖足够准确的局部动力学或约束梯度,在接触切换、地面滑移和高速碰撞前状态下可能不可靠。它也不能替代急停、力矩限制和硬件安全回路。
工程成熟度:适合先在现有 RL 策略外围实现动作安全投影。
5. MDOC:不依赖示范数据的扩散式多机器人最优控制
Model-Based Diffusion Optimal Control(MDOC)把多机器人连续轨迹规划建模为扩散采样,但不训练模仿数据驱动的 score model,而是直接使用已知动力学和代价函数生成轨迹。
其安全机制由动力学模型、Control Barrier Function 约束投影和 Conflict-Based Search 组合而成:扩散过程生成候选轨迹,CBF 投影保证局部动力学和安全约束,CBS 处理机器人之间的冲突。论文在仿真中报告其在成功率、轨迹平滑度、样本效率和计算时间方面优于所比较的规划器,并输出无碰撞轨迹。
为什么重要
学习式扩散规划器通常存在两个问题:
- 需要大量专家轨迹;
- 扩散采样结果不天然满足动力学和硬碰撞约束。
MDOC 的意义是把扩散模型重新变成一种优化采样工具,而不是不可验证的端到端策略。
适合谁关注
适合多机器人仓储、无人机集群、狭窄空间交叉通行和需要生成多种可行轨迹的系统。
工程落地启发
可以把它理解为“随机轨迹优化 + 安全投影 + 显式冲突搜索”:
- 扩散采样负责探索多峰轨迹空间;
- 动力学投影消除不可执行轨迹;
- CBF 负责局部安全修正;
- CBS 将复杂多机器人联合问题拆成单机器人规划和冲突约束;
- 最终轨迹仍交给 MPC 或传统跟踪器执行。
在生产系统中,扩散规划可作为传统规划失败后的候选生成器,而不必立即替代现有 CBS、TEB 或 MPC。
主要风险
目前只有仿真验证且未公开成熟代码。CBF 局部可行不代表一定存在全局可行轨迹;机器人密度较高时,CBS 节点数量仍可能快速增长。模型误差、通信延迟和动态障碍也未被完全覆盖。
工程成熟度:研究价值高,短期适合作为离线规划基线。
6. Jetson-PI:解决异步 VLA 推理中的“看到的是过去,执行的是未来”
在 Jetson Orin 等端侧设备上,VLA 一次推理可能需要较长时间。简单异步化可以让机器人在模型推理时继续执行上一段动作,但新推理所依据的图像对应过去状态,等结果生成时机器人已经运动到了新位置。
Jetson-PI 通过 Foresight-Aligned Asynchronous Correction 处理这一错位:
- 轻量未来修正模块根据当前表示和已提交动作,预测动作执行后的未来环境表示;
- action expert 直接基于未来时间点生成下一段动作;
- 置信度调度器动态决定何时调用较慢的 VLM、何时只调用动作专家;
- 系统层使用 CUDA Graph、GPU 常驻中间缓存和 flow unrolling 降低额外开销。
论文报告,在 Jetson Orin 上相对朴素 PyTorch 推理和 vla.cpp,控制频率分别提高 8.66 倍和 5.41 倍;在 LIBERO 上,平均成功率相对 VLASH 提高 14.8%。
官方已开放基于 π₀.₅ 的 LIBERO 训练与评估代码,以及单独的 llama.cpp 端侧推理引擎。当前训练配置建议至少 48 GB 显存,仓库仍处于早期阶段。
为什么重要
VLA 端侧部署的真正瓶颈不只是每秒 token 数,而是:
- 观测、推理和动作执行是否处于同一时间;
- action chunk 执行期间环境是否发生变化;
- 什么时候必须重新调用视觉语言主干;
- 推理抖动是否会造成动作衔接中断;
- 异步线程是否产生过时动作。
Jetson-PI 针对的是闭环时序问题,而不仅是模型量化。
工程落地启发
即使不使用 π₀.₅,也可以复用其系统架构:
- 将 VLM 与动作头分成不同频率;
- 记录正在执行但尚未结束的 committed actions;
- 利用轻量状态预测器把观测向前对齐;
- 每个动作块附带过期时间和适用状态区间;
- 视觉变化超过阈值时立即丢弃旧动作;
- 底层 MPC、阻抗控制或速度控制继续承担硬约束。
主要风险
主要指标来自 LIBERO,真实机器人演示不足以证明复杂动态环境下的稳定性。未来表示预测错误可能使动作专家基于不存在的场景决策。代码训练成本也不低,现阶段更适合先复现评估和端侧推理,而不是从头训练。
工程成熟度:端侧 VLA 部署方向中非常值得跟进,但必须保留传统控制安全层。
7. Contract-Grounded BT:Coding Agent 通过 MCP 读取机器人技能契约后再生成行为树
该工作提出机器人侧 MCP 服务。Coding Agent 在生成行为树前,先查询一份明确的机器可读契约,内容包含:
- 机器人可执行的技能库;
- 每个技能允许的参数;
- 合法的行为树运算符;
- 可选的行为树组合模板;
- 运行时结构和类型限制。
生成结果必须通过机器人运行时验证门,才能执行。作者使用 Sonnet 4.6 和 Gemma4 31B,在 PyRoboSim 的 110 个任务及 Husarion Panther 实体机器人的 14 个任务上测试,结果显示契约约束能带来接近完整的行为树结构验证通过率,并能连接 Agent 不预先了解的 Nav2 栈。
为什么重要
让 LLM 直接生成机器人程序的主要风险不是语法错误,而是它会凭空假设机器人具备某个能力,例如:
- 调用不存在的抓取或登梯接口;
- 给速度接口传入错误坐标系;
- 在未定位时执行导航;
- 忽略技能的前置条件和退出条件;
- 生成运行时不支持的行为树节点。
契约机制把“机器人到底能做什么”从提示词中的自然语言说明升级为可验证接口。
工程落地启发
可为现有机器狗或移动机器人构建一个轻量版本:
- 使用 JSON Schema 描述每个技能的输入、输出、前置条件和超时;
- MCP 仅暴露查询技能和生成候选计划,不直接开放任意 shell;
- Agent 生成行为树 XML/JSON;
- 本地验证器检查节点白名单、参数范围和状态转换;
- BT 执行器调用 ROS 2 Action、Service 或厂商 SDK;
- 安全状态机拥有比 BT 更高的优先级,可随时中断。
对于登梯功能,可将“进入登梯模式、检测楼梯、速度控制、台阶计数、平台检测、障碍绕行、退出登梯模式”定义成契约化技能,再让 Agent 负责组合,而不是让 Agent 直接控制 vx/vy/vw。
主要风险
契约只能保证调用合法,不能保证任务一定安全或可完成。MCP 返回内容本身也可能被提示注入污染,因此契约应来自签名的本地配置,而不是网页或非可信文档。
工程成熟度:很适合快速工程化,是 Coding Agent 接机器人栈的正确边界设计。
8. AI Coding 与模型动态:Grok Build 开源,GPT-Red 将提示注入红队纳入模型训练
Grok Build 开源 Agent Harness
SpaceXAI 在 7 月 15 日开放了 Grok Build 的编码 Agent 和终端界面源码。开放内容包括 Agent 循环、上下文装配、模型响应解析、工具调度、文件编辑和命令工具、终端 UI,以及 skills、plugins、hooks、MCP server 和 subagent 扩展系统。
它也支持本地优先运行:自行编译后可连接本地推理服务,并通过 config.toml 配置。
这次开源的价值不只在于多了一个终端 Agent,而在于可以直接审计:
- 上下文如何裁剪和压缩;
- 工具调用如何授权;
- 子 Agent 如何继承权限;
- MCP 内容如何进入提示;
- hook 在什么阶段运行;
- diff 和计划审查如何实现。
对于自建 Codex、Claude Code 或 OpenCode 工作流,Grok Build 可作为可阅读的 Harness 参考,不必绑定 Grok 模型。
GPT-Red:自动生成针对 Agent 的提示注入攻击
OpenAI 同日在官方研究中公布 GPT-Red,这是一套通过自博弈强化学习训练的内部自动红队模型。攻击模型与防御模型共同进化,攻击环境覆盖网页、邮件、文件和工具输出中的恶意指令。
OpenAI 报告,在其复现的间接提示注入测试中,GPT-Red 在 84% 的场景中找到有效攻击,而人类红队为 13%;GPT-Red 还被用于攻击真实 Agent 和 Codex CLI 数据外泄任务。生成的攻击样本被用于训练 GPT-5.6,使 GPT-5.6 Sol 在官方最困难的直接提示注入基准上,相对四个月前的生产模型减少约 6 倍失败。以上均为 OpenAI 官方评估,尚需独立第三方验证。
对真实研发流程的启发
Coding Agent 安全测试不应只扫描生成代码,还应主动构造恶意上下文:
- 在 README、Issue、网页和测试日志中放置伪系统指令;
- 构造要求上传密钥或执行外部脚本的工具返回;
- 检查 Agent 是否会把仓库内容错误当成高优先级指令;
- 对 shell、网络、密钥、部署和外部上传使用独立权限;
- 日志中记录“哪段上下文触发了哪次工具调用”;
- 定期用红队任务回归测试不同模型和 Harness 版本。
最新模型判断
本期核查未发现过去 24 小时内新的通用旗舰模型正式发布。主要厂商当前最新的重要发布仍包括 7 月 9 日的 GPT-5.6、7 月 9 日的 Muse Spark 1.1,以及 7 月 8 日的 Grok 4.5。今天的真正增量是 Agent Harness 开放和提示注入安全训练,而不是新的模型代际。
工程成熟度:Grok Build 值得用于 Harness 架构研究;GPT-Red 的方法应转化为企业自己的 Agent 红队测试集。
今日结论
今天的技术主线不是让学习模型接管完整机器人系统,而是重新加强模型与物理、几何、时序和接口约束之间的连接:
- DiffRadar 把雷达信号模型放回 SLAM 优化;
- PixelLoop 让回环直接影响规划连通性;
- 四旋翼残差学习在保留微分平坦性的条件下补偿未知气动;
- ATACOM-DC 只阻止真正朝危险方向移动的动作;
- MDOC 用动力学、CBF 和 CBS 约束扩散轨迹;
- Jetson-PI 修复异步推理造成的观测—执行时序错位;
- Contract-Grounded BT 用机器人技能契约限制 Coding Agent;
- GPT-Red 则说明 Agent 安全需要主动生成对抗上下文,而不能只依靠静态规则。
共同工程原则是:
让模型负责搜索、预测和补偿,让确定性的几何、动力学、接口契约和安全状态机负责最终边界。
最值得深入研究或尝试复现的 3 个方向
方向一:微分平坦结构约束下的无人机残差动力学
优先级最高。
先不做多机紧密编队,可以在单机上采集:
- 不同载荷;
- 靠墙、贴地和穿门;
- 不同速度和姿态;
- 风扇模拟侧风;
- 标称动力学预测与真实状态之间的残差。
训练轻量残差网络,但限制其输出形式不破坏现有几何控制器或平坦性轨迹生成。比较标称控制、任意残差网络、结构化残差网络和 NMPC 的误差、延迟与失稳率。
方向二:Jetson 上的异步感知—动作时间对齐层
不必先部署完整 VLA,可以先对现有视觉避障或策略网络实现:
- 推理开始时记录状态时间戳;
- 记录推理期间已执行的速度或轨迹;
- 用轻量运动模型预测结果返回时的未来状态;
- 将网络输出转换到未来状态坐标系;
- 设置动作过期时间;
- 图像变化或定位残差过大时丢弃输出。
这一机制同样适合端到端无人机控制、机器狗避障和低频视觉规划。
方向三:机器人技能契约 + MCP + 行为树验证器
为机器人现有 SDK 建立机器可读技能表:
- 技能名称与版本;
- 输入参数和单位;
- 前置状态;
- 成功、失败和超时条件;
- 是否允许并行;
- 可被哪些安全事件中断;
- 对应 ROS 2 Action、Service 或 SDK 函数。
Coding Agent 只能生成经过 schema 验证的行为树,不能直接执行任意代码。先在仿真和回放环境运行,再连接实体机器人。
主要来源
- arXiv Robotics 2026 年 7 月 15 日公开批次。
- DiffRadar。
- PixelLoop。
- Flatness-Preserving Residual Learning。
- ATACOM-DC。
- Model-Based Diffusion Optimal Control。
- Jetson-PI 论文与开源仓库。
- Contract-Grounded Behavior Tree Synthesis。
- Grok Build 开源与 GPT-Red。
参考资料
- DiffRadar
- PixelLoop
- Flatness-Preserving Residual Learning
- ATACOM-DC
- MDOC
- Jetson-PI
- Contract-Grounded BT
- AI Coding 与模型动态
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。