技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-19
摘要
本期最值得关注的变化不是新的通用 SLAM 前端,而是定位、规划和机器人基础模型进一步向“可约束、可分层、可部署”演进:
- 多机器人协作开始通过固定长度描述子和事件触发图像传输降低通信量;
- 相机—LiDAR 配准开始把稀疏激光转换成可与图像直接匹配的强度图;
- CBF 正从确定障碍物状态扩展到数量未知、检测不完整的多目标概率信念;
- 四足动态避障开始融合 Velocity Obstacle 几何先验与端到端策略;
- Flow Matching 规划器正在补齐空间等变性、硬约束和推理速度;
- 人形机器人基础控制模型显示出数据、rollout 数量与 Transformer 容量联合扩展的收益;
- 世界模型和接触型 VLA 分别通过单步未来预测与力反馈注入解决推理速度和接触失效;
- Coding Agent 的评估正在从 token 消耗转向“每个成功任务的完整成本”和仓库级实际产出。
1. CERPE:多机器人短暂相遇时,不再持续传输原始图像
CERPE 面向机器人只短暂相遇、视野可能不重叠且通信带宽有限的协同感知场景。每台机器人持续交换固定长度的视觉描述子,只有描述子判断可能存在有效视觉重叠时,才事件触发请求原始图像;暂时没有共视区域时,系统通过带度量尺度的本机运动估计继续传播机器人间相对位姿。论文在仿真和实体机器人上验证了六自由度相对位姿估计。
为什么重要
传统协同 SLAM 往往假设机器人持续联网、共享关键帧或点云,并且能在同一时刻看到共同区域。真实巡检机器人、无人机和机器狗更常见的情况是偶尔擦肩而过,网络只能短时可用。CERPE 的价值是把“是否发送高带宽数据”与“如何估计位姿”分开处理。
工程落地启发
可在现有多机器人 LIO/VIO 中增加三层通信:
- 持续广播时间戳、状态摘要和低维地点描述子;
- 描述子命中后才交换压缩图像或局部特征;
- 完成几何验证后,生成带协方差的机器人间相对位姿因子。
没有共视时,只允许短时间传播相对位姿;随着时间和运动距离增加,应持续放大协方差,避免系统把推算结果当作长期精确约束。
传感器假设与风险
该方法依赖本机里程计具备可靠度量尺度,并需要视觉基础模型能够跨机器人视角产生稳定描述子。相似走廊、不同曝光、鱼眼畸变和时间同步误差均可能触发错误图像请求或错误相对位姿。论文页面目前没有列出公开代码。
工程成熟度:适合作为多机器人 SLAM 的通信前端设计参考,短期不宜直接替换成熟的相对定位模块。
2. Rectified Flow LiDAR Upsampling:先把激光变成“图像”,再做相机—雷达配准
这项工作将稀疏 LiDAR 扫描转换为稠密激光强度图,再使用预训练图像特征匹配器与相机图像建立二维对应,最后通过 PnP-RANSAC 求解六自由度外参。稠密强度图由 Conditional Rectified Flow 生成;预训练阶段只需要自监督图像补全,后续仅使用少量 LiDAR 数据微调,不要求成对的图像—点云数据或真实传感器外参。
在 R3LIVE 数据集上,论文报告平均误差为 4.89° / 1.63 米,单次配准约需 0.68 秒。这一精度不足以直接作为精密在线外参,但对未知初始姿态、跨设备粗标定或为后续几何优化提供初值具有价值。
为什么重要
相机和 LiDAR 的直接特征空间差异很大:图像包含纹理和颜色,点云主要包含几何与反射强度。把激光投影并补全成“成像传感器”输出,可以直接复用成熟的图像匹配基础模型,而不必训练复杂的跨模态特征网络。
工程落地启发
适合构建自动外参恢复管线:
- Rectified Flow 输出稠密 LiDAR 强度图;
- 图像匹配器提供粗对应;
- PnP-RANSAC 生成初始外参;
- 使用边缘、平面或光度—几何联合优化继续精修;
- 将结果与历史标定比较,判断传感器是否发生机械位移。
对于多 MID360、16 线雷达和相机系统,可在机器人静止或低速时后台运行,作为外参健康检查,而不是每帧在线计算。
主要风险
单次 0.68 秒不适合作为高频融合模块;生成式补全还可能产生不存在的强度结构,导致匹配器稳定地匹配错误位置。玻璃、低反射材料、雨雾和不同 LiDAR 强度响应会进一步引入域差异。
工程成熟度:适合粗标定和外参漂移检测,不适合单独承担精密在线标定。
3. Risk-Aware BCBF:障碍物数量未知、观测缺失时仍进行概率安全控制
该工作不假设环境中障碍物数量固定,也不要求感知系统每帧检测到所有目标。系统使用 Random Finite Set 描述未知且随时间变化的多目标集合,再通过 SMC-PHD 粒子滤波器维护多目标概率信念;随后直接基于粒子集合构造非光滑 Belief Control Barrier Function,并给出连续预测阶段和离散观测更新阶段维持安全性的条件。方法已在仿真和真实水下实验中验证。
为什么重要
普通 CBF 通常输入确定的障碍物位置和速度,但真实动态环境存在:
- 行人或车辆漏检;
- 多目标合并与分裂;
- 障碍物数量变化;
- 遮挡后目标暂时消失;
- 目标状态只以概率分布存在。
如果仅对当前检测框构造安全约束,目标一旦短时丢失,安全层就可能错误地认为空间已经空闲。
工程落地启发
可在动态避障栈中分离两层:
- 多目标滤波器维护“可能存在的障碍物信念”;
- CBF/MPC 使用风险分位数或粒子集合,而不是使用单一均值轨迹。
对遮挡区域可保留随时间衰减的目标存在概率;只有概率低于阈值后才逐渐释放安全空间。风险等级还可根据机器人速度、制动距离和目标类别调整。
实时性和风险
粒子数量、目标数量与 CBF 求解规模会共同影响实时性。PHD 滤波器主要估计目标强度分布,并不天然维持稳定的目标身份;在人群交叉、突然加速和严重漏检条件下,安全保证依赖运动模型和概率近似是否足够可信。
工程成熟度:安全控制理论价值较高,适合先在动态障碍仿真中验证,实体系统需要独立急停和保守占用层。
4. VOP-Nav:Velocity Obstacle 不再依赖显式目标检测和轨迹跟踪
VOP-Nav 面向四足机器人在人群中的动态导航。系统使用多帧 LiDAR 数据,由 VOP-Net 隐式编码动态障碍约束并预测基于 Velocity Obstacle 理论的安全速度区域;该预测既作为导航策略的输入,也在训练期间充当奖励信号。系统不需要独立的障碍物检测、身份关联和轨迹预测管线,并已在 Unitree Go2 室内外动态环境中部署。
为什么重要
纯 VO 方法具有明确几何意义,但对目标速度估计错误非常敏感;纯端到端策略不要求显式跟踪,却容易学出保守绕行或在分布外人群中碰撞。VOP-Nav 的思路是让网络学习“安全速度集合”,而不是直接从点云输出最终速度。
工程落地启发
对于只能发送 vx、vy、vw 的机器狗,可以构建类似的中间接口:
- 多帧点云编码动态运动信息;
- 网络输出允许速度区域或风险栅格;
- 传统局部规划器从允许区域内选择最接近目标方向的速度;
- 上层技能或导航 Agent 不能绕过这一速度约束;
- 控制频率下降或点云遮挡严重时,自动缩小允许速度区域。
相比直接让策略输出速度,这种方式更容易加入最大加速度、转弯半径和停止距离等确定性约束。
主要风险
“无需显式跟踪”并不意味着系统真正理解目标未来意图。多帧 LiDAR 在机器人自身剧烈摆动、楼梯运动或传感器遮挡时也可能产生虚假运动。论文摘要没有给出代码、控制频率和具体碰撞率数据。
工程成熟度:架构很适合商用机器狗速度接口,但需要用真实人群、交叉遮挡和急停场景重新训练与验证。
5. BridgeFlow 与 MD-COAS:生成式规划开始补齐等变性和硬约束
BridgeFlow:不使用重型等变网络,也能实现严格 SE(2) 等变
BridgeFlow 先将规划任务变换到以起点、目标或任务为中心的规范坐标系,再使用普通网络执行 Flow Matching,从而在不引入昂贵等变架构的情况下获得严格的平移和旋转等变性。其 Brownian Bridge 先验和最优传输配对用于拉直生成向量场;在密集二维环境和 7 自由度 Franka 任务中,论文报告相对扩散基线最高 15 倍推理加速和约 2 倍有效轨迹率。
MD-COAS:软约束先引导,硬投影最终保证可行
MD-COAS 将基于增广拉格朗日的软约束扩散先验,与 Convex Feasible Set 硬投影组合,并根据扩散阶段自适应调节约束强度。论文在高非凸二维环境和 7 自由度机械臂避障中报告更高的安全率、成功率和更低最终代价。
为什么重要
生成式规划器可以保留多种绕行方案,但长期存在两个问题:
- 旋转或平移场景后需要重新学习;
- 生成结果不天然满足碰撞和动力学硬约束。
BridgeFlow 解决空间泛化和推理速度,MD-COAS 则解决软引导无法完全保证安全的问题。
工程落地启发
更现实的使用方式不是替换现有规划器,而是:
- Flow/Diffusion 模型批量生成少量多样候选;
- 解析碰撞检测和动力学约束筛选;
- TrajOpt、CFS 或 MPC 进行最后精修;
- 所有候选均不可行时退回 RRT、A* 或安全停车。
任务规范化也很值得单独复用:将局部地图、起点和目标统一变换到机器人任务坐标系,可以显著减少网络需要学习的旋转和平移变化。
主要风险
论文测试主要集中于仿真和机械臂基准,尚未证明在动态障碍、感知噪声或严格实时机器人上优于经过优化的传统规划器。页面也未列出成熟公开代码。
工程成熟度:适合作为传统规划失败时的候选生成器,暂不宜直接成为唯一安全规划器。
6. Humanoid Behavior Foundation Model:控制能力的扩展依赖数据、rollout 与模型共同增长
这项人形 Behavior Foundation Model 工作将各种控制任务统一为全局坐标系中的全身运动重现问题,并研究参考动作多样性、on-policy rollout 数量与模型容量之间的配合关系。其 Humanoid Transformer 在仿真和实体部署中,将测试集 MPKPE 相对已有控制器降低超过 10%(local mode)和 82%(global mode)。
为什么重要
机器人控制模型并非只靠增加 Transformer 参数就能扩展。论文给出的核心判断是:
- 参考动作必须足够多样;
- on-policy rollout 必须覆盖模型实际产生的状态;
- 网络结构必须能表达步态、姿态和全身协调的时序结构;
- 三者缺一,扩大模型容量不一定带来收益。
工程落地启发
即使不做人形机器人,也可把这一训练配方用于机器狗技能模型:
- 汇总平地、斜坡、楼梯、跨越和转向的参考行为;
- 先训练统一动作跟踪策略;
- 大量采集策略自身 rollout,而不是只训练专家轨迹;
- 针对失败状态追加恢复动作;
- 将高层速度或技能命令与低层动作表示分开;
- 部署端保留厂商控制器或安全层。
对于使用厂商登梯模式的轮足机器狗,更现实的目标是训练上层“行为基础模型”选择模式、速度和阶段,而不是接管关节级控制。
主要风险
论文摘要没有公布完整训练数据规模、控制频率、硬件配置和代码入口。实体人形平台的执行器带宽、惯量和跌倒保护与商用机器狗差异很大。
工程成熟度:训练方法论价值高,但复现完整模型的资源与硬件门槛较高。
7. DriftWorld 与 LIFT:世界模型追求单步速度,VLA 则在接触后重新引入力反馈
DriftWorld:未来预测由多步去噪缩短为一次前向推理
DriftWorld 在训练阶段学习动作条件的 drift,推理时无需扩散模型的多次去噪迭代。论文报告未来帧生成达到 30 FPS 以上,平均比扩散世界模型快 17 倍;在 Bridge-V2、RT-1、Language Table、Push-T 和 Robomimic 上用于动作搜索,并可作为离线策略评估器,其 rollout 分数与真实结果的相关性最高达到 0.99。
其工程意义在于可以在一个控制周期内比较更多候选动作,而不是用几秒钟生成一条未来视频。世界模型仍应作为候选排序器,而不能取代碰撞检测和动力学验证。
LIFT:视觉失效后,用六维末端力刷新动作
LIFT 在原有 VLA action expert 旁加入反应式动作专家,通过因果力记忆和零初始化交叉注意力注入最近的六维末端力。系统还使用在线 DAgger 收集人类修正 rollout,以处理策略进入接触后产生的分布偏移。论文在毛巾折叠、书本插入和汉诺塔圆环放置中,报告了比纯视觉后训练更快的学习和更高表现。
为什么重要
视觉在接触阶段经常最不可靠:夹爪和物体互相遮挡,深度误差被放大,毫米级插入偏差难以从 RGB 判断。力反馈并不需要替代 VLA 的语义能力,而应在动作进入接触后,以高频小幅修正原动作。
工程落地启发
推荐的接触型 VLA 架构:
- VLA 低频输出语义动作和短轨迹;
- 六维力或关节力矩以更高频率输入反应式控制器;
- 正常自由空间中,反应式修正接近零;
- 进入接触后,限制速度并启用力记忆;
- 力超过硬阈值时由独立控制器撤退;
- 在线采集修正数据,但不允许机器人无限制自主探索。
主要风险
DriftWorld 的像素预测正确不代表物理预测完全正确;LIFT 则依赖高质量力传感器、标定和人工修正数据。LIFT 页面目前表示代码和数据将公开,但尚不代表已经具备开箱即用工程包。
工程成熟度:DriftWorld 适合动作候选评估;LIFT 的“接触阶段独立力专家”非常适合真实机器人操作系统。
8. AI Coding:评估单位应从 token 转向“成功任务”,并细化到仓库级产出
OpenAI 最新发布的评估框架提出,应将模型价格、计算量、成功率、人工审核、重试和返工全部计入任务总成本,再除以达到质量标准的成功任务数量。OpenAI 官方还报告,GPT-5.6 Sol 在其引用的 DeepSWE v1.1 评测中达到 72.7%,并称估算 API 成本比 Claude Fable 5 低 36.2%;这些数值属于厂商发布结果,仍需使用自己的代码仓库独立验证。
GitHub 在 7 月 17 日将 Copilot 仓库级用量指标正式开放,可分别统计每个仓库中 Coding Agent 创建、合并的 PR,以及 Code Review 审查的 PR 和建议类型;Copilot App 指标也新增活跃用户、会话数、请求数、Prompt 数和输入输出 token。
为什么重要
组织级 token 总量很难判断 Agent 是否真正创造价值。一个仓库可能生成大量请求却没有合并任何 PR,另一个仓库请求较少但完成了高价值迁移任务。
推荐研发指标
每个仓库至少记录:
- Agent 创建的 PR 数;
- 最终合并率;
- 一次通过 CI 的比例;
- 人工修改行数和审核时间;
- 回滚与缺陷逃逸数量;
- 平均重试次数;
- 每个成功 PR 的模型与计算成本;
- 不同模型在 C++、前端、测试和文档任务中的独立成功率。
模型路由应基于这些真实结果,而不是统一使用最强或最便宜模型。低成本模型适合搜索、格式化和批量修改;高能力模型适合复杂重构,但只有在减少重试和人工返工后才可能真正更便宜。
最新模型状态
在本次核查的 OpenAI、Anthropic 和 SpaceXAI 官方渠道中,7 月 18 日至 19 日未见新的通用旗舰模型正式发布;当前较新的主要发布仍包括 GPT-5.6、Claude Sonnet 5 和 7 月 16 日发布的 Grok 4.5。本期真正的新增内容主要是 Agent 经济性和仓库级治理能力,而非新的模型代际。
工程成熟度:仓库级 Agent 指标可立即接入研发看板,但必须与测试质量、缺陷和人工成本关联。
今日结论
本期最明确的工程趋势是:学习模型正在从直接输出最终答案,转向输出可被传统系统验证的中间表示。
- CERPE 输出相对位姿候选和通信触发条件;
- Rectified Flow 输出可匹配的 LiDAR 强度图;
- VOP-Nav 输出安全速度区域,而不是直接完全接管控制;
- BridgeFlow 输出多样轨迹候选,再由硬约束筛选;
- 人形 BFM 提供统一行为表示,但仍需要 rollout 和安全控制;
- DriftWorld 用于快速比较未来,LIFT 负责接触后的局部修正;
- Coding Agent 则必须以通过质量门的 PR,而不是 token 或会话数衡量价值。
这类设计比“一个大模型负责感知、规划和控制全部环节”更容易调试、回滚和安全部署。
最值得深入研究或复现的 3 个方向
方向一:相机—LiDAR 自动外参健康检查
在现有机器人中建立低频后台任务:
- 从 LiDAR 生成强度图;
- 与相机图像建立匹配;
- 求解粗外参;
- 与标定值比较;
- 超过角度或平移阈值时报警;
- 使用传统边缘或平面优化进行二次确认。
重点不是达到毫米级,而是发现传感器被碰撞、支架松动或维修后安装偏移。
方向二:动态人群中的“允许速度区域”控制接口
先不训练完整 VOP-Nav,可使用传统 VO 生成监督数据:
- 输入最近 5–10 帧点云;
- 输出二维允许速度 mask;
- 传统局部规划器从 mask 中选取速度;
- 加入速度、加速度和停止距离硬约束;
- 在遮挡和低控制频率时主动收紧速度区域。
这比让端到端网络直接输出 vx、vy、vw 更适合现有机器狗 SDK。
方向三:建立仓库级 Coding Agent 成本—质量看板
接入 GitHub 指标并补充自有 CI 数据:
- Agent PR 创建与合并;
- CI 首次成功率;
- 人工审核时间;
- 重试、回滚和线上缺陷;
- 模型 token 与 API 费用;
- 每个成功 PR 的总成本。
连续运行两到四周后,再决定哪些任务使用高能力模型、哪些任务使用低成本模型,以及哪些仓库暂时不适合 Agent 自动修改。
主要来源
- arXiv Robotics 最新公开列表。
- CERPE 多机器人相对位姿估计。
- Rectified Flow LiDAR Upsampling 与图像—点云配准。
- Risk-Aware Belief Control Barrier Functions。
- VOP-Nav 四足机器人动态导航。
- BridgeFlow 与 MD-COAS。
- Humanoid Behavior Foundation Model。
- DriftWorld 与 LIFT。
- OpenAI Agent 经济性框架及 GitHub 仓库级 Copilot 指标。
参考资料
- CERPE
- Rectified Flow LiDAR Upsampling
- Risk-Aware BCBF
- VOP-Nav
- BridgeFlow 与 MD-COAS
- Humanoid Behavior Foundation Model
- DriftWorld 与 LIFT
- AI Coding
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。