技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-23
摘要
arXiv Robotics 在 7 月 22 日公开了 39 项新工作,Software Engineering 同日公开了 18 项。本期最值得关注的主线是:建图与规划开始围绕统一的 SDF 表示共同设计;无人机卫星匹配定位已在 Jetson Orin NX 上形成多频融合闭环;足式机器人控制开始从真实数据中学习传统简化模型无法表达的失稳状态;人形操作规划则采用“LLM 提候选、动力学优化验可行性、RL 负责跟踪”的分层结构。
机器人基础模型方向同时出现两条路线:一条把真实交互录像自动转换成可运行物理仿真,另一条通过事件记忆和像素空间动作接口,让世界模型真正服务长程规划和动作评估。AI Coding 侧则进一步证明:需求、设计、代码和测试必须可追踪,工具调用中的实体绑定也必须反复验证,不能简单“第一次确认后永久锁定”。
1. OREN + Bubble★:SDF 地图与无人机规划首次真正围绕同一表示协同设计
《From Distances to Trajectories》提出两部分系统:
OREN:显式八叉树先验与隐式神经残差结合,在线从点云重建可微 Signed Distance Function; Bubble★:利用 SDF 中的障碍距离,在自由空间中扩张最大无碰撞球,并在这些“气泡”构成的图上搜索安全通道。
作者在实体四旋翼上完成未知室内环境实时导航。OREN 的 SDF 估计精度相对基线提高约 22%;Bubble★ 在复杂环境中为约 90 米路径生成通道需要 1–3 秒,而对比方法最高约 10 秒。
为什么重要
传统机器人栈经常出现地图和规划表示割裂:
SLAM 输出点云或占用体素; 规划器再单独构造 ESDF; 距离场更新滞后; 轨迹优化和碰撞检测读取不同地图版本。
OREN-Bubble★ 的关键不是神经 SDF 本身,而是让建图、搜索和轨迹优化共享同一距离表示。SDF 除了告诉规划器“是否碰撞”,还直接提供净空、梯度和安全通道半径。
适合谁关注
适合 MID360 无人机、室内高速飞行、三维窄通道规划,以及已经采用 ESDF、FIESTA、Voxblox 或基于轨迹优化规划器的团队。
工程落地启发
不必立即替换现有地图,可先实现混合版本:
FAST-LIO2 或其他 LIO 继续输出位姿和点云; 局部滑窗构建显式八叉树 SDF; 神经残差只修正体素离散误差和未充分观测区域; 全局搜索输出一串最大安全球; B 样条或多项式优化器在球形通道内生成轨迹; 神经部分超时或不确定时退回显式 SDF。
风险与可复现性
当前 arXiv 页面没有列出公开代码。神经残差如果在遮挡区域错误“补全”自由空间,可能造成危险捷径,因此规划所使用的距离必须采用保守下界,而不能直接采用网络均值。
工程判断:今天最值得跟进的无人机建图—规划工作,建议优先复现 Bubble 图搜索,再考虑加入神经残差。
2. NGPS:卫星图匹配、VIO 与 IMU 的异步多频融合已跑上 Orin NX
NGPS 面向 60–150 米航高的 GPS 拒止无人机,通过下视图像和地理配准卫星图进行绝对定位。系统包含:
根据 RANSAC 内点率、重投影误差和匹配置信度动态调节观测协方差; 使用 VIO 速度预测下一次卫星搜索区域; 时间优先队列按真实时间顺序融合 1–2 Hz 绝对位置、10–20 Hz VIO 和 100–200 Hz IMU; 利用被绝对位置锚定的位姿图生成地理配准 2.5D 正射地图。
五条真实飞行序列上的位置 RMSE 为 2.94 米;在 150 米航高、2 m/s 时最差 ATE 为 6.04 米,相比纯单目 VIO改善约 3.5 倍。系统在 NVIDIA Jetson Orin NX 上实时运行,并已开放部分实现。
为什么重要
这项工作比单纯报告图像—卫星检索 Recall 更接近完整定位系统。它正面处理了三个工程问题:
地图匹配延迟到达; 不同数据源更新频率不同; 错误匹配的可信度差异很大。
尤其是按时间戳重放更新,而不是按消息到达顺序直接融合,对 ROS 2、网络地图服务器和异步视觉模型很有参考价值。
工程落地启发
NGPS 应作为低频全局锚点,而不是局部避障定位源:
VIO/LIO 持续提供高频相对运动; 卫星匹配返回 Top-K 候选和协方差; 多帧、运动方向和重投影共同验证后再写入因子图; 使用 switchable constraint 或 max-mixture; 地图匹配失败时只增大漂移协方差,不阻塞飞行; 米级绝对位置只用于区域导航、返航和地图对齐。
主要风险
卫星图年份、阴影、建筑高度、季节变化和重复道路会影响匹配。2.94 米平均误差仍无法支持降落、穿门或贴近设施作业,必须与局部 LiDAR/视觉感知结合。
工程判断:已具备明确频率、硬件和误差指标,适合做 GPS 拒止全局定位原型。
3. Koopman DCM:从真实机器人数据中学习足式系统的“失稳方向”
传统 Divergent Component of Motion 主要基于线性倒立摆,只描述简化质心动力学。新工作将 DCM 推广为 Koopman 不稳定特征函数:不再重点寻找接近零特征值的慢变量,而是主动寻找大正特征值对应的失稳模态。
作者只使用约一小时真实双足机器人数据学习 Koopman DCM,并报告其改善了参考步态跟踪;学习到的状态还可与 MPC 结合,构造基于状态的可行性约束。
为什么重要
足式机器人的失稳并不总能由质心位置和速度完全解释。关节柔性、足底接触、结构耦合和控制延迟都可能产生简化模型中不存在的发散模态。
该方法不是让神经网络直接输出关节力矩,而是学习一个更有判别力的“离失稳还有多远”的状态表示,再交给 MPC 或安全控制器使用。
适合谁关注
人形、四足、轮足机器人平衡控制,尤其适合希望保留 MPC/WBC 结构、但传统 LIPM/DCM 约束过于粗糙的团队。
工程落地启发
可在不修改底层步态策略的情况下使用:
采集本体状态、接触状态和跟踪误差; 学习少量不稳定 Koopman 特征; 把特征值或其安全边界作为 MPC 约束; 临近失稳边界时降低速度、缩短步幅或切换技能; 网络异常时退回传统 DCM/ZMP 条件; 对上梯、下梯和平台转向分别标定可行域。
主要风险
一小时数据只覆盖特定机器人和动作分布;接触模式、载荷或地形改变后,学到的特征可能失效。部署前必须测试数据域外检测和回退机制。
工程判断:比“纯 RL 替换平衡控制”更稳健,适合作为 MPC 的学习式可行性指标。
4. FARO:LLM 只提出接触计划,嵌套动力学优化负责判定能否执行
FARO 面向人形机器人的 locomotion-manipulation。它把问题拆成三层:
LLM 生成候选接触序列; feasibility-guided tree search 搜索接触组合; 嵌套 kino-dynamic 优化快速检查候选并生成动力学一致轨迹; 最终由 RL 控制器跟踪优化轨迹。
论文报告生成轨迹可用于真实世界 loco-manipulation 场景。
为什么重要
LLM 擅长提出“先扶墙、再跨步、再抓目标”这类语义方案,却不擅长判断:
接触点是否可达; 质心和角动量是否可行; 接触切换时是否失稳; 执行器能否产生所需力矩。
FARO 的架构把 LLM 限制在候选生成层,把可行性判断交给确定性优化器,避免“语义合理但物理不可行”的直接执行。
工程落地启发
这套结构同样适合机器狗技能规划:
Agent 产生“靠近楼梯—对正—进入登梯—平台转向—继续上梯”等候选技能序列; 几何和状态机检查传感器、速度、姿态及模式前置条件; 局部轨迹或 SDK 命令经过可行性筛选; 底层厂商控制器执行; 任何候选不可行时返回上层重规划。
主要风险
LLM 采样会增加搜索分支,错误候选仍可能消耗大量优化时间。RL 跟踪器对轨迹的可执行性也不能替代硬件限制和接触安全检查。
工程判断:这是“LLM + 传统规划 + RL 控制”分工较合理的范例。
5. Agentic Real2Sim:把真实交互视频转换成可运行的物理数字孪生
Agentic Real2Sim 的目标不是普通视觉重建,而是从一段机器人交互录像恢复:
场景和物体几何; 物体姿态及状态; 材质、质量等物理先验; 机器人、相机、物体坐标系; 可在仿真器中重放的轨迹和接触过程。
框架覆盖刚体操作、柔性物体和人形动作,并允许使用开放权重 VLM 驱动 Agent 决策,以较低模型成本获得接近前沿闭源模型的转换成功率。
为什么重要
真正可用于 sim-to-real 的数字孪生,不只是“模型看起来像”:
关节必须正确; 接触面和碰撞体必须合理; 物体质量、摩擦和柔性必须可调; 原始交互需要能够在仿真中重放; 仿真失败必须能反向驱动 Agent 修正资产。
这种流程过去通常需要视觉工程师、3D 美术和仿真工程师手工配合。
工程落地启发
小团队可先实现有限领域版本:
只支持固定机械臂和刚体物体; 视觉 Agent 生成分割、深度、位姿和 mesh; 物理 Agent 从类别库选择质量和摩擦初值; MuJoCo/Isaac 中重放轨迹; 根据接触误差自动调参; 输出可用于策略回放和回归测试的 episode twin。
主要风险
VLM 对质量、摩擦和材料的判断只是先验,不是测量;视觉重建误差会被仿真参数“错误补偿”。所有数字孪生都必须用真实轨迹、接触位置和任务结果进行校准。
工程判断:适合自动生成仿真回归场景,但距离通用、无人值守的 Real2Sim 仍有明显距离。
6. WorldScape Policy 2.0 与 Masked Visual Actions:世界模型开始补“记忆接口”和“动作接口”
WorldScape Policy 2.0:事件级长短期记忆
WorldScape Policy 2.0 将记忆拆成:
短期视觉记忆:保留近期局部交互动态; 全局历史; 当前活跃事件; 事件边界; 由检索历史增强的计划 token。
它还构建了接近 500 万事件片段的 ManipEvent-5M,包含动作轨迹、任务指令、子任务描述、目标图像和视频示范,使模型可由高层文本、细粒度文本、目标图像或视频上下文控制。
Masked Visual Actions:用像素轨迹描述动作
Masked Visual Actions 不要求视频模型直接理解机器人关节向量,而是把动作表达为视频中某个实体的部分可见轨迹:
显示机器人轨迹时,模型预测动作会让世界如何变化; 显示目标物体的期望轨迹时,模型反推机器人应如何行动。
单一模型仅使用约 15 小时真实与仿真掩码样本微调,就能跨场景、跨本体进行前向预测、候选未来排序和逆动作建模。
为什么重要
这两项工作分别解决世界模型的两个根本缺口:
时间接口:模型怎样知道任务进行到哪一步; 动作接口:视频模型怎样接收与视觉世界对齐、但又有物理含义的控制信号。
工程落地启发
短期不应让它们直接进入高频控制,而应作为低频模块:
事件记忆用于判断阶段、遮挡和失败恢复; Masked Visual Actions 用于对少量候选轨迹做未来排序; 最终轨迹仍由碰撞检测、MPC 或 MoveIt 验证; 真实执行后立即用新观测纠正世界模型; 不允许长期依赖模型想象状态。
主要风险
视频预测的外观合理不等于接触动力学正确;事件记忆错误后可能持续影响后续计划。需要真实状态验证、记忆重置和动作安全层。
工程判断:世界模型正在从“生成视频”升级为可操作的规划组件,但现阶段最适合作为候选评估器。
7. AI Coding:需求追踪和实体重新验证,比增加更多 Agent 更重要
TraceDev:建立需求—设计—代码的异构追踪图
TraceDev 使用 Requirement Refiner、Designer、Developer、Tester 和 Validator 五类 Agent。Validator 维护一个连接需求、设计模型和代码产物的追踪图,并把它作为其他 Agent 的结构化上下文。
在两个共 125 个用例的数据集上,其成功率分别达到 53.63% 和 56.82%,相对基线最高提升 186.63% 和 340.80%。
其工程价值不在于“五 Agent”,而在于每段代码和测试必须能回答:它实现、验证了哪条需求。
Binding Drift:不要把第一次解析出的实体永久锁定
多步 Agent 可能第一步选择了正确客户、文件或仓库,后续却悄悄切换到另一个实体。研究发现,自然场景下 18% 的合格工作流出现绑定漂移。
简单的“锁定第一次实体”会让初始错误被完整传播:错误动作从 907 次增加到 2746 次。相反,每个高风险步骤用一个廉价模型重新阅读原始指令进行验证,可将错误动作减少约 79%,接近 Oracle 上限。
LISA:功能 Bug 需要不变量测试,而不只是崩溃测试
LISA 让 LLM 根据 API 语义生成调用序列和程序不变量,再利用 API n-gram 覆盖反馈继续探索。它针对的是“输出看起来正常但语义错误”的功能 Bug,而非只检测崩溃。
工程落地建议
真实 coding agent 工作流应固定保留:
requirement_id → design → source files → tests 追踪; 每次邮件、仓库、分支、文件和环境操作前重新核验实体; 实体记录包含 ID、来源、置信度和原始指令证据; 单元测试之外加入不变量和差分行为测试; Agent 不允许自行删除追踪边或降低验收标准; PR 页面直接展示每条需求对应的代码和测试。
工程判断:Agent 数量不是核心,结构化追踪、实体复核和机器可验证测试才决定真实可靠性。
8. 最新模型与 Copilot:Gemini 3.6 Flash 主攻单位 Agent 任务成本,GitHub 开始按采用阶段统计效果
Google 于 7 月 21 日发布 Gemini 3.6 Flash,同时发布 3.5 Flash-Lite 和 3.5 Flash Cyber。Gemini 3.6 Flash 定位于编码、知识工作和多模态 Agent;官方称其相较 3.5 Flash 平均减少约 17% 输出 token,并减少多步任务中的推理步骤和工具调用。API 定价为每百万 token输入 1.50 美元、输出 7.50 美元。
Gemini 3.6 Flash 已开始进入 GitHub Copilot 的 VS Code、Visual Studio、CLI、Cloud Agent、Copilot App、JetBrains、Xcode 和 Eclipse;Business 与 Enterprise 管理员需要显式启用预览策略。
GitHub 7 月 22 日新增 Copilot impact dashboard,把开发者划分为 Code-first、Agent-first、Multi-agent/Copilot App 和 Passive 四类,并按群体展示人均合并 PR、PR 合并速度、代码行数和六个月趋势。
工程判断
这套 dashboard 比单纯统计“活跃用户数”更进一步,但仍不能直接证明代码质量提升。内部看板还应叠加:
Agent PR 一次通过率; changed-line coverage; 人工返工时间; 回滚和线上缺陷; 每个成功 PR 的完整成本; 不同模型在 C++、前端、测试和文档任务中的效果。
本次核查未发现 7 月 22 日以后需要重新排序的通用旗舰模型发布;当前最值得实测的新模型增量仍是 Gemini 3.6 Flash 的低成本 Agent 路线。
今日结论
今天最明确的工程趋势是:学习模型不再独占最终决策,而是被放在可验证的中间层。
OREN 生成更精确的 SDF,Bubble★ 和轨迹优化器负责可行路径; NGPS 提供低频绝对位置,VIO/IMU 维持高频连续状态; Koopman DCM 学习失稳状态,MPC 保留控制约束; FARO 让 LLM 提议接触计划,动力学优化决定能否执行; Real2Sim Agent 自动准备数字孪生,物理仿真负责重放验证; 世界模型生成记忆和候选未来,传统规划器负责最终安全; Coding Agent 生成代码,追踪图、实体复核和测试决定能否合并。
共同原则是:
模型负责提出更好的候选、测量和先验;几何、动力学、仿真和测试负责判定它们是否可信。
最值得深入研究或尝试复现的 3 个方向
方向一:MID360 无人机的 SDF—安全球规划器
建议优先级最高:
用现有 LIO 构建局部 ESDF/SDF; 从当前位置向目标扩张最大无碰撞球; 在球图上执行 A; 将球序列转成 B 样条安全通道; 比较体素 A、球图和现有局部规划器的碰撞检查次数、耗时及轨迹净空; 后续再加入神经 SDF 残差。
方向二:卫星定位作为 LIO/VIO 的可切换绝对因子
下视图像匹配卫星瓦片; 根据内点率、重投影误差和模型置信度计算协方差; 通过速度预测缩小搜索区域; 按原始时间戳插入因子; 连续多次一致后才启用; 错误匹配时可自动撤销。
方向三:Coding Agent 的需求—代码—测试追踪图
为每个需求建立唯一 ID,并自动维护:
需求条目; 设计决策; 修改文件和函数; 测试及其覆盖代码; 执行证据; 审核和回滚记录。
任何代码无法追溯到需求,或需求没有对应测试时,PR 不允许自动合并。
参考资料
- OREN + Bubble★
- NGPS
- Koopman DCM
- FARO
- Agentic Real2Sim
- WorldScape Policy 2.0 与 Masked Visual Actions
- AI Coding
- 最新模型与 Copilot
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。