技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-11
摘要
arXiv Robotics 在 2026 年 7 月 10 日的新列表中共收录 62 项,其中 26 项为新投稿。今天较有工程价值的主线不是推出另一套通用 LIO 前端,而是:恶劣天气下的雷达全局定位、跨机器人与多会话因子图优化、极端狭窄空间中的 SLAM—规划一体化,以及具备物理先验的强化学习控制。
机器人基础模型方向则出现了两个较明确的落地趋势:一是从通用视频生成模型转向原生 Video-Action 预训练;二是不再要求单个 VLA 包揽全部任务,而是把它作为可重试的接触控制技能,由外层规划器负责语义重定位、失败恢复和长时序编排。
1. RadLoc:毫米波雷达全局定位开始形成完整轻量流水线
RadLoc 面向旋转式成像雷达,覆盖从地点识别到三自由度位姿估计的完整流程。其主要模块包括:
- 使用一维 CA-CFAR 加速雷达预处理;
- 利用近距离回波占主导的特性构建紧凑空间描述子;
- 采用分层、由粗到细的地图检索;
- 使用相位相关方法估计平面位置和航向角。
作者在 5 个数据集、15 条序列上进行了实验,并称其描述子尺寸和检索速度优于所比较的方法。目前论文提供补充材料,但从 arXiv 页面尚无法确认已有完整可编译代码仓库。
为什么重要
雷达全局定位的优势并不只是“不怕黑”。在雨、雾、粉尘、重复走廊、玻璃幕墙或视觉外观发生季节变化的环境中,雷达可以作为 LiDAR、视觉和 GNSS 之外的独立重定位通道。RadLoc 的价值在于没有停留在单独的 place recognition 指标,而是尝试直接输出可接入 SLAM 后端的 3-DoF 位姿。
适合谁关注
适合长期运行的户外机器人、矿山或隧道设备、雨雾环境无人车、多会话建图和需要全天候重定位的系统团队。
工程落地启发
可以将 RadLoc 类模块作为低频绝对观测,而不是替代高频 LIO:
- LIO 或轮速—IMU 前端维持连续里程计;
- 雷达描述子在历史地图中检索候选位置;
- 相位相关输出平面位姿初值;
- 使用几何或因子图一致性检查后再加入全局约束;
- 对相似走廊和道路设置多候选假设,而不是直接采用 Top-1。
主要风险
旋转雷达型号、角分辨率、旁瓣和多径特征差异较大;3-DoF 假设更适合地面平台,坡道、剧烈俯仰或无人机场景需要扩展。此外,雷达回波会受到车辆、金属设施和动态大型目标影响,必须结合时间一致性过滤。
2. DeepCORD:把分布式因子图求解器本身变成可学习模块
DeepCORD 面向多机器人、多会话和大规模地图优化。它将并行加速的黎曼优化器展开为可微迭代,通过自监督策略根据优化阶段和通信状态动态调整求解参数;同时支持同步和异步通信,并不仅局限于传统 SE(3) 位姿图,还实验了 SL(4) 投影子地图对齐。
为什么重要
多机器人 SLAM 的瓶颈经常不是前端缺少特征,而是后端在通信延迟、节点掉线、地图规模扩大后难以稳定收敛。传统方法通常需要人工设置步长、动量、惩罚参数和通信频率,不同数据集或网络状态下容易失效。
DeepCORD 所代表的方向不是“用神经网络替代几何优化”,而是让学习模块负责调整优化器,使几何目标函数和李群结构仍然保留。这种混合架构比端到端预测全局轨迹更适合工程系统。
适合谁关注
多机器人协同建图、无人机集群、跨楼层或跨时间地图合并、云边协同 SLAM,以及希望在断续网络下维护全局一致性的团队。
工程落地启发
较稳妥的实施方式是:
- 保留现有 GTSAM、Ceres 或自研图优化器作为基线;
- 先让学习模块只调整步长、阻尼、通信触发阈值等有限参数;
- 设置目标函数下降、残差上界和回退机制;
- 学习求解器输出异常时,立即切回固定参数配置;
- 使用不同网络丢包率和延迟进行压力测试。
主要风险
学习式求解器的训练分布可能覆盖不了真实部署中的极端图结构;在错误回环大量进入图中时,更快收敛不代表收敛到正确解。目前论文页面也未明确展示成熟开源工程,因此短期更适合做后端研究验证,而不是直接替换生产系统。
3. STEMbot:PIN-SLAM、语义八叉树和流形规划被组合到极狭窄机器人上
STEMbot 是一台用于植物冠层下方巡视的微型攀爬机器人。其感知规划系统组合了:
- 纯几何 PIN-SLAM;
- 语义 OcTree 地图;
- 受植物枝干表面约束的流形 A*;
- 基于射线追踪的目标设定和遮挡区域检查。
硬件实验覆盖直径 7—33 毫米的植物茎干和 4 种植物,其重建结果相对离线摄影测量基线的平均 Chamfer 距离低于 1 厘米。论文已被 IROS 2026 接收,并提供项目页面。
为什么重要
这项工作的价值不只在农业机器人,而在于展示了 SLAM、语义地图和规划如何围绕机器人真实运动流形进行设计。许多系统默认机器人在二维平面或自由三维空间运动,但管道机器人、壁面机器人、线缆机器人和树干攀爬机器人只能在低维曲面上移动。
适合谁关注
管道、罐体、墙面、树干和狭小结构巡检机器人,以及希望实现“建图即规划”的特种机器人团队。
工程落地启发
对受约束表面机器人,建议避免直接套用标准 3D A* 或体素规划:
- 先从几何地图提取可通行表面或骨架;
- 将状态空间限制到曲面流形或图结构上;
- 将语义类别用于判断枝杈、端点、危险区域和可检查目标;
- 局部规划只在受约束状态空间搜索;
- 全局地图保留稀疏骨架,局部地图保留高分辨率几何。
主要风险
柔性植物会因机器人接触而移动,静态世界假设不完全成立;视觉或深度传感器在近距离、重复纹理和严重遮挡下也可能退化。迁移到工业场景时,还需重新处理磁吸、轮滑、接触变形和振动问题。
4. HumoSlope:物理先验正在修正强化学习步态的“奖励投机”
HumoSlope 针对人形机器人在极陡坡面上的运动控制。其两阶段训练包括:
- 在局部斜坡支撑平面上计算自适应 ZMP 正则,而不是继续使用世界水平面;
- 使用 Biomechanical Slope Gait Adapter,根据训练阶段可见的坡度描述动态调节质心高度和下肢协调奖励;
- 上坡时鼓励髋部主导发力,下坡时强调膝关节制动;
- 部署时策略仅依赖本体感知,不需要在线视觉或地形传感器。
作者报告了户外草坡 sim-to-real 实验,机器人可盲走通过最高约 32.1° 的坡面。
为什么重要
普通强化学习奖励在陡坡上很容易找到“低质心、缓慢、屈膝”的投机解:虽然不摔,但能耗、速度和姿态都不理想。HumoSlope 表明,物理稳定性指标和生物力学先验可以用于塑造策略,而不必完全依赖黑盒奖励搜索。
适合谁关注
人形机器人、四足机器人、消防或山地机器狗、强化学习控制和 sim-to-real 团队。
工程落地启发
对四足或机器狗也可以复用这一思路:
- 把支撑面估计纳入稳定性计算;
- 奖励或约束使用局部地形坐标系,而不是固定世界坐标系;
- 训练时允许使用高精度坡度、接触力等 privileged information;
- 部署策略只使用 IMU、关节位置、速度和足端接触;
- 外层安全控制器继续监控姿态角、滑移率和支撑多边形。
主要风险
完全依赖本体感知意味着机器人无法提前看到坡度突变、台阶或空洞;草地测试也不能代表湿滑金属、碎石和松软土壤。实际系统仍应保留地形感知、速度限制和失稳恢复策略。
5. 基于 TTC 的动态避障:预训练视觉模型可以补强传统几何管线,但还不能单独承担安全闭环
该方法仅使用单目 RGB,在运行时不依赖双目或 LiDAR。主要管线为:
- UniDepth 生成单目稠密深度;
- SuperPoint 和 SuperGlue 在长序列中建立关键点对应;
- 根据相机内参和预测深度将特征投影到三维;
- 使用 Bundle Adjustment 优化运动和结构;
- 对各关键点计算碰撞时间 TTC;
- 根据最危险目标选择二维地面运动基元。
在 M3ED 数据上的 TTC 小于 1 秒事件检测中,论文报告精确率 0.49、召回率 0.38;在正确检测到危险的样本中,规避方向正确率为 84%,且 22 个真实障碍物中有 20 个至少被检测到一次。
为什么重要
它展示了一种介于纯传统视觉和端到端策略之间的方案:深度来自预训练模型,但运动估计、TTC 和控制决策仍然可解释,且无需重新训练机器人策略。
适合谁关注
低成本单目机器人、小型无人机、临时部署设备,以及没有足够数据训练端到端避障模型的团队。
工程落地启发
更适合将其用作附加风险检测器:
- LiDAR 或双目继续作为主避障传感器;
- 单目 TTC 用于覆盖细小动态目标和传感器盲区;
- TTC 低于阈值时只触发减速或提高局部规划权重;
- 连续多帧一致后才执行强制急停;
- 记录预测深度方差、光流一致性和 BA 残差作为置信度。
主要风险
0.38 的召回率意味着其还不适合独立承担安全功能。单目深度尺度、动态物体与相机自运动解耦、运动模糊、夜间和强逆光都会显著影响 TTC。论文也未证明实时延迟能够满足高速平台的硬实时要求。
6. LingBot-VA 2.0:机器人世界模型开始从“视频模型改造”转向原生 Video-Action 预训练
LingBot-VA 2.0 的核心判断是:面向数字内容生成训练的视频模型,并不天然适合物理机器人。其设计包含四个重点:
- 使用同时对齐语义与动作的视觉—动作 tokenizer;
- 采用因果预训练,而不是从双向视频模型迁移;
- 使用稀疏 MoE 扩大容量,同时控制推理开销;
- 采用异步闭环推理,在机器人执行当前动作时并行预测未来 latent,并用最新观测重新校准下一轮输出。
论文报告了真实机器人上的少样本泛化结果,但摘要没有给出明确控制频率、硬件配置或开放权重信息。
为什么重要
机器人基础模型正在逐渐承认一个事实:物理控制不是视频生成的附属任务。动作因果性、控制频率、观测延迟和闭环修正必须从预训练阶段就被纳入模型设计。
适合谁关注
机器人基础模型、世界模型、VLA、扩散策略、移动操作和双臂操作团队。
工程落地启发
即使不训练同等规模的模型,也可以吸收其系统设计:
- 把推理和动作执行异步化;
- 每个 action chunk 都用最新观测重新锚定;
- 记录动作执行后的真实状态,训练 forward dynamics;
- 将高层视频或 latent 预测与底层关节控制分离;
- 控制接口优先输出末端位姿、局部轨迹或短 action chunk。
主要风险
摘要中的“实时”缺少可直接比较的频率、显卡和延迟指标;稀疏 MoE 对部署框架、显存调度和算子支持要求较高。没有开放数据、权重和机器人适配代码时,短期复现成本可能很高。
7. Harness VLA:冻结基础模型,由外层 Agent 负责失败恢复和技能编排
Harness VLA 不对基础 VLA 继续微调,而是把冻结的 VLA 包装成可重试的接触丰富操作技能,再与少量解析技能组合。外层记忆增强 Agent 负责:
- 语义重新定位;
- 目标重新绑定;
- 非接触运输和导航;
- VLA 技能重新起始和重试;
- 根据执行日志、成功规则和失败模型判断各技能的可用范围。
论文报告其在 LIBERO-Pro、RoboCasa365 和 RoboTwin C2R 等扰动测试中,相比相关基线有较明显提升。
为什么重要
这与真实工程更接近:VLA 擅长局部视觉—动作映射,但不必负责全局任务规划、异常诊断和所有安全逻辑。将其限制为局部技能,外层用显式状态机、行为树或 Agent 编排,更容易测试和回滚。
适合谁关注
准备把 VLA 接入现有机器人控制栈的团队,以及已经拥有 MoveIt、Nav2、MPC、行为树或任务规划器的系统。
工程落地启发
可以建立三层结构:
- 任务层:LLM、行为树或 PDDL 负责目标分解;
- 技能层:VLA 负责抓取、插入、开门等难以解析建模的短时技能;
- 安全执行层:MoveIt、MPC、WBC、碰撞检测和硬件限位负责动作执行。
每个 VLA 技能必须定义前置条件、超时、成功判据、失败类型和恢复动作。禁止仅凭模型生成的“已成功”文本判断任务完成。
主要风险
外层 Agent 本身也可能错误重试,造成机械磨损或危险接触;技能可用范围学习依赖执行日志质量。真实系统还需加入最大重试次数、接触力限制和人工接管通道。
8. AI Coding 与大模型:Muse Spark 1.1 强调 Agent 编排,GitHub 开始补齐会话和成本治理
Meta 在 7 月 9 日发布 Muse Spark 1.1,并开放 Meta Model API 公测。官方将其定位为面向 Agent 的多模态推理模型,支持一百万 token 上下文、MCP 和自定义工具,并强调并行子 Agent、上下文压缩、计算机操作和复杂代码库任务。其 OpenCode 示例包含自动截图、定位 Web 界面错误、修改代码并验证结果。Meta 同时公布了针对提示注入、不可信数据和开发者提示攻击的安全评估结论,但性能数据主要来自官方评测,仍需等待第三方验证。
GitHub 在 7 月 10 日增加了 Copilot 会话的移动端筛选和排序,可按仓库、Agent、状态及“需要注意”状态管理大量会话;同时新增企业预算 REST API,可一次获取多个用户的用量、额度和覆盖规则。
为什么重要
AI coding 的瓶颈正从“模型会不会写代码”转向:
- 如何同时管理多个 Agent 会话;
- 如何找到等待人工处理或失败的任务;
- 如何限制个人和团队预算;
- 如何记录工具调用和测试结果;
- 如何防止 Agent 在未知仓库中执行恶意脚本。
GitHub 的更新虽然不是模型能力突破,却说明 coding agent 正逐渐成为需要运营、审计和成本管理的研发基础设施。
是否适合接入真实研发流程
Muse Spark 1.1 值得在隔离环境中与现有 Codex、Claude Code 或 Copilot 做小规模 A/B 测试,尤其适合长上下文代码库、前端视觉检查和多 Agent 分工任务。但不建议仅凭官方 benchmark 直接替换主力模型。
推荐治理方式
- 每个 Agent 任务使用独立容器或 worktree;
- 未知仓库默认禁止网络访问和安装脚本;
- shell、文件写入、密钥读取和部署操作分级授权;
- 给每个任务设置 token、费用、时间和子 Agent 数量上限;
- 强制保留补丁、测试日志、截图和工具调用轨迹;
- 只有测试、静态分析、依赖审计和人工复核通过后才能合并。
今日工程判断
今天没有出现一套已经证明可以直接替换 FAST-LIO2、LIO-SAM 或其他成熟 LIO 前端的新系统。更值得关注的是围绕现有定位系统补齐能力:
- 使用雷达提供恶劣天气全局重定位;
- 使用学习增强的几何求解器处理多机器人和多会话优化;
- 针对具体运动流形联合设计地图与规划;
- 使用物理先验限制强化学习控制器;
- 将 VLA 限制为局部技能,由显式规划和安全控制层包裹。
这一判断基于 7 月 10 日 cs.RO 新列表的筛选,不代表不存在尚未进入该列表的项目或代码更新。
值得深入研究或尝试复现的方向
1. 雷达重定位接入现有 LIO 后端
以 RadLoc 的模块结构为参考,先不更换 LIO 前端,只实现:
- 雷达描述子数据库;
- Top-K 候选检索;
- 平面位姿粗估计;
- 与当前 LIO 子地图做一致性验证;
- 通过 switchable constraint 加入因子图。
重点测试雨雾、长走廊、地图陈旧和动态车辆条件下的误回环率。
2. 面向多传感器和多机器人的自适应图优化
在现有 GTSAM 或 Ceres 后端中,先只学习阻尼、步长或通信触发参数,同时保留固定参数回退路径。验证指标不应只看最终 ATE,还应记录收敛时间、通信量、错误回环下的稳定性和异步节点掉线恢复能力。
3. VLA 技能化而非整栈替换
选一个现有机械臂任务,把 VLA 仅用于最难解析的接触阶段,外围使用行为树、视觉检测、MoveIt 和力控。为技能增加成功检测、超时、重试、撤退和人工接管机制,再比较“纯 VLA 端到端”和“VLA 技能 + 传统控制栈”的可靠性与恢复能力。
参考资料
说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。