机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-31

摘要

7 月 30 日,arXiv Robotics 新增 43 项,Software Engineering 新增 33 项。今天没有出现能够直接替代 FAST-LIO2、LIO-SAM 或成熟 VIO 的新通用在线 SLAM,但出现了两条很有工程价值的定位建图路线:VidMap 将视频时间顺序、稠密宽基线匹配、单目度量深度先验和全局 SfM 优化结合,用于任意长、未知内参视频的离线度量重建;Dense Soft Weighting 不再先把毫米波雷达频谱阈值化为稀疏点云,而是连续利用全部距离—多普勒单元,并输出可直接进入惯性后端的速度协方差。

控制方向继续强化“学习产生候选,优化器执行约束”的分层:自适应学习 MPC 并行维护多个目标运动预测器;风险感知规划器用学习网络生成动力学一致轨迹原语,再由概率碰撞评估和 MPC 精化;低成本四足机器人研究则表明,50 毫秒以上执行器延迟必须进入训练状态与模型,否则 sim-to-real 会从普通 MDP 退化为部分可观测控制问题。

机器人基础模型方面,TurboVLA 通过直接的 V + L → A 路径绕开每个控制周期都经过大语言模型的高成本通路,在 RTX 4090 上达到 31.2 毫秒推理和约 0.9 GB 显存;CheckVLA 从执行侧补齐 action chunk 的开环缺陷,用动作条件世界模型检查真实观察是否偏离预期,并按延迟约束重写尚未执行的动作后缀。

AI Coding 侧更值得关注的是工作流,而不是新模型榜单:SpecFirst 要求先形成可验证规格再写代码,VITAL-RAG 按代码对象分配有限上下文,而开源社区研究显示,当前 Coding Agent 几乎不会主动读取 AI 贡献规则,在明确禁止 AI 贡献的仓库中也不会自行拒绝执行。过去 24 小时,OpenAI、Anthropic 和 xAI 官方发布页没有出现新的同级旗舰模型,工程投入应优先放在 Agent Harness、上下文、权限和验证链。

1. VidMap:把视频时序约束和 SfM 全局优化合并,用普通长视频构建度量地图

VidMap 面向任意长、未知相机内参、可能包含剧烈运动与重复纹理的视频。传统在线 SLAM 受因果处理和初始化影响,短暂跟踪失败可能持续污染后续状态;传统 SfM 虽能进行全局初始化与优化,却常忽略视频顺序。VidMap 将时间顺序作为一等约束,同时使用宽基线稠密匹配、时间轨迹回环、单目度量深度先验,以及相机内参与位姿的全局联合优化。

为什么重要

大量机器人、手机和运动相机视频没有可靠标定,也没有 IMU 或轮速。若能从这些视频恢复度量轨迹、相机内参和稀疏地图,就可以把历史巡检录像、室内视频和互联网视频转化为先验地图、导航训练数据或三维重建素材。它不是实时 SLAM 的替代品,更像一个“视频地图编译器”。

算法模块

  • 视频关键帧与时间邻域匹配;
  • 宽基线稠密图像对应;
  • 跨时间轨迹传播与回环约束;
  • 单目度量深度先验;
  • 相机内参与位姿联合估计;
  • 基于 COLMAP 的全局 Bundle Adjustment;
  • 低视差点和不可靠轨迹过滤。

传感器假设与实时性

系统只需要单目视频,不要求已知内参,也不依赖 IMU;但仍假设场景大部分静态,并需要足够视觉重叠。VidMap 是离线系统,不适合承担机器人在线状态估计。官方代码已开放,支持 LaMAR、EuRoC、ETH3D-SLAM 和 CroCoDL 等准备与评测流程;首次运行需下载约 9 GB 模型权重,算力和存储成本明显高于经典 SfM。

工程落地启发

在线端继续运行 VIO/LIO,任务完成后将相机视频交给 VidMap 做全局重建,再把其轨迹和稀疏地图与 LiDAR 地图对齐。对于 RealSense D455、手机或普通巡检相机,可分别测试原始视频、稀疏抽帧视频和带 VIO 初值的视频,比较尺度漂移、回环成功率、地图完整度和运行资源。

风险

离线结果准确不代表可以直接用于安全导航。动态残影、局部折叠、滚动快门和错误尺度都可能进入地图;写入生产地图前,应使用 LiDAR、RTK、已知尺寸或人工控制点独立验证。

2. Dense Soft Weighting:毫米波雷达不再先做硬阈值检测,而是保留全部多普勒运动证据

常见雷达里程计先用 CFAR 将稠密距离—多普勒频谱变成稀疏点云,再从通过阈值的检测点估计平台速度。Dense Soft Weighting 为每个距离—多普勒单元赋予连续置信度,通过确定性的鲁棒加权最小二乘估计自车速度,并从同一组观测闭式计算速度协方差。

为什么重要

相机在黑暗、烟尘、雨雪和低纹理环境中容易退化,LiDAR 也会受到悬浮颗粒和强反射影响,而毫米波雷达可直接测量径向速度。相比重新训练一个平台相关雷达网络,该方法不依赖特定训练数据,输出还包含可解释协方差,便于接入 ESKF、MSCKF 或因子图。

算法模块

  • 稠密距离—多普勒频谱读取;
  • 每个频谱单元的连续置信度映射;
  • 面向异常回波的鲁棒加权最小二乘;
  • 自车速度求解;
  • 基于测量权重的闭式协方差;
  • 与共享惯性后端融合。

实时性与鲁棒性

作者在两个公开数据集和一个自采数据集上,相对使用相同惯性后端的最强 CFAR 点云基线,将平均绝对位姿误差降低 31%–45%,并报告可在嵌入式硬件实时运行。其优势主要来自信息保留和测量建模,而非更大的学习模型。

工程落地启发

可把雷达速度作为独立观测因子加入现有 LIO:IMU 负责高频传播;雷达提供速度约束;LiDAR 退化时提高雷达权重;雷达协方差异常增大时自动降权。对于矿井、烟尘、地下空间和雨雾环境,这也可产品化为独立的“恶劣环境速度传感器”。

风险

多径、金属反射、旋翼或车轮自身运动会产生结构化假回波。连续赋权并不自动解决动态目标问题;部署前应单独测试静止零速、原地旋转、狭窄金属通道、雨雾和多人运动场景。

3. Self-Adaptive Learning MPC:并行学习多个目标预测器,应对结构化、随机和对抗运动

该方法针对未知且会切换的目标动力学,例如移动人员突然改变方向、动态障碍由规则运动变为随机运动,或追逃任务中的对抗轨迹。系统从零开始并行学习多个预测器,通过自监督、单步更新和低计算量在线学习维护模型集合,再根据近期误差选择最符合当前行为的模型,由 MPC 负责追踪、追逐或避碰。

为什么重要

动态目标预测常依赖单一神经网络或固定运动模型。目标模式切换后,单一模型的误差会持续传递到规划器。多预测器和在线选择机制把“当前目标属于哪种运动模式”变成持续更新的问题,比永久信任一个黑盒预测器更适合真实机器人。

理论、实验与实时性

在学习误差和目标动力学切换都不存在时,该方法在期望意义下渐近匹配提前知道目标动力学的非因果最优策略;存在误差或切换时,平均 regret 随平均学习误差和切换次数平滑退化。论文在 Crazyflie 仿真与实体硬件上覆盖结构化、随机和对抗目标轨迹。

工程落地启发

无人机跟随、机器狗动态绕障或移动拍摄系统可同时保留匀速、匀加速、周期运动、神经预测和保守随机游走模型。每个模型输出预测均值和不确定度;MPC 根据近期窗口误差选择或混合模型。当所有模型同时失配时,应扩大安全距离、降速或进入重新观察状态,而不是继续追踪。

风险

多模型预测与 MPC 会增加最坏延迟。理论保证依赖目标切换频率和学习误差等假设,不等于碰撞安全证明;实体部署仍需硬速度限制、控制屏障函数或紧急停止逻辑。

4. 风险感知轨迹原语:学习缩小搜索空间,概率碰撞评估与 MPC 负责最终约束

该工作提出面向城市驾驶的混合规划框架:RBFN 学习 jerk 较小、动力学一致的轨迹原语,解析概率模型计算候选轨迹的碰撞风险,随后由优化器或 MPC 在较小搜索空间内完成精化。相比直接在高维控制空间搜索,候选原语可以降低求解复杂度并保留车辆约束。

为什么重要

纯学习规划器推理快,但难以给出清晰安全边界;纯 MPC 可解释,却容易受候选初值和大搜索空间影响。更可靠的边界是:网络只提供有限、平滑、动力学可行的候选,优化器完成最后选择。

工程落地启发

对无人机,可将车辆原语替换为满足最大速度、加速度、jerk 和推力边界的多项式或 B 样条;对机器狗,可用 SDK 可执行的速度和转向片段作为原语。在线流程为:生成有限候选、按障碍分布计算风险、丢弃不可行项、对最佳候选做短时域优化,求解超时则沿最后可行轨迹减速。

可复现性与风险

论文目前主要是城市驾驶场景评估,未给出公开代码或实体机器人结果。概率安全高度依赖感知协方差是否校准;若系统持续低估误差,风险值会产生虚假安全感。原语库也可能遗漏罕见但必要的恢复动作。

5. 低成本四足强化学习:50 毫秒执行器延迟会把普通 MDP 变成部分可观测问题

该工作在 Mini Pupper 2 等低成本四足平台上测得超过 50 毫秒的控制传输延迟。命令发出后,舵机不会立即到达目标位置;若仿真训练假设动作瞬时生效,部署策略看到的状态与真实执行状态会长期错位。作者引入平均执行器延迟前向模型,并让策略显式感知时间,最终在真实硬件上获得更鲁棒的步态。

为什么重要

低成本机器人常见问题不是动力学模型不够复杂,而是串口、总线、舵机内部控制和状态回传共同产生不可忽略的延迟与抖动。仅使用当前位置和目标动作,无法区分“动作尚未执行”和“动作执行失败”,因此控制过程具有隐藏状态。

实验结果

时间感知网络学习出自维持的周期步态,并对额外增加至 320 毫秒的延迟扰动保持鲁棒。工程上最重要的结论是:策略必须知道命令在时间轴上的执行状态,而不是只看最新传感器值。

工程落地启发

对于只能通过厂商 SDK 发送 vx/vy/vw 或技能命令的轮足机器狗,可维护命令历史、发送时间、估计执行时间和反馈时间;策略输入包含最近若干命令及其年龄。训练中随机化固定延迟、抖动、丢包和速度响应时间,部署时再在线估计延迟。

风险

平均延迟模型无法覆盖重尾抖动、总线拥塞和偶发丢包。320 毫秒鲁棒性来自特定平台与节律任务,不能直接外推至高速转向、跳跃或复杂地形;仍需关节限位、力矩保护和跌倒恢复状态机。

6. TurboVLA:绕过 LLM 中央瓶颈,以 0.2B 参数实现约 32 Hz 视觉语言动作推理

传统 VLA 常采用 视觉 → 大语言模型表示 → 动作 路径,每次控制调用都要让视觉 token 进入大型语言骨干。TurboVLA 改为直接的 V + L → A:视觉与语言分别编码,通过轻量双向交互构造任务条件特征,再由紧凑解码器预测连续 action chunk。

性能与实时性

TurboVLA 在 LIBERO 上使用约 0.2B 参数,平均成功率 97.7%;RTX 4090 上推理延迟 31.2 毫秒,显存约 0.9 GB,对应约 32 Hz。官方仓库已发布训练和评测代码,支持 LIBERO 与 RoboTwin;LIBERO 配方使用两个相机、7 维动作和 12 步 action chunk。

为什么重要

对于真实机器人,VLA 的瓶颈往往不是单次决策能力,而是延迟和显存导致闭环频率过低。将 LLM 从每个控制周期的中央通路移出,可以保留语言任务条件,同时显著降低部署成本。

工程落地启发

可将 TurboVLA 作为中层技能策略:语言描述任务,视觉策略输出短动作块,底层阻抗控制器、MPC 或厂商控制器继续处理关节与碰撞约束。移动机器人可把动作头替换为短时域 vx/vy/vw 或局部轨迹,而不是直接控制电机。

可复现性与风险

代码、训练脚本和评测流程已开放,Apache-2.0 许可便于实验;但模型权重和基准数据需单独准备。32 Hz 只是 RTX 4090 上的模型推理,不代表 Jetson、安卓端或完整机器人系统的端到端频率;LIBERO 高成功率也不代表真实动态环境中的鲁棒性。

7. CheckVLA:动作条件世界模型监控 action chunk,偏离预期时重写剩余动作

VLA 为提高吞吐常一次下发多个动作,但 action chunk 执行期间缺少新的高层反馈。若第一步抓取偏移或底盘被障碍阻挡,剩余动作仍会继续执行。CheckVLA 使用单独训练并冻结的动作条件世界模型预测“执行当前动作后,观察应该如何变化”,再比较真实观察与预期变化。

算法模块

  • 冻结的动作条件世界模型;
  • 真实观察与预测观察偏差;
  • 保形校准风险阈值;
  • 受控的首次干预概率;
  • 根据风险超限程度重写动作后缀;
  • 延迟感知硬前缀,避免替换已经无法取消的动作;
  • 事件驱动关键帧库,保留任务进度证据。

实验结果

在 RoboCasa365 仿真中,在相同训练配方与调用预算下,CheckVLA 平均成功率为 36.1%,周期性重规划为 27.6%。当 episode 级误报目标为 5% 时,动作条件校验及时召回率为 77.9%,高于仅观察异常的 48.6% 和动作打乱对照的 37.9%。

工程落地启发

TurboVLA 与 CheckVLA 可组成双层结构:快速策略高频生成短动作块,校验器检查实际进度;发现偏离后,只替换尚未进入控制器缓冲区的后缀。部署时还必须加入独立几何碰撞检测、力矩阈值和急停,因为世界模型只能判断行为一致性,不能证明物理安全。

风险

结果目前来自仿真。世界模型可能对分布外失败产生高置信错误预测;保形校准依赖校准数据与部署分布接近。若 action chunk 太长或底层缓冲过深,发现异常时可能已经无法安全取消。

8. AI Coding:先规格、再分配上下文,并把仓库规则与权限放到 Agent 之外强制执行

7 月 30 日 Software Engineering 新条目揭示了 Coding Agent 的三个现实瓶颈:从零开发时缺少稳定规格,仓库级任务中有限上下文被重复代码占满,以及 Agent 不会主动遵守开源社区的 AI 贡献规则。

SpecFirst 将从零程序合成拆成两个阶段:规格 Agent 先读取文档并探测可执行二进制,把行为观察整理为结构化规格;代码 Agent 再以该规格为稳定参考完成实现。在 ProgramBench 全部 200 个实例、四种模型上,测试通过率提高 6.9%–21.3%,二进制探索覆盖率提高 9.4%–18.5%。

VITAL-RAG 按规范化代码对象组织检索结果,只在额外片段提供新语义时保留一个 companion,并对单对象与全局上下文分别设定 token 预算。在 RepoBench 上,Recall@4K 从 39.59% 提升至 63.67%,同时证据 token 减少 35.63%。这说明长上下文本身不能自动解决仓库理解,关键在于消除同一函数或类的重复视图。

RepoComplianceBench 收集了 49 个仓库、106 个包含 AI 贡献规则的真实 issue。四个前沿模型几乎不会主动读取贡献规则;提示、规则引用和校验器反馈可以改善披露与测试门禁,但在明确禁止 AI 贡献的仓库中,所有测试条件下 Agent 都没有自行拒绝执行。另一项对 Cursor、Copilot、Codex 等 LLM 原生 IDE 的研究分析了 110 万条社区帖子,发现大量安全与隐私问题来自系统级设计,例如过度数据访问和未经检查的自主动作,而非单纯来自底层模型。

适合接入真实研发流程吗

适合,但应采用受控流水线:

  1. 任务开始前生成可审查的行为规格、接口契约和验收测试;
  2. 按代码对象检索上下文,限制重复片段和总 token;
  3. Harness 在执行前强制加载仓库规则与组织策略;
  4. 规则解释可由 Agent 完成,最终允许或拒绝由确定性策略引擎决定;
  5. shell、网络、文件和 Secrets 使用最小权限沙盒;
  6. 完成条件依赖测试、静态分析、差异审查与证据文件,而不是 Agent 的最终自述。

模型发布观察

截至 7 月 31 日早间,OpenAI、Anthropic 和 xAI 官方发布页在过去 24 小时没有新的同级旗舰模型发布。当前主要版本仍是 7 月 9 日发布的 GPT-5.6、6 月 30 日发布的 Claude Sonnet 5,以及 7 月 16 日发布的 Grok 4.5。今天更值得投入的是 Agent 工作流与验证基础设施,而不是为了追逐模型名称频繁重构系统。

风险

SpecFirst、VITAL-RAG 和 RepoComplianceBench 都是新研究,基准提升不保证在私有大型仓库复现。自动生成的规格也可能把错误需求固定下来;策略引擎若规则不完整,会产生形式合规但实质危险的操作。所有 Agent 变更仍需可追溯 diff、测试证据和人工责任人。

今日结论

今天的进展共同指向一套成熟的工程分层:高容量学习模型负责生成候选、表征和预测,可解释估计器与优化器负责融合和约束,独立监控器负责发现执行偏差。

VidMap 不追求在线频率,而是利用全局优化把普通视频转为离线地图;雷达 Dense Soft Weighting 不依赖训练,而是保留被 CFAR 丢弃的弱多普勒证据并输出协方差;自适应 MPC 与风险感知原语都没有让神经网络直接接管最终控制;低成本四足研究明确把执行延迟作为隐藏状态处理;TurboVLA 提升动作生成频率,CheckVLA 则补上动作执行期间的反馈缺口。

AI Coding 同样如此。更强模型不能自动读取贡献规则、维护稳定需求或合理分配仓库上下文。真正可以进入生产环境的 Agent,需要规格、检索、策略、沙盒、验证和人工责任链共同组成系统。

最值得深入研究或尝试复现的方向

方向一:用 VidMap 重建 D455、手机和巡检视频,并与 LIO 地图离线对齐

选择包含长走廊、快速转身、重复门窗和室内外切换的视频,分别使用已知内参与未知内参配置运行 VidMap;再将轨迹与 FAST-LIO2 或 LIO-SAM 地图通过 Sim(3)/SE(3) 对齐,统计尺度漂移、回环成功率、重建完整度和资源开销。重点判断它能否作为历史视频地图生成器,而不是只看单一数据集分数。

方向二:实现稠密雷达软加权速度因子并接入 ESKF/GTSAM

从可访问 Range-Doppler 数据的单芯片雷达开始,实现连续置信度、鲁棒加权最小二乘和闭式协方差;与传统 CFAR 点云速度在黑暗、烟雾、金属走廊、多人运动和原地旋转场景中比较。最终把速度因子接入 IMU/LiDAR 后端,验证 LiDAR 退化时的定位连续性。

方向三:构建“快速 VLA + 执行校验 + 硬安全控制”的三层闭环

以 TurboVLA 或其他轻量策略生成短 action chunk,训练动作条件世界模型检查进度偏差,并由几何碰撞、关节限位、力矩阈值和急停状态机提供最终硬约束。实验同时记录策略频率、校验频率、误报率、漏报率、干预延迟和恢复成功率,避免只比较最终任务成功率。

参考资料