摘要

今天是周一上午,arXiv 尚未进入新的工作日发布批次;Robotics 最新批次仍是 7 月 24 日的 35 项条目。本期因此从该批次中筛选此前未重点介绍、且更贴近工程落地的内容。最新批次没有出现足以重新排序 FAST-LIO2、LIO-SAM、ORB-SLAM3 等成熟方案的通用 SLAM 前端,增量主要集中在长程视觉导航、多楼层动态导航、学习增强 MPC、低成本人体感知、工业 RGB-D 感知,以及机器人数据与仿真基础设施。

今天的主要判断是:

  • 长程导航的真正瓶颈不是“大模型看不懂指令”,而是如何持续积累局部证据、跨视角确认目标并保持闭环稳定;
  • 学习控制更适合生成战略参考或修正传统控制器,而不是直接替代动力学约束;
  • 机器人数据短缺可以通过 Real2Sim、合成触觉和针对弱项的数据采集缓解,但所有生成数据都需要物理与任务验证;
  • Coding Agent 评测正在从单一 SWE-bench 扩展到 Web、Office、安全和真实业务工作流;模型侧过去 24 小时没有新旗舰发布。

1. VoLN:没有路线文字提示后,长程视觉导航成功率迅速跌至个位数

VoLN 提出 Vision-Only Long-Horizon Navigation:任务只提供目标视图,不再通过自然语言指令显式告诉机器人“向左转、走多远、经过什么结构”。机器人必须从沿途可观察到的局部视觉线索中,在线判断哪些信号与最终目标相关。其 VoLN-UAV 基准包含 7,210 个长程无人机导航 episode,涉及连续三维运动、大视角变化和依赖上下文的信标选择。

参考模型 VoLN-MLLM 会将自监督视觉特征映射到结构化语义空间,并结合观测历史、目标视图、本体状态和检索到的视觉—语义 token,预测短时 waypoint。在未见过的五个环境中,其 Easy、Normal、Hard 成功率分别只有 7.4%、4.5% 和 1.8%。

为什么重要

很多 VLN 基准看似测试导航,实际上路线指令已经包含大量空间先验。VoLN 去掉这些提示后,暴露了三个真实机器人难题:

  • 目标图像和当前视角之间的跨视角匹配;
  • 哪些局部标志值得进入长期记忆;
  • 上百个控制周期中如何防止小误差逐渐积累。

适合谁关注

适合 GPS 拒止无人机、视觉指点导航、无先验地图探索和机器人长期视觉记忆研究。

工程落地启发

不建议让 MLLM 直接输出飞行控制。更稳妥的结构是:

  • 视觉模型低频判断目标相似度和任务阶段;
  • 将稳定路标写入带空间坐标的局部记忆;
  • 输出 1–3 秒局部 waypoint;
  • LiDAR/深度局部规划器检查障碍物;
  • MPC 或传统控制器执行;
  • 目标匹配置信度下降时主动停稳、环视或回退。

风险

个位数成功率说明这仍是探索性基准,而不是可部署导航系统。纯视觉方案也无法可靠处理玻璃、弱光、无纹理区域和相似走廊。

工程判断:适合用于检验视觉长期记忆,不适合作为当前无人机主导航方案。

2. ZONDA:把多楼层规划、目标复核和动态行人避障放入同一导航框架

ZONDA 面向零样本 Object Navigation,重点补齐传统方案通常忽略的两个场景:跨楼层移动和动态行人。系统由三部分组成:

  • 根据带高度差的可通行地图进行启发式多楼层规划,不要求平台专用学习控制器;
  • 通过多尺度、多视角观测与 VLM 交叉验证目标,减少单帧误识别;
  • 显式跟踪和预测移动行人,生成具有前瞻性的避让动作。

论文在 HM3D、MP3D、动态 HM3D-DYNA 及真实 Direct Drive Tech TITA 双足机器人上进行了验证。

为什么重要

真实建筑导航不是单层平面问题。机器人需要判断:

  • 楼梯或坡道通向哪一层;
  • 当前看到的目标是不是之前误检的同类物体;
  • 行人当前不挡路,但几秒后是否会进入机器人路径;
  • 多楼层拓扑和本地避障发生冲突时如何重规划。

对机器狗楼梯系统的启发

该架构很适合你的轮足机器狗,但不需要复制其底层控制:

  • 全局层维护“楼层—楼梯—平台—房间”拓扑;
  • 前后 MID360 与顶部 16 线雷达负责楼梯和平台检测;
  • 厂商登梯模式继续执行步态;
  • 上层只控制模式、vx/vy/vw 和阶段切换;
  • 目标检测必须经过多视角确认;
  • 平台转角和动态行人由独立局部规划器处理。

风险

论文摘要没有公开具体控制频率、成功率和代码成熟度。真实楼梯中的栏杆、玻璃、窄平台和传感器剧烈摆动,仍可能破坏高度地图和行人跟踪。

工程判断:架构可直接参考,特别适合“已有登梯 SDK、缺少上层闭环”的机器人。

3. RL 引导 MPC:让强化学习决定“怎么防守”,MPC 决定“如何物理可行地执行”

该工作研究自动驾驶赛车的防守控制。Soft Actor-Critic 在 Frenet 坐标系中生成带赛道几何意义的防守参考,非线性 MPC 再将这些参考作为空间正则项,同时处理轮胎摩擦和车辆动力学约束。

在 Thunderhill West 仿真赛道中,该系统将对手完成超车所需平均时间从 8.8 秒延长至 14.6 秒,同时使用了约 83.4% 的可用轮胎力。MPC 平均求解时间为 33.3 ms,标准差为 13.9 ms。

为什么重要

这是一种典型且合理的 RL–MPC 分工:

  • RL 处理难以写成解析代价的战略行为;
  • MPC 处理车辆动力学、摩擦圆和实时执行;
  • RL 不直接输出转向和驱动力;
  • MPC 仍可拒绝不可行参考。

可迁移的工程思路

在机器人系统中,RL 可以输出:

  • 无人机绕左、绕右、减速或等待的战略模式;
  • 机器狗当前应选择平地、登梯还是绕障技能;
  • MPPI/MPC 的参考通道或目标点;
  • 安全距离、速度上限等有限范围参数。

传统优化器继续负责速度、加速度、姿态、碰撞和执行器限制。

风险

33.3 ms 是平均求解时间,标准差较大;生产系统必须关注 P95/P99 延迟和超时回退,而不是只看平均值。结果目前也仅来自赛车仿真。

工程判断:非常值得借鉴其层级接口,但不应照搬赛车状态空间和奖励。

4. 仅靠平面 LiDAR,在 CPU 上估计周围人员位置与朝向

这项工作使用普通全向二维激光雷达序列,输出每条射线附近是否存在人员、人员距离以及相对朝向。网络采用 Space-Time Blocks,将沿扫描射线的空间处理和跨帧时间聚合显式分离。

训练不需要手工标注二维 LiDAR 数据,而是利用窄视场 RGB-D 人体跟踪器,在两种传感器共视区域自动生成监督。与参数量匹配的基线相比,距离误差下降 38%、位置误差下降 28%、朝向误差下降 15%;论文还报告了服务机器人 CPU 实时推理和现场演示。

为什么重要

摄像头人体感知存在隐私、光照和遮挡问题,三维 LiDAR 成本又较高。二维激光雷达虽然无法恢复完整人体姿态,但判断人员位置和面对方向,已经足以支持:

  • 社交导航;
  • 行人意图预测;
  • 机器人主动让路;
  • 判断人员是否正在接近设备;
  • 夜间和弱光环境监控。

工程落地启发

可以将窄视场相机作为训练阶段教师,部署时只保留二维雷达:

  • RGB-D 在共视区生成位置和朝向标签;
  • 二维雷达学习 360° 时序表示;
  • 部署端 CPU 运行轻量网络;
  • 输出进入动态障碍跟踪器;
  • 传统 VO/TEB/MPPI 根据人员朝向调节避让;
  • 低置信度人员仍按普通障碍物处理。

风险

二维雷达容易混淆腿部、桌椅和并排行人;人员静止、蹲下或被遮挡时,朝向估计也可能不稳定。

工程判断:低成本、隐私友好,适合矿区、戒毒所、服务机器人等室内人员感知。

5. 矿山破碎锤 RGB-D 感知:吞吐率和端到端延迟必须分开看

这套系统面向矿山液压破碎锤自动化,同时生成:

  • 移除机器人自身点云后的三维工作区;
  • 岩石实例分割结果;
  • 具备操作可行性的破碎位姿。

它将图像实例分割与几何点云处理结合,在嵌入式硬件上以约 10 Hz 输出结果,但端到端总延迟约为 675 ms。

为什么重要

10 Hz 并不意味着每个结果只延迟 100 ms。流水线可以每 100 ms 输出一帧,但该帧对应的是 675 ms 前的场景。对于缓慢液压设备可能可接受;对于快速移动机器人或无人机,这种延迟足以造成严重控制偏差。

适合谁关注

适合矿山机械、消防设备、重型机械臂、固定或低速工业机器人和 RGB-D 点云工程。

工程落地启发

工业系统需要同时记录:

  • throughput:每秒能输出多少结果;
  • latency:当前输出对应多早以前的观测;
  • jitter:最坏情况下延迟波动;
  • pose age:动作执行时目标位姿已经有多旧。

对高延迟模块,应:

  • 预测岩石或工具在结果返回时的位置;
  • 降低机械动作速度;
  • 在接触前重新采集近距离观测;
  • 自身点云过滤使用实时关节状态插值;
  • 破碎位姿由运动规划和碰撞检测再次验证。

风险

验证场景是代表性缩比环境,并不等同于粉尘、震动、湿岩、强反光和设备遮挡严重的真实矿井。

工程判断:方法很工程化,其最大启示是时间对齐和闭环延迟管理。

6. GS-Agent 与 TableVerse:机器人仿真数据出现“生成式”和“确定性重建”两条路线

GS-Agent 使用多个专业 Agent 操作物理引擎,从自然语言描述自动完成 3D 资产选择、材质调节、物体放置、运动控制、相机和灯光配置。系统通过代码调用物理引擎并利用多模态反馈迭代,可生成包含刚体、软体和液体交互的可控 4D 世界。

TableVerse 则采取相反路线:它不让模型“想象”桌面布局,而是从互联网上的真实、非结构化图像中确定性恢复具备度量尺度、真实拓扑和机械稳定性的仿真场景,再自动生成无碰撞抓放轨迹。TableVerse-100K 包含 10 万个不同的物理一致桌面环境及交互轨迹。

为什么重要

两条路线分别适合不同目的:

  • GS-Agent 适合快速创造罕见场景、事故场景和多物理体交互;
  • TableVerse 更适合生成贴近真实物体分布的训练数据;
  • 前者强调可控性和多样性;
  • 后者强调几何真实性与稳定性。

工程落地启发

机器人数据平台可以同时保留两类数据:

  • 真实数据和 Real2Sim 数据作为主体;
  • 生成式仿真补充罕见失败和极端组合;
  • 所有生成场景运行物理稳定性测试;
  • 轨迹必须在仿真中成功回放;
  • 生成图像、深度、碰撞体和任务标签做一致性检查;
  • 分开统计真实、重建和生成数据的训练收益。

风险

物理引擎中的“可运行”不代表与现实动力学一致。Agent 还可能通过调节摩擦、质量或碰撞体,使原本不可行的任务在仿真中虚假成功。

工程判断:TableVerse 更适合策略训练主数据,GS-Agent 更适合压力测试和长尾场景生成。

7. FELT 与偏置感知采集:缺少触觉数据时,先生成;模型忽视某类指令时,定向补数据

FELT 从 RGB 图像预测左右手指的压力触觉图,使用冻结的大型视觉编码器和轻量 query decoder,一次前向推理即可生成触觉信号。左右触觉面板由独立分支解码,以表达擦拭、插入和手内旋转中的非对称接触。生成的触觉图或 latent feature 在四种接触任务中均改善了纯视觉策略,部署时甚至可以不安装真实触觉传感器。

另一项偏置感知数据研究发现,六种机器人基础策略普遍存在类似的指令因素支配顺序:颜色 ≥ 物体 ≥ 空间关系 ≥ 动词 ≥ 尺寸。也就是说,策略容易依赖颜色等显著线索,却忽略“推、拉、移动”等动词和尺寸条件。作者根据该诊断,把固定采集预算更多分配给弱 grounding 因素,在仿真和真实机器人上仅使用一半示范数量便超过常规采集方法。

为什么重要

机器人数据扩展不应只追求“更多轨迹”:

  • 触觉缺失可以通过视觉预测生成辅助特征;
  • 指令泛化差需要定向补充被模型忽略的因素;
  • 大量重复颜色和对象组合,可能不会改善动作语义理解;
  • 合成数据应针对明确的能力缺口。

工程落地启发

建议为策略建立因素化评测矩阵:

  • 对象不变,只换颜色;
  • 颜色不变,只换动词;
  • 物体不变,只换尺寸;
  • 布局不变,只换空间关系;
  • 视觉相同,但改变接触状态。

根据失败矩阵决定下一轮采集,而不是平均增加所有类型数据。生成触觉只作为辅助表示;接触力硬限制仍由真实传感器或控制器负责。

风险

视觉预测的触觉本质上是模型推断,无法发现图像中不可见的内部卡滞、摩擦突变和材料损伤。

工程判断:非常适合优化机器人数据预算,但不能把合成触觉当作安全传感器。

8. Coding Agent:WorkBuddy Bench 将评测扩展到代码、网页、办公与安全任务

Tencent WorkBuddy Bench 覆盖四类真实工作域:

  • Code:仓库级软件工程;
  • Web:前端和网页开发;
  • Office:办公和业务流程;
  • Security:红队与蓝队安全任务。

任务不是直接复制公开 Issue,而是从真实 commit、PR 或业务场景逆向构造,再重写为简短、口语化的角色请求,降低通过搜索找到原始答案的可能性。环境镜像、测试、参考解和评测 Harness 均公开,并支持在 CodeBuddy Code 与 Claude Code 两种 Harness 中复现。

不同子集使用不同评分方法,因此作者明确不提供一个混合总分,也不建议直接比较各子集分数。

为什么重要

真实 Coding Agent 不只修改代码,还可能:

  • 启动浏览器检查 UI;
  • 修改电子表格和业务数据;
  • 执行安全分析;
  • 协调多个工具;
  • 处理非标准、口语化需求。

只在 SWE-bench 上表现好,并不能证明它适合完整研发工作流。

推荐内部评测方式

可以参照 WorkBuddy 的目录结构,为自己的项目建立小型基准:

  • C++/ROS 2 编译与崩溃修复;
  • NestJS/PostgreSQL 后端功能;
  • Vue/Element Plus 页面视觉修复;
  • Android Compose 功能开发;
  • Docker、CI 和部署问题;
  • 安全与依赖治理。

每项任务固定环境、验收脚本、时间预算和权限。模型与 Harness 必须成对评测,因为同一模型在不同工具权限、上下文压缩和执行语义下表现可能完全不同。

最新模型状态

过去 24 小时没有新的通用旗舰正式发布。当前最近的重要模型更新仍是 7 月 24 日的 Claude Opus 5,官方定价为每百万 token 输入 5 美元、输出 25 美元,并已进入 GitHub Copilot 的 IDE、CLI 和 Cloud Agent 等入口。厂商公布的编码与 Agent 评测仍应在自己的仓库和 Harness 中复测。

工程判断:下一阶段模型选型应基于多域任务成功率和每个成功任务总成本,而不是单一代码榜单。

今日结论

今天最明确的趋势是:长程自主能力正在从单一大模型,转向分层系统和有针对性的数据工程。

  • VoLN 暴露了视觉长期证据积累的困难;
  • ZONDA 将多楼层拓扑、目标复核和动态避障拆成独立模块;
  • RL–MPC 让学习负责战略,让优化器处理动力学;
  • 二维 LiDAR 人体感知证明低成本传感器也能支持社会导航;
  • 矿山 RGB-D 系统提醒工程团队区分吞吐率与真实延迟;
  • GS-Agent 和 TableVerse 分别承担长尾生成与真实布局重建;
  • FELT 和偏置感知采集让数据增长针对能力缺口;
  • WorkBuddy Bench 则把 Coding Agent 评测扩展到真实多工具工作。

共同原则仍然是:

让学习模型生成候选、先验与辅助表示;让几何、动力学、真实传感器和验证脚本决定结果能否进入生产系统。

最值得深入研究或尝试复现的 3 个方向

方向一:机器狗的多楼层拓扑与阶段式登梯导航

  • 建立楼层、楼梯、平台和走廊拓扑图;
  • 用三套 LiDAR 检测楼梯阶段和平台边缘;
  • 厂商登梯模式负责底层执行;
  • 上层闭环控制 vx/vy/vw、模式切换和台阶计数;
  • 平台转弯和动态行人使用独立局部规划;
  • 所有阶段设置超时、停稳重观测和回退条件。

方向二:二维 LiDAR 的人员朝向与动态避障

  • 使用 RGB-D 自动生成二维雷达人体标签;
  • 训练轻量时序网络输出人员位置与朝向;
  • CPU 端实时运行;
  • 根据人员朝向预测短时间移动趋势;
  • 输出进入 VO、TEB 或 MPPI;
  • 重点测试并排行人、遮挡和静止人员。

方向三:建立多域 Coding Agent 内部基准

  • 每类任务固定容器和仓库快照;
  • 同时测试 Code、Web、Office 和 Security;
  • 模型与 Harness 成对比较;
  • 记录一次成功率、重试、人工修改、总成本和安全违规;
  • 每次升级模型、MCP 或上下文压缩策略后重新运行;
  • 不使用跨子集的简单平均分掩盖能力短板。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。