技术深度简报
机器人 / SLAM / 控制 / AI Coding 技术深度简报|2026-07-29
摘要
arXiv Robotics 在 7 月 28 日公开了 69 项条目。本期没有发现一套足以直接替代 FAST-LIO2、LIO-SAM、ORB-SLAM3 等成熟前端的新通用 SLAM 系统,更值得关注的是:对象级 SLAM 开始把语义特征直接纳入数据关联;无人机规划将非凸走廊、动力学和目标收敛放进同一个混合整数 MPC;高速飞行控制开始显式预测电池放电造成的最大推力下降;足式机器人强化学习则通过训练期虚拟力矩扩大探索,最终仍部署纯关节策略。
机器人基础模型方向出现两条实用主线:视觉触觉世界模型开始同时预测接触、力相关 latent 和滑移;具身数据工程开始用“数据金字塔”统一梳理真实机器人、UMI、人类视频、仿真和通用视觉语言数据。AI Coding 侧,GitHub 在同一天强化了恶意 Actions 工作流审批、Dependabot 恶意包覆盖和 npm 发布前扫描,并把 Grok 4.5 接入 Copilot。
1. Semantic Semi-Incremental Object SLAM:语义不再只是地图标签,而是数据关联变量
该工作提出广义的 data-association-free Object SLAM,同时估计机器人位姿、对象位置、对象语义和测量—地标对应关系。语义既可以是对象类别,也可以是视觉基础模型输出的连续特征向量;系统采用半增量求解,在新增测量时更新当前问题,同时对地标数量估计给出原则、启发式和可解释规则。
为什么重要
对象 SLAM 最容易失效的环节不是检测,而是同类对象的数据关联:重复椅子、门、设备柜或车辆一旦关联错误,就会把后端优化拉向错误解。传统方法通常先做硬关联,再把结果交给优化器;该工作把语义估计和关联放入同一个概率问题,使“对象看起来像什么”和“对象位于哪里”互相提供约束。
算法模块
- 里程计和对象位置观测;
- 类别标签或连续语义特征;
- 隐式数据关联变量;
- 机器人位姿、地标位置和地标语义联合估计;
- 半增量优化;
- 地标数量估计与合并规则。
传感器假设
系统需要可靠的里程计,以及可产生对象位置和语义特征的视觉、RGB-D 或 LiDAR—相机感知模块。它本身不是完整视觉前端,也不能代替动态物体过滤和闭环检测。
实时性与可复现性
论文强调半增量方案改善计算效率,但摘要没有公布统一硬件上的实时频率,arXiv 页面也未提供正式代码仓库。当前更适合作为因子图或对象地图后端研究,而不是直接替换生产 SLAM。
工程落地启发
可在现有 LIO/VIO 后端外建立对象层:先保留 Top-K 候选关联,不立即做硬匹配;将类别、DINO/CLIP 特征、三维位置和对象尺寸共同用于关联;只有连续多帧一致时才固化对象 ID。对象因子应使用开关约束或鲁棒核,避免单个错误对象破坏几何地图。
风险
基础模型特征在工业零件、低照度和跨季节环境中可能发生域偏移;大量同类对象还会让关联组合快速增长。对象层不能直接修改用于紧急避障的占用地图。
2. Non-Convex Air Corridor MPC:把走廊可行性、动力学和目标收敛统一进规划问题
该工作面向非凸城市空中走廊,采用混合整数 tracking MPC,在单个优化问题中同时约束 UAV 动力学和走廊可行性。为避免非凸几何引起局部极小值,规划器把基于最短路径的 offset cost 和可行性约束直接嵌入 MPC,不再依赖独立的外部全局规划阶段。
为什么重要
常见无人机栈先由 A*/JPS 找几何路径,再由轨迹优化器拟合动力学轨迹。两层分离后,经常出现路径可通行但轨迹不可执行,或轨迹优化在非凸通道中选错分支。混合整数 MPC 可以显式选择走廊分区,同时保证状态和控制连续。
算法模块
- 非凸走廊的分区或逻辑变量;
- 混合整数 tracking MPC;
- UAV 动力学约束;
- 最短路径 offset cost;
- 目标收敛与走廊可行性约束。
实时性与鲁棒性
论文目前给出数值仿真,未公布实体无人机、求解器、控制周期或最坏求解时间。混合整数优化在走廊分区和预测时域增加时可能出现明显长尾延迟,因此短期不能据此认定适合机载实时闭环。
工程落地启发
更稳妥的实现是让全局搜索先提供有限个走廊分支,再让 MI-MPC 只在局部 2–4 个候选分区中选择;同时设置严格求解超时,超时后沿上一次可行轨迹减速。对 MID360 无人机,可将局部 ESDF 安全通道转换成凸多面体序列,避免直接对全部体素建立整数变量。
风险
动态障碍、感知延迟和走廊地图误差没有在摘要中得到充分覆盖。规划器即使在模型内可行,也必须由飞控、推力限制和紧急停车/悬停逻辑兜底。
3. BC-NMPC:高速飞行规划开始把电池衰减当成时变动力学约束
BC-NMPC 将电池和推进系统模型接入 NMPC,在线预测电压、电流、功率和最大可用推力,并根据电池放电造成的推力上限变化在飞行中重新规划轨迹。作者用真实飞行验证推进模型,用仿真评估在线重规划;相对未补偿方案,报告轨迹 RMSE 降低 6 倍、可飞距离增加 46%、飞行时间增加 100%,并在障碍环境中避免碰撞。
为什么重要
高速无人机通常按满电状态规划,随着电压下降,同一油门无法产生相同推力,轨迹误差会在急转、爬升和近障段集中爆发。只在底层提高 PID 增益无法弥补物理推力不足,正确做法是让规划器提前知道未来控制权限会下降。
算法模块
- 电池电压和电流模型;
- 推进系统与最大推力预测;
- 带时变推力上限的 NMPC;
- 飞行中轨迹重规划;
- 轨迹跟踪与剩余控制裕度评估。
传感器假设
需要电池电压、电流或可估计的功率状态,以及经过标定的电机—桨叶推进模型。不同电池老化程度、温度、桨叶和载荷都可能要求重新辨识。
实时性与可复现性
推进模型经过真实飞行验证,但完整重规划效果主要在仿真中评估;论文未给出统一求解频率和代码仓库。工程采用前必须在实体机上测最坏求解时间和模型失配。
工程落地启发
可先不改写整套 NMPC,只增加一个“可用推力管理器”:根据电压、温度、载荷和历史控制残差估算推力上限;规划器据此降低速度、爬升率和最大曲率。电池模型置信度下降时应使用保守下界,而不是均值预测。
风险
错误高估推力会直接导致撞击,错误低估则会过度保守。电池内阻随温度和老化变化,必须保留在线校准、输出限幅和飞控级低电保护。
4. WARL:训练期加入虚拟外力扩大探索,部署时回归纯关节控制
WARL 在足式机器人强化学习的动作空间中临时加入作用于机身的虚拟 wrench(力和力矩),使策略在训练早期能够直接探索位置和姿态空间。Switching Curriculum 在“关节 + wrench”与“纯关节适配”阶段之间切换,并逐步衰减虚拟 wrench,最终得到不依赖外力辅助的纯关节策略。项目展示了跨越障碍、跳跃和动态全身动作,并进行了 Isaac Gym 到 MuJoCo 的 Sim2Sim 迁移。
为什么重要
足式 RL 在稀疏成功任务中经常卡在探索阶段:随机关节噪声很难偶然产生完整跳跃或越障动作。虚拟 wrench 相当于训练期的辅助教练,先把机器人推入有价值的状态,再让关节策略学习如何独立复现。
算法模块
- 关节动作策略;
- 虚拟 wrench 策略;
- 成功轨迹或 wrench 序列缓冲区;
- Joint + Wrench 学习阶段;
- Joint-only 适配阶段;
- 指数衰减的 Switching Curriculum。
实时性与可复现性
项目页面公开了方法和演示,但未提供明显的完整训练代码入口。部署策略最终只输出关节控制,因此推理开销与普通 RL 策略接近;主要成本在训练和课程设计。
工程落地启发
对于没有关节级控制权限、只能调用厂商技能和 vx/vy/vw 的轮足机器狗,可以借鉴而非照搬:训练期加入“理想技能辅助”或外部状态修正,引导策略发现上梯、平台转向和跨越的成功状态;随后逐渐取消辅助,最终让策略只输出真实 SDK 能执行的技能选择和速度命令。
风险
论文也指出,虚拟 wrench 可能鼓励不符合机器人真实形态的动作。辅助力过强时,策略会学会利用仿真中的不现实自由度。必须限制 wrench 方向、作用点、持续时间,并用 Sim2Sim、系统辨识和实体低速测试筛除投机行为。
5. FeelWorld:世界模型开始显式预测接触、力相关状态和滑移
FeelWorld 是分层视觉触觉世界模型,同时预测未来视觉 latent、接触状态、三维触觉 latent 和滑移状态。其 contact-gated asymmetric attention 在自由空间阶段保持纯视觉预测,只有进入接触后才启用视觉—触觉联合动力学;训练还加入自回归 rollout 和上下文噪声,以降低长时预测误差。论文在芯片抓取、水果抓取和 USB 插入中报告 81.7% 平均零样本规划成功率,80 步 rollout 的 LPIPS 比纯视觉基线低 61%。
为什么重要
纯视觉世界模型可能生成看起来合理、物理上错误的未来:夹爪似乎抓住了物体,但实际上已经滑落;USB 在画面中接近插孔,却承受过大侧向力。FeelWorld 将接触和滑移提升为世界状态,而不只是附加传感器输入。
算法模块
- 未来视觉 latent 预测;
- 接触二值/离散状态;
- 力相关三维触觉 latent;
- 滑移状态;
- 接触门控非对称注意力;
- 自回归世界模型;
- 基于预测状态的 CEM 规划。
传感器假设
需要视觉输入及稳定的触觉或力相关信号。不同触觉硬件、软材料、传感器安装和采样频率之间的域差异较大。
实时性与可复现性
摘要未公布完整规划频率和开源代码。CEM 通常需要多次 world-model rollout,实体部署时应重点测试最坏延迟,而不能只看单次前向速度。
工程落地启发
对接触操作,可让 VLA/世界模型低频提出 action chunk,触觉模型高频判断接触和滑移;当预测滑移或力异常时截断剩余动作,由阻抗控制器执行撤退。触觉世界模型只能做候选排序,硬力矩阈值和碰撞限制必须独立存在。
风险
触觉预测准确不等于控制安全。传感器漂移、不同物体材质和未见接触模式会产生分布外输入;世界模型的想象结果不能替代真实力反馈闭环。
6. Data Pyramid:具身模型的数据配方比单纯扩大真实机器人轨迹更重要
Data Pyramid 将具身数据分成五层:真实机器人数据、UMI/无机器人采集数据、第一/第三视角人类数据、仿真数据和通用视觉语言数据,并从规模、机器人对齐度、质量、多样性、复用性和物理真实性分析各自作用。配套项目和 GitHub 仓库提供可检索的数据集表,覆盖真实轨迹、UMI、人类视频、仿真器和代表性 VLA/WAM。
为什么重要
真实机器人数据最对齐,但昂贵且覆盖窄;通用视频规模最大,却缺少动作和接触标签。下一代 VLA 不可能只依靠单一数据源,关键在于不同阶段如何混合:通用数据学习语义,人体视频学习物体交互,仿真覆盖失败和危险状态,真实机器人数据完成本体与控制对齐。
工程落地启发
小团队不应追求不可复制的百万轨迹规模,可建立分层数据配方:
- 真实机器人:高质量成功、失败和恢复轨迹;
- UMI/手持设备:快速扩展物体与场景多样性;
- 人类视频:学习目标、接触顺序和物体状态变化;
- 仿真:覆盖碰撞、边界状态和系统性扰动;
- 通用视觉语言:对象、场景和任务语义。
每条数据应记录来源、本体、动作定义、时间同步、成功/失败原因、接触信息和许可证,避免只积累视频文件。
可复现性
论文属于综述,不提供单一可训练模型;但项目页和 GitHub 数据表已公开,适合用于制定数据路线和筛选公开数据集。
风险
不同来源的动作空间、相机坐标、时间频率和标签质量不一致。混合规模增大但对齐错误时,模型可能学到冲突动作或错误接触关系。数据配方必须通过下游消融验证,而不是按数量简单拼接。
7. AI Coding 与模型:GitHub 同时加强 Agent 供应链防护,并接入 Grok 4.5
GitHub Actions 现在会自动识别部分可疑公共仓库工作流并暂停执行,要求具有写权限的协作者通过已认证网页会话批准后才运行。GitHub 表示该机制针对被盗凭据推送恶意 workflow、窃取 CI/CD 凭据的攻击,不需要仓库额外配置,目前适用于 github.com 公共仓库。
Dependabot 同时开始从 OpenSSF malicious-packages 项目导入恶意包公告,扩大 npm、PyPI 等生态覆盖;npm 则在新版本公开安装前执行发布时恶意扫描,正常情况下会引入约 5 分钟等待,双用途安全工具还需声明 contentPolicy 并附带 DISCLOSURE 文件。
模型侧,Grok 4.5 于 7 月 28 日开始进入 GitHub Copilot,支持最高 500K 上下文、图文输入和低/中/高推理强度,可用于 VS Code、Visual Studio、Copilot CLI、Cloud Agent、Copilot App、JetBrains、Xcode 和 Eclipse;Business/Enterprise 管理员需要显式开启策略。GitHub称其内部测试较擅长并行工具调用和终端型编码任务,但这一判断仍需在自己的仓库中复测。
为什么重要
Coding Agent 扩大了供应链攻击面:Agent 会执行 workflow、安装依赖、读取 PR 分支中的脚本,并持有测试或发布凭据。仅靠模型识别恶意内容不够,执行平台必须在工作流启动、依赖解析和包发布三个阶段提供确定性拦截。
适合接入真实研发流程吗
Grok 4.5 可以作为 Codex、Claude Code、Copilot 默认模型之外的对照模型,尤其适合测试大型仓库探索、并行工具调用和时效敏感任务;不建议仅凭厂商或 GitHub 内部评测直接设为全组织默认。应使用同一任务集比较一次完成率、CI 通过率、人工修改时间、工具循环、总 token 和每个成功 PR 的完整成本。
工程落地启发
- 外部 PR 的 Actions 默认使用最小权限和无生产密钥环境;
- workflow、安装脚本、
package.json、lockfile 和 Agent 指令文件都视为可执行代码审查; - 启用 Dependabot malware alerts;
- Agent 安装依赖前验证 Registry、包名、版本、哈希和发布者;
- 发布 npm 包的自动化应容忍扫描等待,不要假设 publish 后立即可安装;
- 对多模型 Agent 建立相同的权限、日志、测试和费用门禁。
风险
GitHub 的自动暂停只覆盖其能识别的部分可疑 workflow,而且当前不适用于 GitHub Enterprise Server。恶意包检测也不可能覆盖未知样本;Agent 仍需在隔离容器、最小权限令牌和网络白名单中运行。
今日结论
今天的技术增量都指向同一条工程原则:让学习或优化模块产生更好的候选和估计,但把最终可信边界交给可解释的约束。
对象 SLAM 将语义与关联联合估计,却仍需要鲁棒因子保护几何地图;非凸走廊 MPC 和 BC-NMPC 把通道、动力学和推力权限纳入规划,却仍需求解超时与飞控兜底;WARL 用虚拟 wrench 扩大训练探索,部署时必须消除辅助;FeelWorld 将接触和滑移写入世界状态,但硬力限制仍需独立;Coding Agent 获得更强模型的同时,也必须接受工作流审批、恶意包检测和发布前扫描。
最值得深入研究或尝试复现的方向
方向一:为现有对象地图增加“软关联 + 语义联合估计”
在 LIO/VIO 之外维护对象层,保留 Top-K 关联候选;将对象位置、类别、视觉特征、尺寸和历史状态一起送入后端。先在重复走廊、仓库设备柜或停车场车辆场景测试,重点统计错误合并、重复对象和关联恢复能力。
方向二:给无人机 MPC 增加可用推力预测和控制权限降级
从简单版本开始:根据电压、温度、载荷和历史油门—加速度残差估算最大可用推力;规划器依据推力下界动态限制速度、爬升率和转弯曲率。测试应覆盖满电、低电、老化电池和额外载荷,并验证错误模型下的保守回退。
方向三:建立 Agent 供应链执行门
在 Codex、Copilot、Claude Code 或自建 Agent 外部拦截 workflow、包管理器和发布命令:验证来源、哈希、lockfile、权限和网络目标;外部 PR 使用一次性容器和无生产凭据运行;将恶意包告警、工作流审批、测试结果和人工批准写入不可绕过的合并门禁。
参考资料
- Semantic Semi-Incremental Data-Association-Free Object SLAM
- Model Predictive Planner for UAV Navigation in Non-Convex Air Corridors
- BC-NMPC: Battery-Constrained NMPC with Propulsion Prediction and Replanning for High-Speed Flight
- WARL 论文
- WARL 项目页
- FeelWorld: Visuo-Tactile World Model
- Data Pyramid 论文
- Data Pyramid 项目页
- Data Pyramid GitHub
- GitHub Actions holds potentially malicious workflows for approval
- Dependabot alerts on malicious packages across more ecosystems
- npm publish-time malware scanning and dual-use metadata
- Grok 4.5 官方发布
- Grok 4.5 in GitHub Copilot