摘要

今天最值得关注的不是又出现一套可直接替代 FAST-LIO2、LIO-SAM 或成熟 VIO 的通用前端,而是机器人系统外围能力正在明显加强:

  • 无 GNSS 无人机开始尝试利用稳定语义结构进行跨视角绝对定位;
  • LiDAR 感知从固定推理配置转向按实时期限动态调整分辨率;
  • 无人机 VLN 和机器人 VLA 都在拆分“慢速语义理解”与“快速动作生成”;
  • 长时序操作开始显式维护任务阶段和历史接触结果;
  • 机器人规划开始用视觉预测检查几何可行性,而不只依赖语言推理;
  • AI Coding 模型竞争重点进一步转向单位任务成本、工具调用效率和多 Agent 调度。

本期筛选 8 条动态。其中前两项最接近定位与实时感知工程,第三至第七项集中于机器人规划、控制和 VLA,第八项覆盖最新代码模型与研发工作流。


1. SASGeo:用稳定语义结构为无 GNSS 无人机提供绝对位置修正

SASGeo 面向 GNSS 拒止环境中的无人机定位。它没有直接用原始航拍图像与卫星图做外观检索,而是把道路、建筑、水体、铁路、交叉口和农田边界等相对持久的结构转成语义栅格和关系图,再综合语义空间对齐、关系证据、特征稳定性、地理区分度以及正向、矛盾和未知观测,决定是否接受一次绝对位置修正。

在 220 次包含旋转、尺度变化、局部裁剪、遮挡、模拟地图变化和语义干扰项的合成检索试验中,全局语义描述子的 Recall@1 为 58.6%,带空间结构的语义匹配达到 94.5%—95.5%。作者同时明确说明,该结果只证明了受控条件下语义几何的判别能力,尚未验证真实飞行导航。

为什么重要

无人机 VIO 的主要问题不是短时间精度,而是长期运行缺少绝对约束。传统图像—卫星地图匹配容易受到季节、光照、视角、地图年份和传感器差异影响。将匹配对象改成道路拓扑、建筑轮廓和水体边界,有机会提高跨季节、跨模态定位的稳定性。

工程落地方式

更合理的架构不是让 SASGeo 替代 VIO,而是作为低频全局因子:

  1. VIO 或 LIO 持续输出高频局部轨迹;
  2. 语义分割生成俯视或局部语义栅格;
  3. 在离线卫星语义地图中检索 Top-K 候选;
  4. 对候选进行旋转、尺度和空间结构对齐;
  5. 通过残差、地理区分度和多帧一致性筛掉歧义匹配;
  6. 将确认后的平面位置和航向作为带鲁棒核的绝对因子加入后端。

传感器与实时性假设

它至少需要可用于语义提取的视觉输入,以及预先构建的地理语义地图。论文当前主要是合成 proof of concept,未提供真实无人机端到端延迟、算力需求或飞行速度条件。

主要风险

最大的风险是重复城市街区、相似农田、地图更新滞后和语义分割错误。工程上必须保留“拒绝定位”的能力,宁可暂时继续依赖 VIO 漂移,也不能把一个高置信度错误位置直接写入因子图。

工程成熟度:研究验证阶段,不建议直接用于安全关键定位。


2. Anytime LiDAR Detection:根据当前点云复杂度和截止时间动态选择推理分辨率

这项工作针对 pillar 或 voxel 类 3D 检测网络,提出单模型多分辨率推理机制。系统不需要部署多个不同分辨率模型,而是在运行时调整输入点云的体素或柱状网格分辨率,并由 deadline-aware scheduler 预测各分辨率的执行时间,选择在当前时间预算内可完成的最高分辨率。

作者在 nuScenes 上进行了评估,并将其接入模拟自动驾驶系统;论文称该方法在场景复杂度变化时能够减少不必要的停顿,同时保持无碰撞导航。

为什么重要

机器人实时系统最常见的问题之一,是感知算法按照最坏情况配置:

  • 简单环境中浪费大量 GPU;
  • 复杂场景中突然超时;
  • 点云数量变化造成延迟抖动;
  • 检测器超时后拖慢整个定位—规划—控制链路。

“平均帧率达到 20 FPS”并不足够,真正重要的是每一帧是否能够在控制截止时间前完成。

工程落地方式

在 MID360、16 线或多雷达系统上,可以将类似机制接入 TensorRT 3D 检测器:

  • 统计当前帧点数、非空 voxel 数和 ROI 分布;
  • 离线拟合不同分辨率下的推理延迟模型;
  • 根据控制周期剩余预算选择 voxel size;
  • 在狭窄或高速场景优先保证近场高分辨率;
  • 当 GPU 同时运行 LIO、检测和规划时,把实时负载纳入调度器输入;
  • 记录降分辨率期间的漏检率,而不只记录平均 mAP。

实时性与鲁棒性

它的核心优势是显式面向 deadline,而不是只优化平均吞吐量。单模型设计也比维护多套权重更节省显存和部署空间。

主要风险

低分辨率推理最容易漏掉行人、线缆、细杆和远距离目标。对消防机器人或无人机,不能全局均匀降低分辨率,更适合采用近场固定高分辨率、远场自适应分辨率的分区策略。

工程成熟度:值得复现,尤其适合 Jetson / RK3588 加独立 GPU 等算力受限平台。


3. FSD-VLN:无人机语义理解与低延迟控制开始采用异步快慢双系统

FSD-VLN 将无人机长时序视觉语言导航拆成两个异步分支:

  • 慢速分支使用预训练视觉语言模型,提取较稳定的环境语义和任务先验;
  • 快速分支使用 Diffusion Transformer,对跨时间动作分布建模并连续产生飞行指令;
  • 两者异步运行,避免每个控制周期都重新执行完整的大模型推理。

论文在低空飞行仿真中报告,未见场景的导航成功率最高达到对比方法的约 2 倍,单次动作推理延迟和总任务时间降低超过 50%。

为什么重要

VLM 或 VLA 直接进入无人机高频控制环通常不可行。无人机姿态控制可能工作在数百赫兹,局部位置或速度控制也常需数十赫兹,而视觉语言模型的推理周期可能达到数百毫秒甚至更长。

快慢双系统的正确方向是:

  • 语言模型负责“去哪里、经过什么、当前处于哪个任务阶段”;
  • 快速策略负责“接下来几百毫秒如何平滑飞行”;
  • 传统控制器负责姿态稳定、推力限制和故障保护。

工程落地方式

真实无人机可以设计成四级结构:

  1. VLM 以 0.5—2 Hz 更新语义目标和局部子任务;
  2. 快速学习策略以 10—30 Hz 输出局部轨迹或速度意图;
  3. MPC 或轨迹跟踪器以 50—100 Hz 处理动力学和障碍约束;
  4. 飞控姿态环以数百赫兹执行。

VLM 输出不应直接映射成电机或姿态指令。

传感器与可复现性

论文依赖实时视觉和语言指令,但当前页面未给出真实无人机实验、开源代码、机载计算平台或具体控制频率。

主要风险

全部结果来自仿真,未覆盖视觉延迟、振动模糊、风扰、定位跳变、通信丢包和推力限制。所谓 50% 延迟下降,也不能直接说明满足真实飞行的最坏情况截止时间。

工程成熟度:架构思路值得采用,论文模型本身暂不宜直接工程化。


4. TFP:VLA 不再只看当前画面,而是维护可更新的任务阶段信念

TFP 针对 VLA 的一个典型缺陷:同一视觉状态在不同任务阶段可能需要完全不同的动作。例如手已经抓住物体与尚未抓住物体,画面可能非常相似,但下一步动作不应相同。

TFP 使用 Liquid Time-Constant 动力学维护 episode-local 的任务进度状态,并将这一历史信念通过自适应调制直接注入 flow-matching 动作解码器。该记忆在稳定或遮挡阶段保持,在接触、释放和子任务切换附近进行更强更新。

使用 3.3B 参数模型时,论文报告 LIBERO 平均成功率从 96.9% 提升至 98.75%,LIBERO-plus 从 91.4% 提升至 93.77%;在专门测试记忆能力的 MIKASA ShellGameTouch 上,成功率最高达到 75%。

为什么重要

简单堆叠最近几帧并不等于拥有任务记忆。真正有用的记忆需要回答:

  • 当前子任务是否已经完成;
  • 上次接触是否成功;
  • 物体被遮挡前位于哪里;
  • 当前应该保持历史判断还是根据新观测修正;
  • 动作失败后是否需要回退。

TFP 的价值在于让历史状态直接影响动作生成,而不只是作为被动上下文。

工程落地方式

不需要先训练一个全新 VLA。可以在现有策略外围增加小型阶段估计器:

  • 输入视觉特征、本体状态、夹爪状态、力矩和执行结果;
  • 输出任务阶段、抓取状态和失败概率;
  • 用阶段编码调制现有 diffusion / flow-matching action head;
  • 接触事件附近提高状态更新增益;
  • 长时间遮挡时保留信念,但设置最大有效时长;
  • 状态冲突时触发重新观测或回退,而不是继续执行动作块。

主要风险

LIBERO 的高基线成功率意味着绝对增益有限;在真实机器人中,错误记忆可能比无记忆更危险。阶段信念必须有重置、冲突检测和外部验证机制。

论文页面当前没有展示可直接使用的公开代码仓库。

工程成熟度:非常适合做现有 VLA 的轻量增强实验。


5. APIVOT:长时序规划中,让语言负责语义、视觉预测负责几何检查

APIVOT 是一个 VLM 规划器,在推理过程中自适应交替使用两种内部表示:

  • 语言思维负责目标分解、对象选择和动作顺序;
  • 视觉思维生成或想象未来场景,用于检查空间是否足够、物体是否碰撞、操作后状态是否合理。

论文在长时序厨房任务中报告,其相对通用 VLM 和已有规划框架取得更高成功率,且优势在空间受限任务中更加明显。

为什么重要

纯语言规划器很容易生成语义正确、几何错误的方案,例如:

  • 先放入物体后导致柜门无法关闭;
  • 抓取路径被其他物品挡住;
  • 目标容器剩余空间不足;
  • 中间动作改变了后续可达性。

APIVOT 代表一种更合理的规划方式:只有在需要判断物理空间时才调用视觉预测,而不是每一步都进行昂贵生成。

工程落地方式

真实系统不必依赖生成式视觉模型完成全部几何验证,可以采用混合实现:

  1. LLM 或 VLM 生成候选任务计划;
  2. 视觉预测判断粗粒度未来场景;
  3. MoveIt、碰撞检测或可达性分析做精确几何验证;
  4. 失败的候选计划返回高层规划器重新排序;
  5. 只有语义和几何都通过后才下发技能;
  6. 每完成一个技能重新观测真实场景,禁止长期依赖想象状态。

可复现性

论文提供项目页面,但摘要没有说明完整训练数据、真实机器人闭环结果或推理延迟。

主要风险

生成的未来画面可能视觉上合理,但违反刚体、摩擦或接触动力学。视觉思维只能作为候选筛选器,不能替代真实碰撞检测和运动规划器。

工程成熟度:适合接入“LLM 任务规划 + MoveIt/Nav2”现有技术栈。


6. 仅靠单目视觉,对软物体和硬物体使用统一抓取控制管线

该工作使用单目 RGB 和位置控制夹爪处理软硬属性差异很大的物体。系统组合了开放词汇目标检测、图像分割、边界关键点分配、实时点跟踪和单目深度估计。

在接触前,语言模型根据对象语义估计材料柔顺性,作为抓取策略先验;对软物体,系统根据跟踪关键点的 Procrustes 差异估计形变并调节抓取;对硬物体,则根据关键点距离尺度变化控制夹爪开度。作者在 Franka Emika Research 3 上测试了生菜、马苏里拉奶酪、羊角面包、纸巾和硬塑料瓶。

为什么重要

触觉和六维力传感器能够提升抓取质量,但也增加成本、标定和维护复杂度。该方法展示了一个低硬件成本方案:用视觉形变作为软物体接触状态的间接反馈。

工程落地方式

适合食品、包装和家庭服务场景中的低速操作:

  • 语言模型只提供粗粒度材料先验;
  • 视觉跟踪提供实际形变量;
  • 夹爪电流或电机转矩提供最低成本的额外接触信号;
  • 对透明、反光或低纹理物体切换到保守夹力;
  • 抓取过程中限制单周期夹爪位移;
  • 视觉跟踪丢失时立即停止继续收紧。

传感器与实时性

系统不要求触觉或对象专用模型,只需要 RGB 和位置控制夹爪。论文说明使用了实时点跟踪,但摘要未给出具体控制频率和端到端延迟。

主要风险

视觉形变并不等价于接触力。遮挡、镜面包装、透明材料和极低纹理表面会导致跟踪失败;语言模型给出的硬度估计也不能作为安全依据。

工程成熟度:适合低速原型,不适合替代工业力控。


7. DexVerse:灵巧操作评测开始真正覆盖多任务、多机械臂和多灵巧手

DexVerse 提供 100 个灵巧操作任务,覆盖抓取搬运、关节物体操作、工具使用、双臂协同、非抓取操作、接触丰富动作、多目标执行和长时序多阶段任务。

平台支持 3 种机械臂和 6 种灵巧手,并提供纹理、背景、光照和相机视角变化。数据包含 3,180 条 VR 遥操作示范,以及同步的本体状态、RGB、深度、点云和环境状态。作者在 19 个任务上评估了 Diffusion Policy、DP3、OpenVLA 和 π0.5。

为什么重要

目前很多机器人学习结果只在单一机械臂、单一夹爪和少量任务上成立。换一只手、换相机角度或换背景后性能迅速下降,很难判断模型学到的是通用操作能力还是固定环境特征。

DexVerse 的主要价值不在于“又一个仿真器”,而在于可以统一比较:

  • 跨任务泛化;
  • 跨机械臂泛化;
  • 跨灵巧手泛化;
  • 视觉域变化;
  • 触碰和非抓取控制;
  • 长时序任务的错误累积。

工程落地方式

如果团队准备开发 VLA 或 diffusion policy,不建议一开始复现全部 100 项。可以选择:

  1. 一个普通抓取任务;
  2. 一个工具使用任务;
  3. 一个双臂任务;
  4. 一个非抓取推、拨或旋转任务;
  5. 一个长时序多阶段任务。

随后至少更换一种相机位置、一种手型和一组纹理,观察模型是否真正迁移。

可复现性与风险

论文提供项目页面和多模态示范数据描述,可复现性优于只公布指标的 VLA 论文。

不过它仍然是仿真基准,不能直接覆盖真实触觉噪声、摩擦变化、关节回差、通信延迟和硬件损坏风险。

工程成熟度:适合作为机器人策略内部评测基准,不代表真实部署成熟度。


8. 最新模型与 AI Coding:重点已从“谁分数最高”转为“每个任务该路由到哪个模型”

在本期检查的官方来源中,最新主要模型发布仍是 OpenAI 于 7 月 9 日正式发布的 GPT-5.6 系列,以及 SpaceXAI 于 7 月 8 日发布的 Grok 4.5。未发现 7 月 12 日之后更新的同级官方大模型发布。

GPT-5.6 的工程特征

GPT-5.6 包含:

  • Sol:面向复杂编码、长任务和高难度推理;
  • Terra:日常工作中的性能与成本平衡;
  • Luna:低成本、低延迟和高并发任务;
  • max:增加单 Agent 推理预算;
  • ultra:默认协调多个并行 Agent;
  • Programmatic Tool Calling:允许模型运行轻量程序处理工具中间结果,减少模型往返和无效上下文。

官方 API 定价为每百万 token:Sol 输入 5 美元、输出 30 美元;Terra 输入 2.5 美元、输出 15 美元;Luna 输入 1 美元、输出 6 美元。

Grok 4.5 的工程特征

Grok 4.5 定位于编码、Agent 任务和知识工作,官方称服务速度约 80 token/s,API 定价为每百万 token 输入 2 美元、输出 6 美元,并已接入 Grok Build、Cursor 和 API。

不同厂商公布的 benchmark 使用的 harness、推理配置和成本估算方式不完全一致,因此不应直接根据单张官方榜单决定生产模型。

AI Coding 工作流增量

GitHub Copilot App 已覆盖 macOS、Windows 和 Linux,并支持所有 Copilot 套餐以及 BYOK;JetBrains 中也已可把 Codex 作为 Agent provider,同时加入 Hooks、MCP 管理、权限模式和调试日志。

这意味着 coding agent 正逐渐脱离“某个 IDE 内的单一聊天窗口”,转向可替换模型、可管理工具和可审计权限的 Agent 容器。

推荐的生产模型路由

不要让所有任务都默认使用最强模型:

  • Sol / 高推理模型:大型重构、跨仓库迁移、疑难崩溃、复杂架构设计;
  • Terra / 中档模型:普通功能开发、测试补充、代码审查、文档同步;
  • Luna / 低成本模型:代码搜索、分类、格式修复、批量小修改和并行子任务;
  • Grok 4.5:可作为高吞吐 coding agent 的对照模型,重点测试 C++、Rust、前端和长任务成本。

真实研发接入标准

模型是否进入主力工作流,应由团队自己的仓库评测决定,至少记录:

  • 单任务成功率;
  • 测试一次通过率;
  • 人工修改行数;
  • 缺陷逃逸率;
  • token 和 API 成本;
  • 工具调用次数;
  • 首次可用结果延迟;
  • Agent 卡死或循环比例。

权限方面应默认采用独立 worktree、容器隔离、MCP 白名单、部署和密钥操作人工批准,并保留命令、diff、测试和浏览器验证记录。


今日结论

本期最重要的工程趋势可以归纳为三个词:分层、调度和验证

第一,机器人智能系统正在分层。高层语义模型不再直接承担高频控制,FSD-VLN 将慢速语义与快速动作分离,TFP 则在动作层补充任务阶段记忆。

第二,实时系统开始调度算力。Anytime LiDAR Detection 不再以固定分辨率运行,而是根据每帧复杂度和剩余时间预算动态调整推理负载。这种思想也应扩展到回环检测、语义分割、局部建图和 VLA 推理。

第三,生成式规划必须被验证。SASGeo 需要完整性拒绝机制,APIVOT 的视觉想象需要真实几何规划验证,语言生成的材料硬度需要视觉和电流反馈验证,coding agent 的修改也必须经过测试和审查。


建议优先深入研究或复现的 3 个方向

方向一:为现有 LiDAR 感知链路增加 deadline-aware 调度

这是今天最适合快速工程验证的方向。

实施步骤:

  1. 记录 MID360 或现有雷达每帧点数、非空 voxel 数和推理时间;
  2. 准备 2—4 档 voxel size;
  3. 使用同一模型测试不同分辨率输入;
  4. 拟合延迟预测模型;
  5. 根据控制周期预算动态选择分辨率;
  6. 检查近场小障碍物漏检率和最坏情况延迟。

即使不训练新网络,也可以先通过动态 ROI、点云降采样和 TensorRT profile 验证收益。

方向二:为 VIO/LIO 后端增加语义地图绝对定位因子

以 SASGeo 为思路,但不要一步做成端到端无人机系统:

  • 用公开卫星数据生成道路和建筑语义图;
  • 从无人机图像生成局部语义鸟瞰图;
  • 做旋转和平移相关匹配;
  • 返回 Top-K 候选和置信度;
  • 多帧一致后才加入 GTSAM;
  • 使用 switchable constraint 防止错误绝对定位破坏整张图。

重点指标应是误接受率,而不只是 Recall@1。

方向三:为现有 VLA 增加独立任务阶段记忆

无需重训大型 VLA,可以先训练一个小型阶段状态机或时序网络:

  • 输入视觉特征、夹爪开度、末端位置和接触信号;
  • 维护“接近—接触—抓取—移动—释放”等阶段;
  • 根据阶段修改 action chunk 长度和动作约束;
  • 视觉被遮挡时保持短期状态;
  • 观测冲突时触发重新规划;
  • 每个阶段设置超时和回退动作。

这一改造通常比继续扩大 VLA 参数量更容易提高真实机器人成功率。

参考资料

说明:历史聊天导出文本没有保留原始超链接,上述链接为按论文或项目名称生成的官方站点/学术检索入口;后续日报将直接保存原始论文、GitHub 与官方发布链接。