端侧 AI 与机器人技术雷达|2026-07-20

今日必看

Jetson-PI 把端侧 SoC 竞争推到控制时序层

Jetson-PI 的 arXiv 页面显示论文 2026 年 7 月 14 日提交,核心是 Foresight-Aligned Asynchronous Correction:在 VLA 动作执行和下一轮推理并行时,用轻量 future correction module 缓解感知与执行错位,再用置信度调度减少不必要的 VLM 调用。论文报告在 NVIDIA Jetson Orin 上,相比 naive PyTorch 和 vla.cpp 分别取得 8.66x 与 5.41x 控制频率提升,并在 LIBERO 平均成功率上较 VLASH 高 14.8%;配套 GitHub 仓库 7 月 19 日仍有提交,算法仓库为 Apache-2.0,边缘推理仓库为 MIT。证据阶段是论文、代码、项目 benchmark 和演示,不是第三方真机复现。主来源

这条动态重要的地方不只是“Jetson Orin 跑得更快”,而是它把端侧 AI 芯片的有效算力拆成了调度、图复用、GPU 驻留缓存、动作 horizon 和控制延迟。一个可辩论判断是,未来机器人 SoC 选型表会少看孤立 TOPS,多看平台能否把 VLA 控制链路稳定地压进可审计时序;这对 Jetson 是先发优势,对瑞芯微、地平线、高通、Intel、爱芯元智等平台则是压力:只给离线模型清单不够,还要暴露每步推理、相机输入、动作发布和温控降频后的延迟。反例也明确,如果第三方无法在真实机械臂、不同相机数和不同功耗模式下复现这些增益,Jetson-PI 仍会停留在 CUDA 生态的优秀论文工程。后续验证指标应看非作者复测、非 NVIDIA 后端移植、端到端功耗和失败恢复日志。代码

第二个判断更偏工程采购:端侧 SoC 的差异会越来越由“能否让控制链路被记录和回放”体现,而不是单次 benchmark 峰值。机器人团队真正需要的是同一任务在相机数、动作块长度、系统负载和散热条件变化后仍能解释为什么失败。若某个平台能把这些字段变成 SDK 默认报告,它即使峰值算力不是最高,也可能先进入客户的回归测试表;若做不到,模型生态会继续默认围绕 Jetson 与 CUDA 组织实验。边缘运行时

芯片 / 平台

  • NVIDIA JetPack 7.2:官方下载页显示 JetPack 7.2 搭配 Jetson Linux 39.2、CUDA 13.2.1、TensorRT 10.16.2,并把 JetPack 7 支持扩展到 Jetson Orin 系列,同时在 Thor T5000 上预览 MIG、给 AGX Orin 32GB 增加 241 TOPS Super Mode。判断上,NVIDIA 正把 Orin 与 Thor 收进同一软件底座,国产 SoC 的短板会从参数表转向 BSP、实时内核、模型测量工具和长期镜像维护。主来源

  • JetPack 7.2 Yocto:NVIDIA 论坛公告确认 7 月 1 日发布首个官方 JetPack 7.2 Yocto release,覆盖 Orin 和 Thor 开发套件,并通过 OE4T 提供 Yocto 6.1 与 6.0 分支支持。它的产业含义是机器人客户开始要求可裁剪、可维护的生产 Linux,而不仅是开发板镜像。主来源

  • Ultralytics v8.4.102:7 月 19 日 release 在 YOLO26 部署侧新增 Hailo 语义分割导出与推理,区分 Hailo-8/8L 主机上采样和 Hailo-10/15 加速器图内 ArgMax 路径。它不是机器人基础模型事件,但说明视觉模型工具链正在把边缘 AI 芯片后端写成一等出口。主来源

软件 / 框架

  • Jetson-PI-Edge:项目 README 将其定义为基于 llama.cpp 的 VLA 边缘推理引擎,支持 PI0/PI0.5、前台 HTTP server、FlashRT provider、图复用和 GPU 驻留中间缓存;Jetson Orin MAXN 表格中 PI0.5 总延迟从 naive 1420.8 ms 降到 412.9 ms。局限是数字仍为项目自报,且最佳路径依赖 CUDA。主来源

  • LiteRT v2.1.6:Google AI Edge 7 月 2 日 release 增加 ARMv7 预编译包,把 Accelerator Test Suite 单算子覆盖扩到 43 个 f16/f32 op,并修复高维 tensor 与 GPU broadcast 等内核问题。它的信号是端侧 runtime 正在补“可测算子覆盖”,这比只宣布支持某模型更接近芯片导入流程。主来源

新项目雷达

  • Forgearpitg1304/forge 是 MIT 许可的机器人数据工具,支持 RLDS、LeRobot v2/v3、Zarr、HDF5、Rosbag、MCAP 转换,并提供质量评分、语义搜索和去重;仓库 7 月 19 日仍活跃。它不直接提升端侧推理速度,但会影响 VLA 训练数据是否能进入可查询、可清洗的工程管线。主来源

持续观察

  • 验证信号:未来两到四周重点看 Jetson-PI 是否出现第三方复测,以及是否有人把同一 PI0/PI0.5 控制链路搬到 QNN、OpenVINO、RKNN、BPU 或 AXera 后端。若非 NVIDIA 平台只能停在离线推理,端侧 SoC 的真实差距会被运行时证据进一步放大。参考来源

  • 平台分界线:JetPack 7.2 的 Yocto、agent skills 和统一 Orin/Thor 底座提示一个非共识判断:机器人客户采购的可能不是“芯片 + SDK”,而是能被 CI、BSP、镜像和模型 benchmark 持续验证的平台。可证伪条件是后续项目仍只公开 TOPS、模型名称和演示视频,而不公开功耗、温度、相机数、控制频率与失败 trace。参考来源

  • 国内平台指标:今天的观察不等于国产端侧 SoC 没有机会,反而给出了更清楚的追赶路径。优先验证 RKNN、BPU、QNN、OpenVINO 和 AXera 工具链能否输出同一套端到端表格:模型版本、量化格式、输入视角、每阶段延迟、峰值内存、持续功耗和异常动作记录。参考来源

评论