端侧 AI 与机器人技术雷达|2026-07-24

今日必看

Cosmos3-Edge 把世界模型压到 Jetson Thor 的动作闭环

NVIDIA 在 2026 年 7 月 20 日把 Cosmos3-Edge 放到 Hugging Face 的 Cosmos3 仓库中。它不是单纯的视频生成模型,而是 4B 参数的 open world model:模型卡写明它可以从文本、图像、视频和动作轨迹等输入生成文本、图像、视频和动作输出,并包含 Cosmos3-Edge-Policy-DROID、4-step Super 图像/视频蒸馏检查点等版本;许可证为 OpenMDW1.1,模型和 NVIDIA/cosmos 代码仓库同日标注发布。官方文章进一步给出端侧信号:Cosmos3-Edge 被定位为可在 Jetson Thor 侧运行的世界动作模型,面向机器人和视觉 AI agent,把场景理解、未来预测和动作生成放进同一个共享表征。模型卡 发布说明

这条动态的增量在于,NVIDIA 没有只发布一个更小的 VLM,而是在模型卡里直接列出动作输入/输出、DROID policy、Jetson AGX Thor T5000、Jetson T3000、Jetson T2000 和 AGX Orin 等平台的端侧测试表。PBR 表显示,Jetson AGX Thor T5000 在 eager Transformers 下,文本、图像、视频 reasoner 的端到端延迟分别为 3.60 秒、3.17 秒、3.25 秒;Jetson T3000 对应为 4.61 秒、3.83 秒、4.14 秒。Generator 的 vLLM-Omni 表还给出 forward dynamics、inverse dynamics 和 Policy DROID 延迟,但不同任务、分辨率和运行栈不能横向硬比。证据阶段是官方模型、代码和厂商 benchmark,还不是第三方真机复现。

一个可辩论判断是:物理 AI 的端侧竞争可能先从“端到端 VLA 谁更大”转向“谁能把世界预测、动作轨迹和可复现运行表放在同一个模型包里”。这会把 Jetson、DRIVE、RKNN、BPU、QNN、OpenVINO、Pulsar2 等平台的比较指标从 TOPS 和 demo 视频,推向 action chunk latency、视觉输入到动作输出抖动、失败轨迹回放、微调脚本和安全边界。证伪条件也明确:如果第三方在 Jetson Thor 或同级边缘 GPU 上复现不了动作策略延迟和成功率,或者真实机器人仍需要单独的 VLA/控制器接管动作,Cosmos3-Edge 更像一个有工程价值的仿真与数据生成底座,而不是端侧闭环控制入口。

对国内端侧厂商来说,这个信号比“又一个 NVIDIA 模型”更值得拆解。瑞芯微、地平线、黑芝麻、爱芯元智、高通和联发科的短期压力不是立刻复刻 4B 世界模型,而是补齐模型包外的工程证据:输入模态边界、动作表示、运行时 profile、失败样本格式、微调后的回归测试。只要这些证据缺口存在,整机厂在机器人和智能空间项目上会继续优先选择带模型、运行时、仿真和 benchmark 一体化的路线,即便单颗 SoC 的性价比更高。

算法 / 论文

  • RoboTTT:NVIDIA、Stanford 和 UT Austin 的 RoboTTT 论文页显示,该方法把 GR00T N1.7 类 VLA 的视觉运动上下文扩到 8K timesteps,通过 test-time training fast weights 压缩历史,并在真实双臂装配任务上报告相对 single-step baseline 平均提升 87%。价值信号是机器人模型开始把“长上下文”变成控制状态,而不只是语言 token 窗口;局限是目前主要是论文和项目页证据,代码与第三方复现还要继续看。主来源

  • VideoChat3:南京大学等团队 7 月 16 日提交 arXiv 2607.14935,项目页称其 4B video MLLM 使用 I3D-ViT 与 adaptive frame resolution,在视频输入上做 16 倍时空压缩,并公开 models、code、data、training recipe。它对端侧有启发:连续视觉理解的瓶颈不只是模型参数,而是把低分辨率观察、高分辨率确认和响应时机做成状态机;但 20.41 秒处理 2,048 frames 的结果是在 NVIDIA H200 条件下报告,不能直接外推到机器人板端。项目页 论文

新项目雷达

  • Thinking Machines Inkling:Inkling 7 月 15 日在 Hugging Face 发布,模型卡显示 Apache-2.0、975B total / 41B active、文本/图像/音频输入和文本输出,模型文件更新到 7 月 23 日;vLLM recipe 给出 1M context、NVFP4、MTP、4x GB200 等部署路径。它不是端侧模型,但会影响端侧路线:开权重多模态大模型正把“可下载”与“可运行”分开,真正进入边缘生态要看量化、蒸馏和小模型 teacher 数据能否落地。模型卡 vLLM recipe

持续观察

  • 验证指标:Cosmos3-Edge 后续最关键的不是 star 数,而是 Jetson Thor/T3000 上的第三方 action policy 复现、单任务成功率、端到端温升与功耗、action chunk jitter,以及 NVIDIA/cosmos 是否把 DROID 以外的机器人 embodiment 训练脚本补齐。代码仓库

  • 非共识判断:多模态模型的下一轮端侧价值不会来自“把闭源旗舰能力压小一圈”,而来自能否把视频、动作、失败回放和微调数据变成平台厂商可测试的工程合约。若瑞芯微、地平线、高通、爱芯元智等生态后续仍只展示单模型跑分,不给 action / video trace 级验证工具,NVIDIA 在机器人端侧软件栈上的默认入口会继续扩大。参考来源

  • 反向观察:如果 VideoChat3 这类 4B 视频理解路线在 H20、RTX AI PC、Jetson Thor 或国产 NPU 上被压到稳定低时延,而 Cosmos3-Edge 的动作输出仍停留在厂商样例,那么端侧模型栈会分化为“轻量视频感知 + 传统控制器”与“世界模型一体化”两条路。前者更利好通用 NPU 和 ISP 厂商,后者更利好 NVIDIA 这种能同时控制模型、CUDA/vLLM、仿真和开发板的全栈平台。参考来源

评论