今日必看
tau-0-vla 把长程操作的瓶颈推到本体适配层
sii-research/tau-0-vla 在 2026 年 7 月 27 日公开代码、项目页、论文 PDF 和 Hugging Face 权重入口。项目把它定义为带世界模型引导 test-time computation 的分层机器人基础模型:高层策略用记忆选择下一子任务,需要更多推理时用世界模型搜索替代路径;低层策略使用 Qwen3.5 视觉语言骨干、Mixture-of-Transformers 动作专家和 conditional flow matching,在统一 40 维状态/动作空间内执行子任务。README 还写明训练数据规模为 40,115 小时异构真实机器人数据,并提供一个由 AgiBot World Beta 转成 LeRobot v3.0 格式的 Strike the gong 示例子集。证据阶段是代码、模型权重入口和项目方论文/文档,不是第三方真机复现或客户部署。代码 项目页 权重
它和最近覆盖的 OpenETA、Robot Foundation Layer、vla-kernels 不同:OpenETA 强调任务 agent 到真实硬件的执行证据,RFL 把模型到本体适配抽象成接口合约,vla-kernels 盯住 Jetson Thor 上的热点 kernel;tau-0-vla 则把“同一低层策略跨本体执行”写进模型结构和公开部署合同。部署文档明确说 public v1 HTTP serving 只支持 joint-control checkpoint,不支持 EEF serving,并要求 checkpoint 携带 robot name、camera、prompt、dimensions 和 normalization contract。这说明长程机器人模型的竞争点正在从“能否做多步推理”转向“本体状态、动作顺序和服务边界能否被固定下来”。部署文档
一个可辩论判断是:未来几周具身智能平台的分化不会先发生在最炫的高层规划,而会发生在本体适配合同。只要状态维度、相机命名、动作切片、归一化和 SDK 顺序不能被机器校验,40,115 小时数据或更大的模型都很难变成可迁移交付物。反例也清楚:如果第三方只把它当作 AgiBot World 示例和 joint-control server 复跑,不能扩展到 Unitree、Franka、UR 或自定义移动双臂,那么这个项目的价值会停留在研究代码,而不是通用机器人平台层。下一步验证指标是:是否发布真实机器人长程成功率、是否出现非项目方 checkpoint 复现、EEF serving 是否补齐、以及 LeRobot / Isaac / ROS 2 侧是否有人把它的 40D 合同转成可复用 adapter。
这对端侧硬件平台也有直接含义。机器人主控不只是给模型提供算力,还要把相机、关节、夹爪、底盘、时间同步和安全停止组织成模型能稳定消费的合同。NVIDIA Jetson/Isaac 的优势在于部署文档、仿真工具和 TensorRT 路径更容易形成闭环;国产 SoC 或机器人控制器如果只展示峰值 NPU 算力,很难解释同一个策略如何跨不同本体复用。更务实的竞争点,可能是先把本体描述、状态映射、动作恢复、失败日志和回滚命令做成标准产物,让模型团队不用在每台机器上重新猜字段。
因此,今天的重点不是单个模型分数,而是模型包开始要求硬件平台给出可验证的输入输出秩序。谁能把这个秩序做成默认工具,谁就更接近机器人量产前的真实评审表。
新项目雷达
- pi.cpp:
Jinlong-cs/pi.cpp在 2026 年 7 月 28 日提交初始公开版本,README 将其定位为 TensorRT-first 的 VLA/WAM 边缘 GPU 推理路径,覆盖 PI0.5、FastWAM、SmolVLA、SemanticVLA、Evo-1、DiT4DiT、GR00T N1.6、StarVLA 等模型,并给出 Jetson AGX Orin、H200、TensorRT 10.3.0、CUDA 12.6 条件下的项目自报延迟与 LIBERO 400 成功率表;README 写 MIT License,但 GitHub API 未识别独立 LICENSE 文件。代码
pi.cpp 的价值不在于又列出一批 VLA 名称,而在于把模型资产转成固定 ONNX 合同、TensorRT engine、本地 C++ runtime、picpp latency、picpp server 和 closed-loop LIBERO eval。它与昨天的 vla-kernels 方向互补:vla-kernels 更像某些算子热点的加速试验,pi.cpp 更像把多个机器人策略统一塞进同一个边缘部署工作台。局限也很明显,数字仍是项目方自报,真实机器人闭环、功耗、温升、长时间运行和非 NVIDIA 后端都未核验。
- StarWAM:
shaohua-pan/StarWAM是本轮手工核验的另一个非 watchlist 项目,GitHub API 显示 Apache-2.0、7 月 6 日创建、7 月 17 日最后推送,README 称其提供 Wan2.2 / Cosmos-Predict2 backbone adapter、MoT WAM、Shared-DiT WAM、LIBERO 与 RoboTwin 2.0 recipe,并把预训练 checkpoint 放在 ModelScope。它不够新鲜,未进入今日主条;但它和 tau-0-vla、pi.cpp 一起说明,世界动作模型正在从单篇论文转向可组合代码库和评测 recipe。代码
持续观察
tau-0-vla:优先看四个后续信号:Hugging Face 权重是否被第三方下载复跑;AgiBot World 以外的数据是否形成 adapter;public v1 是否补齐 EEF serving;以及 open-loop eval 能否进入真实本体 episode 记录。若这些缺席,分层结构更像论文假设,而不是平台接口。代码
pi.cpp:验证重点不是表格里的最低延迟,而是同一模型在 AGX Orin 上的 TensorRT engine、延迟 JSON、LIBERO episode、CUDA Graph 开关和 QDQ-INT8 回退规则能否被外部复现。若复现成立,Jetson/Thor 之外的瑞芯微 RKNN、地平线 BPU、爱芯 Pulsar2、高通 QNN 和 Intel OpenVINO 也会被迫给出同粒度的部署合同。代码
评论