端侧 AI 与机器人技术雷达|2026-07-31
今日必看 VisionPsy-Nano 把小型 VLM 的竞争压到视觉 token 预算 Tether AI Research 在 2026 年 7 月 29 日发布 VisionPsy-Nano 系列:VisionPsy-Nano-460M 主打质量,VisionPsy-Nano-460M-Flash 主打延迟,二
今日必看 VisionPsy-Nano 把小型 VLM 的竞争压到视觉 token 预算 Tether AI Research 在 2026 年 7 月 29 日发布 VisionPsy-Nano 系列:VisionPsy-Nano-460M 主打质量,VisionPsy-Nano-460M-Flash 主打延迟,二

VLM与LLM 如果说我们有一张图片、一个图表想让大模型来帮忙理解那应该要怎么实现了? 标准的LLM语言大模型只能处理文本序列,是不能够读取图像的,如果没有办法将视觉的数据转换为LLM

背景 计算机视觉领域,一直都是卷积天下。传统的卷积神经网络(CNN)依赖于卷积核提取局部特征,效果很好,但是也有一些不足,如需要人工设计卷积结构包括卷积核大小和层数,另外就是难以捕捉
环境安装 pip install -e ".[smolvla]" 在原来lerobot的环境基础上。 启动训练 本文主要是记录复现lerobot smolvla策略的效果,为了快速看到效果,这里不进行采集数据了,直接用此前ACT采集的数

概述 在http://www.laumy.tech/2458.html#h37章节中,介绍了transformer的原理,本章用pytorch来实现一个将"我有一个苹果&q
简介 Dataset和DataLoader在pytorch中主要用于数据的组织。这两个类通常一起搭配处理深度学习中的数据流。 Dataset 用于产出“单个样本”:定义怎么按索引取到一个样本,以及总

维度是什么 维度=数据需要“几个”索引才能定位到一个元素,也叫做轴数(axis)或阶(rank)。 可以看成"套盒子"的层数,盒子里面装盒子,再装数字。每多一层外括

概述 框架 以翻译作为例子,从宏观角度理解大模型,可以把大模型视为一个黑匣子,它可以输入一种语言然后输出另外一种翻译语言,如下图所示。 如果将模型稍微展开一下,模型分为encoders和
SLAM 2D 激光:slam_toolbox (1)安装启动 sudo apt update sudo apt install ros-jazzy-slam-toolbox ros2 launch slam_toolbox online_async_launch.py (2)输入输出 ros2 node info /slam_toolbox …
配置类ACTConfig @PreTrainedConfig.register_subclass("act") @dataclass class ACTConfig(PreTrainedConfig): # 输入/输出结构 chunk_size: int = 100 # 动作块长度(每次预测的动作序列长度) n_action_steps: int = 100 …

基本原理 简单总结一下什么是ACT算法。传统的机器算法过程是观测关节位置J1经过模型预测动作A2然后执行,观测到J2预测数A3,观测到J3遇到A4依次类推,这样就有一个问题,假设预测