今日必看
VisionPsy-Nano 把小型 VLM 的竞争压到视觉 token 预算
Tether AI Research 在 2026 年 7 月 29 日发布 VisionPsy-Nano 系列:VisionPsy-Nano-460M 主打质量,VisionPsy-Nano-460M-Flash 主打延迟,二者都约 460M 参数、8,192 token 上下文,基于 nanoVLM 的 SigLIP2 视觉编码器、SmolLM2-360M 语言骨干和 pixel-shuffle connector。项目同时给出 Hugging Face 模型卡、Apache-2.0 许可证、Transformers / vLLM 路径、GGUF 量化权重和 llama.cpp 命令,GitHub 仓库在 7 月 29 日更新了 GGUF 下载与本地运行说明。证据阶段是模型权重、代码和项目方 benchmark,不是第三方设备复测。模型卡 Flash 代码
这次新增的关键不是又出现一个 0.5B VLM,而是它把端侧多模态的约束显式写成视觉 token 预算:普通版在 512x512 下写明 1088 个视觉 token,Flash 版压到 64 个视觉 token,并提供 Q4 GGUF 路径。项目方称普通版在同尺寸模型的 17 个公开评测中 16 个占优,Flash 保留约 99% 综合分,同时在 Pixel 9、Galaxy S23、Galaxy S25 Ultra、iPhone 15 的 TTFT 上给出数量级提升;这些数字仍需外部复现,且评测 PR 还在 VLMEvalKit 上游审核中。
一个可辩论判断是:端侧 VLM 的短期胜负不会由“参数量最小”决定,而会由视觉 token、量化格式和本地运行入口能否一起交付决定。若这个判断成立,高通、联发科、Intel、瑞芯微、地平线、黑芝麻和爱芯元智这类平台方会更需要展示真实图片输入下的 prefill、首 token、峰值内存和电量曲线,而不是只给文本模型 tokens/s。反例是,若第三方复测发现 64-token Flash 在 OCR、图表或小目标场景掉点明显,采购仍会回到更大 VLM 或云端服务。后续验证指标是 GGUF 下载量、llama.cpp issue/PR、手机端复测日志、VLMEvalKit PR 合入情况,以及是否出现 QNN、OpenVINO、CoreML、RKNN 或 BPU 的原生部署样例。
这里还有一个容易被低估的产业含义:端侧多模态开始要求模型团队同时交付“模型能力”和“输入管线预算”。过去很多小模型发布只证明权重能下载,工程团队真正移植时才发现图片切块、视觉 token、上下文占用和 KV cache 共同决定首 token 延迟。VisionPsy-Nano 把这些约束提前放到模型卡、GGUF 和 README 中,等于把端侧选型表从“多少参数、多少分”推进到“同一张图进来要多少内存、多久能说第一句话、量化后掉多少点”。这会压缩只做云端 VLM 蒸馏的叙事空间,但不会自动证明它可量产;真正的门槛仍是第三方复测、异常图片集、持续发热和不同 NPU 后端的算子覆盖。
软件 / 框架
OpenVINO DFlash:Intel 社区文章在 7 月 30 日给出 Qwen3.6-35B-A3B W4A16 在 Panther Lake iGPU 上的 DFlash 结果:HumanEval 89.8 tokens/s、2.2x,MT-Bench 1.3x,GSM8K 1.6x;它说明 MoE 也有机会在 AI PC 上继续挤解码效率,但代码写明会进入后续 OpenVINO.GenAI release,目前不能视为已发布 SDK 能力。主来源
llama.cpp b10199:7 月 30 日发布的 b10199 继续提供 Android arm64、Windows OpenCL Adreno arm64、OpenVINO 2026.2.1、Vulkan、CUDA 13.3 等二进制包;本次 release body 主要是测试构建修正,信号在于多后端分发节奏持续。它更像端侧模型发布的基础设施背景,而不是一条新的性能结论。主来源
算法 / 论文
Liquid LFM2.5-Encoders:Liquid AI 在 7 月 28 日发布 230M、350M 两个 encoder,模型卡显示
lfm1.0许可证,博客称支持 8,192 token、230M 在长上下文 CPU 前向约 3.7x 快于 ModernBERT-base,并开源encoder_eval记录模型 revision、依赖和硬件信息;价值在于把分类、路由、规则检查这类常驻任务从生成式大模型里拆出来,局限是 CPU 型号和端侧量化路径仍需补齐。主来源mDenseOn / mLateOn:LightOn 在 7 月 30 日发布 307M 参数 multilingual retrieval 模型,arXiv 论文 7 月 29 日提交,模型、数据与训练脚本均公开,
mLateOn模型卡为 Apache-2.0、支持 ONNX / PyLate;价值在于把长文档、跨语种和代码检索的训练 recipe 公开,让 Agent 记忆和本地知识库不只依赖闭源 embedding 服务,局限是它面向检索而非生成式端侧交互。论文 模型
持续观察
端侧 VLM 验证口径:接下来应优先看 VisionPsy-Nano 的 GGUF 在同一手机、同一图片分辨率、同一量化位宽下与 LFM2.5-VL、SmolVLM2、Qwen3.5-0.8B 的 TTFT、RSS、耗电和错误样例对照。若复测只给平均分、不公开图片类别和失败案例,端侧选型价值有限。GGUF
小模型采购信号:今天几条候选共同说明,端侧模型正在把“可运行入口”前置到模型发布当天:GGUF、ONNX、Transformers、自测 harness 和模型卡许可会直接影响评估成本。后续若 QNN、OpenVINO、CoreML、RKNN、Pulsar2 或 BPU 栈开始在模型卡级别给出可复查样例,小模型才会从社区热度进入真实硬件清单。
反向证伪条件:如果未来两周这些模型只停留在 Hugging Face 热度和项目方表格,没有出现独立设备日志、转换脚本、失败样例和后端 issue,那么今天的判断就要降级。端侧模型发布看起来更完整,不等于硬件平台已经可替换;采购最终仍会要求稳定供包、驱动兼容、温控策略和长时间运行记录。
评论