Tether AI Research 正式发布 VisionPsy-Nano 系列视觉语言模型,参数量控制在约 4.6 亿,目标就是塞进你口袋里的那台手机。整个家族开出两个变体:VisionPsy-Nano-460M 主攻精度,VisionPsy-Nano-460M-Flash 则把首次生成令牌的响应速度和内存占用放在第一位。

模型权重已上架 HuggingFace,开发者可直接下载。

打开网易新闻 查看精彩图片

在同等量级约 5 亿参数的视觉模型中,VisionPsy-Nano-460M 的统治力几乎是一边倒。与 LFM2.5-VL-450M、SmolVLM2-500M 以及同一团队此前发布的 nanoVLM-460M-8k 基座相比,它在 17 个基准里拿下 16 个第一,整体归一化得分在同级别中最高。这种领先不是靠某一项古怪指标刷出来的,而是覆盖了文档理解与 OCR(73.9)、视觉感知(61.5)、推理与知识(52.2)、指令遵循与可靠性(65.1)四个能力大类。尤其在小模型通常最容易崩盘的推理与知识类,它比第二名同尺寸模型高出 7.4%;视觉感知高出 4.6%。

更值得留意的是跨级表现。当把比较对象放宽到 0.75B 到 1B 参数级别的模型时,这颗 460M 参数的小模型在三个完整基准上,直接击败了所有被测的更大选手,包括苹果的 FastVLM-0.5B(实际 759M)、Qwen3.5-0.8B(873M)以及 InternVL3.5-1B(1061M),后者的参数量是它的 1.6 倍到 2.3 倍。在 MM-IFEval 这类衡量模型是否真的遵从用户指令的基准上,它压过了所有更大模型。这个维度的胜出,意味着从“能拿来搭产品的模型”到“需要不停盯着修正的模型”之间,划出了一条清晰的界限。

而 Flash 版本解决的是一种更实际的体感问题:你举起手机、打开摄像头之后,要等多久。手机端视觉是否“可用”,并不取决于模型体积,而是取决于视觉令牌的处理时间。Flash 将视觉令牌数量从完整模型的 1088 个压缩到 64 个,同时把质量保持在近乎相同的水准——归一化得分 61.4,对比完整版的 62.3,相差只有约 1%。

在真实手机上,使用量化后的 GGUF 构建版本并以 512×512 分辨率实测,差异立竿见影。对比 nanoVLM-460M 和 SmolVLM2-500M,Flash 的首次令牌响应速度快了 11.9 倍到 25.1 倍;对比 LFM2.5-VL-450M 和 Qwen3.5-0.8B,在不同设备上仍然快出 1.3 倍到 3.5 倍。内存峰值同样大幅下降:Android 端下降 24% 到 39%,iPhone 15 端下降 41% 到 65%。

VisionPsy-Nano 并不是把云端模型裁切到勉强能在手机上勒紧腰带运行。从项目一开始,在设备端本地运行就是最高设计约束,这直接左右了所有技术决策:参数预算的划定、Flash 视觉令牌预算的收缩、对单图查询场景的优化取向,以及随完整精度权重一并发布的量化构建。手机分配给单个应用的内存通常只有一小块 RAM,也不存在独立显存,因此一台要真正活在手机里的模型,必须够小、可量化、首令牌响应极快。VisionPsy-Nano 从架构基因里就是为此而建的。