最近几个月我发现,我订阅的 token 套餐越来越多,但是 token 好像越来越不够用。

也不知道是项目多了,还是各大厂商给的 token 缩水了。

反正钱没少花,token 焦虑反而越来越大了。

直到前几天,阿里发了 Qwen3.8-27B,官方跑分直接媲美 Claude Opus 4.6,还几乎全部是在 Claude Code 上跑出来的,而且开源,随便下载,不要钱。

热度也很夸张。发布 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。编程工具 Cline 宣布,上线仅 4 天,它就成了 Cline 开发者选得最多的本地模型。CNBC 和 The Information 也都专门做了报道。

Hugging Face 趋势榜,Qwen3.8-27B 排第一
打开网易新闻 查看精彩图片
Hugging Face 趋势榜,Qwen3.8-27B 排第一

Ollama,vLLM,SGLang 全是 day-0 支持,连 Cloudflare 都第一时间把它收进了 Workers AI 模型库,AMD 官方也出了 Ryzen AI Max 的部署教程。这个待遇,今年在开源模型里真没见过几次。

这激发了我的兴趣,索性直接把它装进了我的 Mac,实测下它到底有没有网上评价的那么好。

1 . 先说清楚它是什么

Qwen3.8-27B,270 亿参数,稠密模型,啥意思呢,每生成一个字,270 亿参数全员上场干活,不像有些模型只派一小队人。Apache 2.0 协议开源,权重随便下载,商用也不要钱。官方给这代定的调子叫「A New Bar for Coding and Cowork」,主打就是编程和办公协作。

它还有个 2.4 万亿参数的大哥 Qwen3.8-2.4T-A95B,这次权重也一起放出来了,这是 Qwen 第一次把 Max 级别的模型开放权重。不过 2.4T 那个开放权重版是纯文本模型,不带视觉,而且那个体量普通人根本跑不动。27B 才是你能搬回家的那个。

原生多模态,能看懂图片和视频,官方口径连小时级的长视频都能理解。注意,是看懂,不是生成,想让它画图的可以散了。

本地跑边界框检测,框出照片里的鹈鹕
打开网易新闻 查看精彩图片
本地跑边界框检测,框出照片里的鹈鹕

比如上面这个,让模型把照片里的鹈鹕一只只框出来,框得相当准。这种能力放在 agent 流程里很值钱,识图,读文档,看截图写代码,都用得上。

上下文原生 262K,官方说用一种叫 YaRN 的技术能扩展到 1M。你可以理解为,262K 是训练出来的原装量程,1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。所以 1M 目前只是理论值,实测大家跑到的都是 262K。

2 . 为什么都在喊「本地 Opus 4.6」

Opus 4.6 发布时候的体验和断崖式领先,相信用过的人都感同身受。所以现在社区再出什么新模型,第一反应都是拿它跟 Opus 4.6 比,它就是那把尺子。

官方模型卡上的跑分确实吓人。但先说清楚,这些全是官方自己跑的分,先打对折听。

Qwen3.8-27B 官方文本跑分表
打开网易新闻 查看精彩图片
Qwen3.8-27B 官方文本跑分表

SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3。

多模态这边官方口径也不弱,电脑操作 OSWorld-Verified 84.3,文档理解 OmniDocBench 91.1。官方说整体能力超过自家上一代付费模型 Qwen3.7-Plus。

纸面好看归好看,实际体感怎么样?社区这几天的实测结论比较一致:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。

我自己实测下来,模型能力确实还不错,中文写作和基础编程完全没问题,但就是速度慢,比不上云端 API,要是真实做项目,等待时间也是成本。

第三方榜单这边也出来了,Artificial Analysis 的 Agentic Index 刚把它收录进去,51 分,排第 7。

Artificial Analysis Agentic Index 榜单,Qwen3.8 27B 以 51 分排第 7
打开网易新闻 查看精彩图片
Artificial Analysis Agentic Index 榜单,Qwen3.8 27B 以 51 分排第 7

51 分什么概念,比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但它前面还站着 Claude Opus 5,GLM-5.3,Grok 4.6 三个 59 分的。所以准确的说法是,本地模型第一次挤进了这个榜单的第一梯队,离「干翻所有闭源旗舰」还差得远。

另一个专门测 agent 复杂任务的第三方榜单 Agents' Last Exam 也出分了,27B 拿到 42.9%,保住了自家旗舰 Qwen3.8-Max 八成以上的水平,压过 GLM-5.2 和 Seed 2.1 Pro。

Agents' Last Exam 榜单,Qwen3.8-27B 拿到 42.9%
打开网易新闻 查看精彩图片
Agents' Last Exam 榜单,Qwen3.8-27B 拿到 42.9%

注意看这张榜,27B 那一栏底下标的是什么:Claude Code。又是 Claude Code,这个点后面第 5 节细说。

3 . 27B 凭什么塞进个人电脑

这是我觉得最值得讲的部分。

传统的稠密模型,每一层都用全注意力。啥意思呢,你可以理解为模型每读一个 token 都要记一笔账,上下文越长账越厚。这个账本叫 KV cache,很多模型长上下文跑不动,是账本先爆了,不是模型本身装不下。

Qwen3.8-27B 玩了招狠的。64 层里只有 16 层用全注意力,剩下 48 层换成一种叫 Gated DeltaNet 的线性注意力,只保留一个固定大小的状态。相当于别人每笔流水都留着,它只记余额。

效果是,KV cache 大约只有同尺寸传统模型的四分之一。27B 的身板扛 262K 上下文,靠的就是这个。

另外它内置了 MTP,一次预测多个 token,你可以理解为自带一个草稿手,先打草稿再确认,速度白捡一截。

4 . 什么电脑跑得动

直接给结论:

● 24GB 显卡或 24GB 内存的 Mac。 底线入场券,跑 4bit 量化版,大约 17GB。官方还提供了 FP8 版本,一张 RTX 5090 这种消费级游戏显卡就能顺畅跑。

● 32GB 的 Mac。 舒服档,上下文也能开得长一些。

● 48GB 以上。 可以上 8bit,质量接近无损。

● 16GB 及以下的 Mac。 别折腾了,装不下。

速度上要有心理预期,但也不用太悲观,给几个社区实测的锚点:M4 Max 跑 MLX 4bit 大约 23 tok/s,M5 Max 跑优化过的 4bit 加 MTP 能到 50-60 tok/s,RTX 5090 开 MTP 甚至能冲到 90-120 tok/s。入门档 Mac 会慢一些,聊天够用,跑长任务会嫌慢。

这里有个关键变量是 MTP,开和不开速度差接近一倍,RTX 5090 上同一个版本实测从 66 tok/s 涨到 121 tok/s。代价是 MTP 会多吃显存,压缩可用上下文,所以看到谁报了个很高的速度,先问他开没开 MTP。

我自己是 M5 Max 128G,用 Ollama 跑的 4bit 版,实测大概 25 tok/s 左右,聊天和一般任务够用,跑长任务得有耐心。内存完全不是事,跑满 262K 上下文都够。

有人可能会问,4bit 和 8bit 怎么选?一句话:内存够就 8bit,嫌慢就 4bit。4bit 快接近一倍,质量损失日常聊天感知不强,但长推理任务会偶尔露怯。

5 . 配上 Claude Code,才是完全体

开头说了,官方跑分几乎全是拿 Claude Code 跑出来的,所以我认为,这模型目前搭配上 Claude Code 效果最好。

接入也简单,Ollama 原生支持:

Bash

ollama pull qwen3.8:27b-mlx

ollama launch claude --model qwen3.8:27b-mlx

Ollama 官方模型页,Applications 第一行就是 Claude Code
打开网易新闻 查看精彩图片
Ollama 官方模型页,Applications 第一行就是 Claude Code

Ollama 官方的模型页上,Applications 列表第一行就是 Claude Code,这待遇不是所有模型都有的。

两条命令,Claude Code 的后端就换成本地模型了,现在 Claude Code 接本地模型,完全不用担心封号的问题,没有 API 费用,没有额度焦虑,agent 随便跑,token 随便烧,代码不出你自己家门。这就是我说的 token 自由。

对代码不能出内网的公司来说,这基本是目前最值得评估的方案。

提前说个体感上的关键点:拿它接 Claude Code 这种 agent,决定流畅度的其实不是生成速度,是「读档」速度。啥意思呢,agent 每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重新通读一遍才能开工,轮数越多,要重读的东西越厚。

短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。所以拿来当 CC 后端,内存带宽比 tok/s 数字更值钱。我自己接入后的长期体感,跑一阵子再补。

6 . 泼点冷水

新模型发布第一周,吹捧的声音都打对折听。这模型用下来,社区也发现了一些尚待打磨的细节。

国外开发者 Simon Willison 的实测可以当个佐证。默认的 xhigh 推理档位疯狂过度思考,让它画个 SVG 圆圈,它能就「要不要加同心辅助圆」这种问题琢磨半天,一张骑自行车的鹈鹕 SVG 整整想了 21 分钟,烧掉两万多个推理 token,他文章的标题直接就是「很优秀,但默认疯狂过度思考」。

Simon Willison 的实测文章,标题就是「很优秀,但默认疯狂过度思考」
打开网易新闻 查看精彩图片
Simon Willison 的实测文章,标题就是「很优秀,但默认疯狂过度思考」
鹈鹕 SVG 和那句「Was that worth waiting 21 minutes for? Absolutely not.」
打开网易新闻 查看精彩图片
鹈鹕 SVG 和那句「Was that worth waiting 21 minutes for? Absolutely not.」

同一个提示词关掉推理,两分多钟就完事。所以日常使用,建议把 reasoning_effort 调到 medium 或者 low。

社区这边还有两个真实反馈值得说。

一个是 token 消耗。国外有人把 3.8 和上一代 3.6 并排实测,答案质量 3.8 确实赢,10 个任务赢 9 个,但代价是平均 token 消耗几乎是 3.6 的三倍。

这个缺点放在本地跑倒没那么致命,反正烧的是自己家的电,但如果你打算调 API 按量计费,这个账得算清楚。

另一个是知识截止。有人问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。不知道自己不知道,用的时候留个心眼。

另外提醒下,agent 跑长任务记得把输出长度配额开大,官方专门提醒了这点。

1M 上下文前面说了,目前还是 PPT 数字。

7 . 谁该上车

● 手上有 24GB 以上显卡或者 32GB 以上 Mac,想不花 API 钱跑 Opus 4.6 级别 agent coding 的,直接上。

● 公司代码不能出门的,这套方案可以认真评估。

● 电脑 16GB 内存的,看看热闹就好。

● 只是日常问答写作的,你现在用的大部分普通模型就够用,不用换。

说实话,Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。

但它的意义不在今天。

在 token 越来越不够用的时代,本地模型第一次摸到了「能用」的门槛。

按这个速度走下去,完全够格的生产级本地模型,早晚会出现。到那时候,智能不用按月订阅,就住在你自己的电脑里。

这一定是未来发展的方向,未来我们的每个电脑,每部手机都该本地常驻一个 AI 大模型,这对端侧 AI 意味着什么,不用我多说。