一个开发者在RTX 5070上跑Falcon3-10B,用自己写的Triton后端把解码速度从9.89 tok/s推到了97.5 tok/s,快了近10倍。但评论区最高亮的回复不是夸优化牛,而是“这模型已经1.58岁了,Qwen3.5-4B和9B随便哪个都比它强”。这个实验最有价值的不是速度数字,而是把选模型和选显卡的权重彻底摆在了台面上。

实验做了什么

7月27日,一位开发者在Reddit r/LocalLLaMA发帖,分享了他为Falcon3-10B-Instruct-1.58bit模型写的Triton推理后端。在单张RTX 5070上,他用混合打包解码方案跑出了97.51 tok/s,预填充426.63 tok/s;而同一张卡用HuggingFace原生Transformers BitLinear跑,解码只有9.89 tok/s,预填充298.72 tok/s。加速比接近10倍,并且生成的所有token与基准完全一致—— 这不是用精度换速度的粗糙优化,而是一次严格保真的工程改造 。

简单理解:通过定制Triton后端,RTX 5070在Falcon3-10B上的解码速度从不足10 tok/s跃升到近百tok/s,且输出与标准实现完全一致。针对Falcon3-10B这种低量化模型,RTX 5070在定制优化下可以跑出接近100 tok/s的实用速度。但不同10B模型对显存和算力要求不同,通用工具链下的速度仍需实测。97.51 tok/s意味着对话几乎感觉不到延迟,但这一结果基于单一GPU和单一软件栈,不能直接推广到所有10B模型。

打开网易新闻 查看精彩图片

评论区才说到了根上:模型太老了

帖子最热门的评论只有一句:“这模型大概1.58岁了,连Qwen3.5-4B和9B都超过它。”确实,根据评论区调侃说法,Falcon3-10B已是“1.58岁”的老模型——在本地AI领域,一年半足够迭代两代。有用户评论指出,Qwen3.5-4B仅4B参数,但已超越Falcon3-10B;而Qwen3.5-9B表现更优(此说法基于社区使用经验,未在本文中独立验证)。

就在另一篇本地AI系列文章中,我写过RTX 3050 Ti跑2B模型96 tok/s的实验。当时2B模型受限于能力天花板,只能做简单助理;而现在5070跑10B, 在这个特定1.58-bit量化下终于不撞显存墙 ,结果发现这10B的能力还不如一个4B新模型。 模型的代际进化比显卡更激进,选新不选老 。

如果你有RTX 5070,当前该关注什么

别被“97.5 tok/s跑10B”的炫技带偏。根据社区反馈,像Qwen3.5-4B、Qwen3.5-9B这些较新的模型,在多项任务上已优于老模型,值得优先尝试。但请注意:这些模型在RTX 5070上的具体解码速度、显存占用和实际任务表现,本文并未实测。建议你根据自己的使用场景,用少量样本先在自己环境中测试,确认满足需求后再正式部署。

上手本地模型的门槛已经很低:装好Ollama后,终端执行 ollama pull qwen3.5:4b (或9b),就能直接对话。无需配CUDA版本,无需编译自定义内核,Ollama的通用后端虽然达不到97.5 tok/s,但在大多数场景下足够流畅—— 关键是模型能力跟得上你的任务 。

速度很重要,但别被数字绑架

这个实验用到了1.58-bit极低量化、DP4A指令和CUDA Graph,这些技术在日常工具链里并不会自动开启。普通用户用Ollama、LM Studio跑模型,实际速度受后端优化程度影响,极限数字不具备普适性。 你真正应该关注的,不是极限速度,而是模型能不能装进显存、完成你的任务 。

另外,RTX 5070目前二手参考价约4740元(2026年7月17日)。它属于较新的中高端卡,用于本地AI时,12GB显存仍是决定能跑多大模型的门槛。有些任务需要14B甚至更大模型,那可能需要显存更大的卡;但如果你的日常需求在4B-9B范围,5070正好在甜区里。

给实验者的掌声:代码开源,但你不必跟跑

这位开发者把代码和复现指南全部公开,明确说“找的是独立复现,不是星星”。这种开放精神值得尊重。但对于我们这些把本地AI当生产力工具的人, 不用跟着每个定制内核跑分,只需记住:模型比显卡更容易过时 。

你手里用的是什么显卡跑本地模型?是坚持追新模型,还是会把老模型优化到极致?来评论区聊聊你的策略。