最近这一轮国产模型更新,最值得关注的未必是旗舰型号。DeepSeek V4.1 Flash 和 GLM 5.3 Flash 都把百万上下文、Agent、工具调用与原生多模态塞进了 Flash 档,API 单价却压得很低。

过去提到 Flash,很多人的第一反应还是“便宜、快,复杂任务交给旗舰”。这两款模型已经把那条分界线冲淡了。它们的能力足以承担日常开发与知识工作,价格又允许 Agent 多跑几轮。

比起反复争谁更聪明,更实用的做法是给它们安排不同岗位:DeepSeek 负责 Build,GLM 负责 Review。

DeepSeek V4.1 Flash:把它放在建造者的位置

DeepSeek V4.1 Flash 于 2026 年 9 月 10 日发布。它是一个 552B 总参数的 MoE 模型,输入阶段激活 8B 参数,输出阶段激活 16B 参数。新架构把推理成本继续压低,同时保留了 100 万 token 上下文与最高 384K 输出。

这次 Flash 最醒目的变化是 Agent 能力。DeepSeek 公布的结果里,V4.1 Flash 在 Terminal-Bench 2.1 得到 90.6,DeepSWE v1.1 得到 74.2,NL2Repo-Bench 得到 65.4。厂商评测会受 Harness、工具和推理档位影响,但这些成绩至少说明一件事:Flash 已经能处理完整的软件工程任务,不再局限于补几行代码。

代码、工具与视觉输入放在同一次执行里

模型原生支持图像理解,也支持 Tool Calls、Responses API 和 Anthropic API。网页报错截图、产品流程图、设计稿、终端输出,都可以和代码仓库一起交给 Agent。对开发者来说,多模态的价值不在“看懂一张图”,而在模型看完界面状态后继续改代码、调用工具、运行测试,再根据结果修正。

它适合承担有明确完成标准的建造任务:实现一个功能、跑完测试、追踪 bug、改完失败用例、调用浏览器检查页面。提示词里写清验收条件,并授权它使用必要工具,让它从理解需求一直跑到可验证结果。

1 日常开发用 High

官方把 High 定位为日常 Agent 工作流。功能开发、跨文件修改、常规调试,都可以把它设成默认档。

2 复杂推理切 Max

架构设计、难复现故障、长链路定位再开 Max。简单改动用 Low,可以减少思考 token 与等待时间。

◆ 价格低,长任务仍要盯总消耗

DeepSeek API 使用模型名 deepseek-flash。高峰时段每百万 tokens 的缓存未命中输入为 ¥2,输出为 ¥8;空闲时段分别为 ¥1 和 ¥4,缓存命中最低为 ¥0.02。工作日 9:00 至 12:00、14:00 至 18:00 按高峰价计算,其余时间执行批处理更省。

注意:便宜会降低人对消耗的敏感度。长任务里,反复读仓库、重跑工具和 Max 推理累积得很快。给 Agent 设置验收条件、最大轮次和预算提醒,比只看单次 token 价格更有用。

GLM 5.3 Flash:让第二双眼睛专门找问题

GLM 5.3 Flash 是 GLM-5 系列首个原生多模态模型,拥有 320B 总参数、18B 激活参数和 100 万 token 上下文。它采用稀疏注意力与线性注意力的混合架构,官方数据里,相比 GLM 5.3,注意力计算量约降至三分之一,KV Cache 体积约缩至四分之一。

它同样不是只能处理轻量对话的“小模型”。GLM 公布的结果中,Terminal-Bench 2.1 为 84.3,DeepSWE v1.1 为 63.4,Toolathlon Verified 为 78.4,AutomationBench 为 48.8。图像、视频、文件和文本都可以输入,适合检查网页截图、文档版式、图表与操作结果。

◆ 审查员的能力来自任务设计

把 GLM 放在 Review 位时,不要只发一句“检查代码”。把 DeepSeek 的改动、需求、测试结果和相关截图一次交给它,要求它从反例出发:寻找遗漏分支、可疑权限、未经解释的依赖、性能回退、脆弱测试和超出需求的改动。

同时收紧它的权限。审查阶段默认只读,让它输出问题清单、证据位置、影响等级和建议修复方式,不让它顺手改文件。这样才能保留独立判断,避免第二个模型沿着第一个模型的实现继续补丁。

◆ 国内 API 单价更低

智谱 BigModel 国内标准价为每百万 tokens 输入 ¥0.8、缓存命中 ¥0.23、输出 ¥2.8,缓存存储当前限时免费。它的输入模态包括图片、视频、文件和文本。审查任务通常需要读大量现有代码,输出却只是一份问题清单,这种输入多、输出少的结构正好能利用它的价格优势。

一套能直接执行的 Build + Review 流程

1 DeepSeek 完成建造

给出目标、约束、相关文件与验收命令。默认 High,允许写文件和运行工具,要求它持续处理到测试通过或给出明确阻塞。

2 GLM 独立审查

提供原始需求、变更 diff、测试日志与界面截图。保持只读,要求每个问题都标注文件位置、触发条件和影响,不接受只有风格偏好的意见。

3 DeepSeek 定点修复

把确认有效的问题清单交回 DeepSeek,只修有证据的问题,再运行同一套验收。高风险功能可以让 GLM 复审一次,普通改动到这里结束。

维度

DeepSeek V4.1 Flash

GLM 5.3 Flash

推荐岗位

Build 建造

Review 审查

上下文

100 万 tokens

100 万 tokens

多模态

图像理解

图片、视频、文件、文本

国内 API 标准价
输入 / 输出

¥2 / ¥8(高峰)
¥1 / ¥4(空闲)

¥0.8 / ¥2.8

最适合的任务

写代码、跑 Agent、调工具、修 bug

读 diff、找反例、查风险、核对结果

Flash 的新位置:高频任务主力

这两款模型最有价值的地方,是把强 Agent 能力放到了可以高频调用的价格带。日常开发、工具执行、文档与界面检查,已经没有必要因为“Flash”这个后缀就自动换成旗舰。

如果只保留一个模型,DeepSeek V4.1 Flash 的建造能力、三档推理强度和 Responses API 适配更适合作为默认主力。预算允许保留两个,就让 DeepSeek 负责完成,让 GLM 负责怀疑。模型能力接近时,独立上下文、不同提示词和不同权限,往往比继续争一两个跑分更能提高最终交付质量。