这是苍何的第 586 篇原创!

大家好,我是小仓鼠苍何。

现在每天起床第一件事,像一只小仓鼠一样先要偷偷看看自己的 Agent 还剩余多少额度,多少积分。

有时候,随便跑个简单的任务,积分和额度咔咔掉,更有意思的是,有次我在 Codex 中随便问了句话,耗费了劳资 3% 的额度?

?,孙割来了,都得破口大骂,我真的有点 Token 焦虑的感觉了。

打开网易新闻 查看精彩图片

DeepSeek v 4 flash 现在也不禁造了,各大模型公司为了解决像我这样穷光蛋的困扰,也纷纷退出自家的 flash 模型。

阿里爸爸也不例外,最近也推出了最新的 Qwen 3.8-Flash 模型

前天在 X 上看到 Qwen 3.8-Flash 也开源了。

打开网易新闻 查看精彩图片

悄悄研究了下,Qwen 3.8-Flash 是采用全新下一代架构,主模型参数量 125 B,额外配了 51 B 的 N-gram Embedding,每个 token 只激活 6 B 参数。

相比 Qwen 3.7-Plus,训练成本直接降了 90%,每百万 Tokens 输入 1 元、输出 3 元。

而 DeepSeek v 4 flash 当前高峰时期的价格是每百万 Tokens 输入 3 元、输出 9 元。

可能大家对这个体感不是很清晰,你放到 Agent 里面去跑跑,看看余额下降的速度,就体会很深了。

我看阿里自家的 Agent 产品千问办公,也第一时间接入了 Qwen 3.8-Flash,说是想让 Agent 迎来量大管饱时代。

打开网易新闻 查看精彩图片

我偏不信,我要替兄弟们去试试水,看是不是在吹牛逼。

当然如果你也不信,可以自己去玩玩。

我打开千问办公后,就看到有标准和高级两个模式。

仔细一看,标准模式下面写着「秒杀日常任务」。秒杀这个词真是用的好啊,我想产品经理放上这个词上去的时候,一定是面临巨大的压力的,万一测下来,速度一般,那可真是啪啪啪,打脸了,哈哈哈。

打开网易新闻 查看精彩图片

刚好最近刷到一篇 RSI 的行业报告,讲的是 AI 研发自动化加速下的模型、算力与应用机会,感觉挺有意思。

但这篇 PDF 四十多页,我实在没那个耐心一页页读。

打开网易新闻 查看精彩图片

于是我直接丢给千问办公,让它帮我总结。试试速度和效果。

靠,就等了几秒,报告信息、核心论点、支撑数据,全都给我整理好了?

打开网易新闻 查看精彩图片

Codex 里的 GPT 5.6 sol 硬是给我瞪了好几分钟才搞定,你别说,还真挺快的。

于是,我继续让它深入拆解了一下里面的算力测算模型,整理成 MarkDown 文档。

看了一下,模型结构、变量拆解、结构洞察、投资映射都分析到了,真别说,清晰明了。

打开网易新闻 查看精彩图片

整个过程也仅仅耗时几秒,妈耶。

在千问办公这样的 Agent 里,评估消耗最好的方法就是看额度或者积分。

这一套下来我看了眼积分,竟然还没花到 1 个积分 ? ?

打开网易新闻 查看精彩图片

也就是说,一千个积分,我能让它看几百个 PDF?

打开网易新闻 查看精彩图片

我还真不信了这个邪,我直接把一百个科技行业的行业研究报告丢给千问办公。

任务一交代,右侧还能看到任务监控、它调用的技能,还有产物,过程还是挺透明的。

提示词:基于这 100 份报告做横向分析,输出一份 Markdown 综合报告,分析一下这些报告中被反复提及的趋势有哪些,市场规模和增速怎么样,有哪些冷门信号,未来 1-2 年最值得关注的 3 个方向是什么

打开网易新闻 查看精彩图片

等了几分钟,这个报告就好了,我看了一下,分析很详细,总结也很到位。

打开网易新闻 查看精彩图片

可能有小可爱问,这里怎么不是秒杀啊?兄弟,这是 100 份报告,几分钟已经快到离谱了,卧槽。

但是我感觉看着还是有点麻烦,于是让它做了个趋势图表,整体趋势更一目了然了。

打开网易新闻 查看精彩图片

这一整套下来也才十分钟,几个积分?

打开网易新闻 查看精彩图片

请问阿里爸爸,你们是怎么赚钱的?这积分消耗太离谱了吧?我严重怀疑是不是你们看我帅,给我开了白名单,大家也去试试看看情况,回来告诉我。

我还是不死心,我总觉得有点儿假,工作中经常要做 PPT,自己找模板做费时又费力。

我直接把几千字的产品文档丢给它,让它做成 PPT。

它会先问下我大概想要的风格和页数,然后给我一个大纲,我看了一下,没啥问题就让它开干。

打开网易新闻 查看精彩图片

等了一会它就做好了,还能直接在线编辑修改,哪里不满意改哪里。挺方便,但也没啥特殊的。

打开网易新闻 查看精彩图片

效果挺在线的,兄弟们感受下。

打开网易新闻 查看精彩图片

这个效果的话,这一套下来,花了二十多个积分吧。

打开网易新闻 查看精彩图片

刚好 GLM-5.3-Flash 也发布了,我顺手让它也做了一版 PPT。

打开网易新闻 查看精彩图片

GLM-5.3-Flash 的效果也还可以。

打开网易新闻 查看精彩图片

但 GLM-5.3-Flash 这个任务消耗了 200 多个积分,相比起来,千问办公便宜了十倍。

打开网易新闻 查看精彩图片

?不敢相信,再试试水。

前段时间我做了个公众号数据监控平台,功能有了,但 UI 有点丑,我自己又暂时没啥灵感。

我让千问办公帮我重新设计,它会在右侧画布直接给预览效果,哪里有问题也可以直接找到具体元素让它修改,这点和无限画布挺像的。

不过在复杂编程场景下它速度没那么快,而且长时间任务还会出现断掉的情况,但效果还不错。

打开网易新闻 查看精彩图片

最后试试这个场景,财务和行政同学应该深有体会,发票。

发票一多就乱,整理起来头都大了,我直接把活丢给它。

500 份发票单据,让它逐份抽出开票方、收票方、金额、税率、日期、科目归类建议、是否缺发票专用章,最后输出 Excel。

打开网易新闻 查看精彩图片

我还混了 pdf、docx、txt、csv 好几种格式,塞了些乱七八糟的票据进去,它全都整明白了。

有问题的地方也都识别出来了,该标缺章的标缺章,该提示的提示。

打开网易新闻 查看精彩图片

我看有人统计,1000 积分具体能干多少活,也给大家参考一下:

打开网易新闻 查看精彩图片

说实话我挺好奇,又快又省这事,它是怎么做到的。

于是我扒了扒它的原理。

千问办公这个标准模式用的是专属版的 Qwen 3.8-Flash,训练阶段就针对多步规划、工具选择、上下文压缩这些办公场景做了调优,Agent 能力直接点满。

推理阶段,千问办公又给模型定制了 Harness 架构,把吞吐效率拉了上去。

也就是说,模型本身更聪明了,干活的路子也更熟了,每一步少绕弯,Token 自然就省下来了。

打开网易新闻 查看精彩图片

说实话,我算是 Token 重度用户,日常开发、办公、长时间的自动化工作流,24 小时基本都在烧。

以前玩 Agent 总绕不开一个不可能三角,高性能意味着高成本,低成本就得牺牲智能。

所以经常盯着 Token 算账,生怕一个不小心把钱包干穿了。

而这次模 A 协同优化,算是把这个三角掰开了一个口子。

现在感觉 「Agent 的 Token 焦虑,可能真要翻篇了」

当 95% 的日常任务用标准模式就能又快又好地搞定,积分还花不了几个的时候,Agent 才算真正进入了量大管饱的时代。

不过对于复杂任务,建议你还是开启高级模式吧。但对于绝大多数办公任务,秒杀模式就够了。

你最近用什么 Agent 干活?评论区聊聊。