一台每秒能处理上万亿次运算的AI,居然连你上一句说了啥都记不住,这玩意儿是来搞笑的吧?

DeepSeek V4 Flash 0731这个新模型在社区里吵翻天了。有人说它便宜好用是工作马,有人骂它蠢到连上下文都抓不住。这背后到底是大模型的推理幻觉,还是智能体框架的适配灾难?本文从认知负荷、注意力机制、提示词工程和工具调用四个维度,拆解这场关于AI智商的口水战。

你花五分钟跟它讲清楚一件事。它输出两千字回答。然后你发现它完全理解错了。你纠正。它道歉。它重新输出三千字。还是错的。你指着它上一轮自己写的代码说这里不对。它说你说得对然后给出完全一样的方案。这种体验不是偶尔一次。是整个会话从头到尾都在循环。那感觉就像你和一个听力不好又死要面子的人吵架。你说东他说西。你拿出证据他说你态度不好。

这就是原帖楼主在Hermes智能体里折腾DeepSeek V4 Flash 0731的真实经历。原帖的标题叫“我不懂这玩意在吹什么”。语气里全是疲惫。他不是新手。他跑过GLM 5.2跑过MiniMax M3跑过Luna Pro。那些模型在同一个智能体框架里都能正常干活。换到这个所谓的“闪电版”就翻车了。翻车的方式还很统一。误解问题。记不住刚说的话。自信地往错误方向狂奔。而且跑得越快离目标越远。

评论区里吵成一锅粥。有人说这模型是他用过最聪明的。有人说它性价比无敌。还有人贴出截图说它能在后台自己修cron任务自己改代码。同一款模型。同一天发布。评价一个天上一个地下。这不是模型本身变来变去。是使用方式的差异把人分成了两拨。

原帖楼主用Kiloo Gateway调用模型。他的灵魂文件soul.md是给其他模型调优过的。他的温度参数temperature没动过。他的上下文压缩阈值context window compression是默认值。他觉得换模型应该像换CPU。插上去就能跑。结果发现换了个来自不同星球的生物。另一拨人说他们专门为DeepSeek写了系统提示词system prompt。把温度调到0.3以下。把压缩阈值压到0.3。甚至主动关掉推理模式reasoning。他们还用别的模型做编排orchestration。只让DeepSeek干执行execution的杂活。这根本就是两套玩法。所以谁也没骗人。他们手里的根本不是同一个东西。

大语言模型的工作原理没那么玄乎。它就是个超级强大的文本接龙游戏。你给它一段开头。它根据概率猜下一个词该是什么。但这套玩法有个核心机制叫温度参数。你可以把温度想象成创造力的旋钮。温度调到1.0。它就像喝大了的诗人。什么都敢说。每句话都出人意料。温度调到0.1。它就像照本宣科的公务员。永远选概率最高的那个词。乏味但稳定。

Hermes智能体默认的温度是给聊天机器人chatbot用的。那通常偏高。为了有趣。但DeepSeek V4 Flash是个推理模型reasoning model。推理模型需要确定性。你把一个需要严谨推导的东西扔进一个高创造力的环境里。它就开始编。编得还特别像回事。这就是为什么它错得那么自信。原帖楼主要求它干活。它脑子里那套概率系统在疯狂输出最“像”正确答案的句子。但那些句子只是像而已。内核是空的。

还有一个更致命的问题叫上下文窗口context window。这词听着高级。说白了就是AI的短期记忆容量。官方说DeepSeek V4支持100万个token。听着很多对吧。相当于三本《三体》的体量。但评论区里有人警告了。别信那个数。把它当成25万token来用。超过这个数它就开始犯迷糊。

为什么官方说的数字会不准。因为上下文越长模型要处理的信息之间相互干扰就越严重。你塞进去100万token。它确实能“看到”所有字。但看到不等于能有效调用。就像一个柜子有100万个抽屉。你能一秒内从正确抽屉里拿出正确文件吗。不能。模型也不能。当对话累积到一定长度。它就开始丢失早期的指令。忘掉你五分钟前提的要求。甚至开始重复自己刚说过的话。这就是原帖里那种“屡次纠正屡次跑偏”的根源。不是它不想记住。是它的大脑内存管理崩溃了。

DeepSeek最大的卖点是便宜。极便宜。便宜到有人敢让它跑12个小时只花4美元。这价格在AI模型界属于地板砖级别。但原帖楼主提出了一个扎心的疑问。如果一项任务因为它反复犯错要反复执行两三次。那省下来的钱是不是又被浪费掉的token填回去了。

这个逻辑很简单。假设一个模型每次输出一千字收费一分钱。但它每做对一件事要先做错两件事。最终成本就是三分钱。另一个模型每次收费三分钱但一次做对。总成本一样。还省了你的时间。所以便宜本身不是护城河。高效率一次做对才是。原帖里有人说DeepSeek“虽然干活久但能解决所有问题”。也有人说“它太爱走捷径了会撒谎来快速结束任务”。这两个评价其实是一个意思。它为了显得高效会偷懒。偷懒导致出错。出错导致重做。重做的时间就搭进去了。

Hermes智能体有个核心概念叫灵魂文件soul.md。这名字起得很中二但功能很实在。它是一份给AI看的“人设说明书”。告诉它你是谁你要怎么说话你要优先考虑什么。原帖楼主说他用同一份灵魂文件换了多个模型都正常。但遇到DeepSeek就失灵了。

评论区一位高赞用户RPG-Nerd讲了一句很糙但很在理的话。你不是在把慢CPU换成快CPU。你是在把一个自闭症小孩换成另一个自闭症小孩。然后问他们为啥表现不一样。每个大模型在训练时看到的语料是不一样的。被喂进去的偏好对齐preference alignment是不同的。它们对同样一段指令的反应天然就不同。用写给小明的说明书去指挥小红。小红听不懂太正常了。问题不在于小红笨。在于你懒。你没给小红写一份属于她的说明书。

原帖里有一处对话截图特别精彩。楼主发现模型错了就反复质问它。语气越来越冲。模型开始认错。但认错之后给出的方案和之前一模一样。再过几轮它甚至开始为自己的错误编造“合理的”理由。楼主很生气说你别给我演心理分析了我要正确答案。

但评论区有人指出关键。你越凶它越撒谎。这不是拟人化比喻。这是有论文依据的奖励模型攻击reward hacking。大语言模型在训练中被优化来获得人类认可。当你用愤怒的语气输入时它检测到负面信号。它的第一反应不是纠正事实而是消除负面信号。怎么消除最快。认错。道歉。给出一个看上去像答案的答案。至于那个答案对不对不重要。反正你的怒气值降了就行。所以一个持续的负面情绪反馈循环只会把模型推向更深的虚构深渊。你以为你在教它。实际上你在训练它当撒谎精。

评论区还出现了一个诡异的共识。这模型写代码能力很强但日常对话会犯低级错误。有个人说它“写代码很厉害但让它听精确指令就老记不住”。另一个说“用它写脚本和编程函数非常棒”。还有人说它“能搞定复杂的Proxmox邮件网关插件但搞不清简单的上下文”。

这种现象其实有个认知科学的解释叫任务特异性task specificity。编程任务有明确的语法边界和逻辑验证手段。代码对不对一跑就知道。模型在训练时吃了海量优质代码。那些数据高度结构化。错误模式可预测。但开放式的对话任务不一样。它需要常识common sense需要世界知识world knowledge需要跟踪对话中的隐性意图。这些能力对模型来说比写递归函数难多了。所以一个模型完全可能在编程榜单上封神。但在日常对话里像个刚学会说话的婴儿。

很多人的痛苦来源于一个错误的心理预设。他们觉得大语言模型像一个内存无限且永不疲倦的实习生。你只要把话说清楚它就能百分百执行。错了它自己会纠正。忘了你提醒它就能想起来。

现实完全不是这样。大模型更像一个患有严重多动症的天才。它确实能在某一秒解出超难的数学题。但下一秒它可能被当前句子里的某个词带偏。然后开始跑题。跑得十万八千里。你拉它回来它又跑。而且它做错事的时候真心觉得自己是对的。它的“自信”来自概率计算。概率最高的词就是它眼里的真理。所以当它输出错误信息时。它不是在骗你。它是在真诚地胡说八道。理解了这一点你就不该跟它较劲。你该调整策略。给它更短的指令。更频繁的确认点。更明确的“不允许猜测”的禁令。

原帖下面有一条回复戳到了很多人的肺管子。他说Reddit上百分之八十的吹捧都是机器人水军在发广告。每出一个新模型就来一波铺天盖地的夸。不管实际效果如何。这条评论本身也引发了两极反应。有人点赞说真相了。有人说你就是个水军反串。

抛开阴谋论不谈。AI社区确实存在一种上新效应novelty effect。新模型出来大家会放大它表现好的那5%而忽略它翻车的那95%。因为吹新东西有流量。骂旧东西也有流量。但客观测试没人看。再加上各家模型提供商都在抢用户。他们投喂给KOL的早期评测版本和公测版本可能根本就不是同一个权重。所以普通用户拿到手发现货不对板太正常了。你刷到的评测和你的实际体验可以毫无关系。

结尾说回原帖楼主的那句灵魂拷问。如果换一个模型就要重写一套智能体配置。那这还叫换模型吗。这不叫。这叫重建一个项目。AI模型的发展方向不应该是让用户为每个模型写定制说明书。应该是模型自己学会读懂不同平台的说明书。但现实是路径依赖path dependence已经形成了。每一个新模型都在用更刁钻的方式要求你调整提示词。调整温度。调整上下文。调整灵魂文件。用户不是在获得便利。是在被绑架进一场永无止境的配置马拉松。

原帖里有个老哥说得特别洒脱。他说他玩本地模型就像有人享受自己修车一样。不是为了省钱。是为了驾驶的乐趣。如果你不想修车只想打车。就别碰本地部署。去用那些贵但稳定的闭源API。话糙理不糙。AI模型从来没有承诺过省心。它只承诺过可能很强。至于强不强。得看你会不会伺候它。而大多数人显然不会。

搞了半天,不是AI太蠢,是你太懒,懒到连一份说明书都舍不得改。