打开网易新闻 查看精彩图片

同一周,AI 圈其实在打两套牌:

  • 阿里讲:能干多久(Qwen 官方案例约 16 天编程)
  • DeepSeek 讲:能干多便宜

更扎心的是第二套。

据外媒与评测口径发酵:DeepSeek V4-Flash 在 Agent 相关表现上,被报道 超过自家更大的 V4-Pro 预览
同时有测算称,平均每个任务成本大约 3 美分——大约两毛人民币量级。

翻译成人话:

不是「更大一定更强」,
而是 小一档、训练得更懂干活,还便宜到让老板心动

为什么普通人该看一眼?

  1. 用得起:以前前沿模型像奢侈品,现在有人把「单次任务成本」打到咖啡钱以下。
  2. 选型变了:公司不一定天天上最贵的;高频小事走便宜模型,难事再上旗舰。
  3. 卷的是后训练:参数没暴涨,却把 Agent 分数打上去——说明「会不会干活」能被专门练。

冷静三句,防被带节奏:

  1. 高分有的来自厂商自家评测环境,第三方复现要另看。
  2. 便宜不等于零风险:错一次修的成本,可能比省下的 token 贵。
  3. 「小干翻大预览」≠ 永久碾压所有闭源旗舰,别听成神话。

我写这类热点,习惯把「钱」和「坑」放一起讲。
也会用墨衍顺手看选题和 GEO——不是硬广,是想少发无效更新。

你觉得呢:
以后公司是继续堆最贵模型,还是 能省就省、难事再上旗舰?评论区聊聊。