先说大白话:这个模型到底变了什么?
用最简单的方式讲。
一个AI大模型从"出生"到"会干活",大致要经历两步:
第一步,预训练。
就是让模型疯狂"读书",把互联网上的文章、代码、教科书都读一遍,学会认字、理解句子、掌握基本知识。这时候的模型就像一个读了很多书的大学生,知识面很广,但不会干活。
第二步,后训练。
这就不是"读书"了,而是"练手艺"。比如你想让模型学会修Bug,你就拿成千上万个真实的Bug案例喂给它,让它一次次尝试修复,做对了给奖励,做错了继续练。练多了,它就知道"修Bug应该这样干"。
DeepSeek这次V4-Flash正式版,第一步完全没变,模型还是那个模型,读的书还是那些书。他们只重做了第二步:换了一套更好的"练手艺"方案。
结果呢?同样的脑子,换了训练方法之后,干活能力涨了6倍。
这就像一个班里两个学生,智商差不多,读的课本也一样,但一个老师只让他们背书,另一个老师天天带他们做实战项目。到期末考试时,后者直接把前者摁在地上摩擦。
二、数字不会骗人:到底厉害在哪?
DeepSeek官方公布了9项测试成绩,我们挑三个最直观的来看:
① 修Bug能力:从"基本不会"到"超过一半能搞定"
有一个叫DeepSWE的测试,专门考AI能不能独立修复真实开源项目里的Bug。以前V4-Flash预览版只能修好约7%的Bug——基本等于不会。现在正式版修好了54%,超过一半的Bug能自己搞定。
什么意思?以前你让AI帮你修代码Bug,10次里9次要你自己动手。现在差不多有一半的情况,它能自己修好,还修得对。
② 命令行操作能力:逼近满分
有个叫Terminal Bench的测试,考核AI能不能像程序员一样在电脑终端里一步步敲命令、装软件、排查问题。正式版拿了82.7分(满分100)。对比一下:Claude最贵的那个版本85分,DeepSeek只差2.3分——但价格是Claude的九十分之一。
③ 全栈开发能力:几乎翻倍
还有一个DSBench-FullStack测试,考AI能不能从零写一个完整的网站——包括前端页面、后端逻辑、数据库。预览版37分,正式版68.7分,翻了近一倍。
打个比方:以前这个模型像一个只会写HTML页面的初级前端,现在它能独立搭出一个带数据库、带登录功能的小网站了。
三、"后训练"到底是怎么做的?拿学开车举个例子
很多人还是觉得"后训练"很抽象。我们换个场景理解——
假设你要训练一个人学会开车:
预训练阶段:给他看一万本驾驶手册、交通法规、汽车构造原理。这时候他理论上知道"红灯停绿灯行""方向盘往左打车子往左转"。但真让他坐进驾驶座,他连刹车和油门都分不清。
后训练阶段:让他实际坐进驾驶座,找个教练陪练。先练倒车入库,练100次,每次停歪了就告诉他"往左回半圈";再练侧方停车,练200次;再练高速变道,练300次……练到肌肉记忆形成,不用想就知道脚该放哪。
DeepSeek的做法就是:不去换一个更聪明的"学员",而是换了一个更好的"教练",设计了一套更科学的练车方案。
这套方案好在哪?它不是让模型做选择题("以下哪项是正确的变道方式?"),而是让模型真的去执行任务("去,把这辆车的Bug修了"),做错了就分析错在哪、重新来。这种"干活→犯错→纠正→再干活"的循环,比死记硬背管用得多。
这就是为什么模型脑子没换,干活能力却涨了6倍——不是它变聪明了,是它终于知道"遇到这种问题该怎么动手"了。
四、那对我有什么用?
说一个最实在的:便宜。
这个模型调用100万个Token(大概相当于让它读完三本《三体》的字数):
- 普通调用:花1块钱
- 如果很多内容之前读过、缓存命中了:花2分钱
有开发者实测,用它跑一小时的代码任务,花了不到一块钱。
同时它的价格只有同级别国外模型的几十分之一。
这意味着什么?以前你让AI帮你做一个自动化工作流,比如每天自动抓取新闻、自动整理成表格、自动发邮件,你可能担心成本太高。现在成本低到可以忽略不计,每小时几毛钱。
对于做内容的人、写代码的人、开小店的人,这个模型就像雇了一个24小时不睡觉、工资几乎为零的"数字实习生"。虽然它不是天才,但大部分基础活它能干,而且干得越来越靠谱。
五、这意味着什么?大模型比赛换赛道了
过去两年,所有AI公司都在比一件事:谁家模型更大、参数更多。
你1000亿参数,我就2000亿,他3000亿,像军备竞赛一样。
DeepSeek这次用行动说了一句话:别比谁家脑子大了,比谁家训练得更会干活。
这对小公司是个大好消息。你不需要砸几十亿训练一个超大模型,只要后训练做得好,一个中等规模的模型也能在特定任务上干得很漂亮。
DeepSeek还透露了两个信息:V4-Pro正式版预计8月初上线(性能更强的版本);即将实施峰谷定价(早上9-12点、下午2-6点贵一倍,其他时间便宜)。
峰谷定价这个设计很聪明。就像电费一样,鼓励你把不着急的活安排在晚上跑,成本更低。这对做批量处理任务的人特别友好。
六、一句话总结
大模型能力的上限,不取决于脑子有多大,取决于训练方法有多好。
以前大家觉得"后训练"只是锦上添花。
现在才发现,它才是真正决定一个模型"能不能干活"的关键。
对于普通用户来说,最直接的影响就是:你手上的AI工具会越来越"会用"、越来越便宜。一个能干活、又几乎免费的AI助手,正在变成现实。
用最简单的方式讲。
一个AI大模型从"出生"到"会干活",大致要经历两步:
第一步,预训练。
就是让模型疯狂"读书",把互联网上的文章、代码、教科书都读一遍,学会认字、理解句子、掌握基本知识。这时候的模型就像一个读了很多书的大学生,知识面很广,但不会干活。
第二步,后训练。
这就不是"读书"了,而是"练手艺"。比如你想让模型学会修Bug,你就拿成千上万个真实的Bug案例喂给它,让它一次次尝试修复,做对了给奖励,做错了继续练。练多了,它就知道"修Bug应该这样干"。
DeepSeek这次V4-Flash正式版,第一步完全没变,模型还是那个模型,读的书还是那些书。他们只重做了第二步:换了一套更好的"练手艺"方案。
结果呢?同样的脑子,换了训练方法之后,干活能力涨了6倍。
这就像一个班里两个学生,智商差不多,读的课本也一样,但一个老师只让他们背书,另一个老师天天带他们做实战项目。到期末考试时,后者直接把前者摁在地上摩擦。
二、数字不会骗人:到底厉害在哪?
DeepSeek官方公布了9项测试成绩,我们挑三个最直观的来看:
① 修Bug能力:从"基本不会"到"超过一半能搞定"
有一个叫DeepSWE的测试,专门考AI能不能独立修复真实开源项目里的Bug。以前V4-Flash预览版只能修好约7%的Bug——基本等于不会。现在正式版修好了54%,超过一半的Bug能自己搞定。
什么意思?以前你让AI帮你修代码Bug,10次里9次要你自己动手。现在差不多有一半的情况,它能自己修好,还修得对。
② 命令行操作能力:逼近满分
有个叫Terminal Bench的测试,考核AI能不能像程序员一样在电脑终端里一步步敲命令、装软件、排查问题。正式版拿了82.7分(满分100)。对比一下:Claude最贵的那个版本85分,DeepSeek只差2.3分——但价格是Claude的九十分之一。
③ 全栈开发能力:几乎翻倍
还有一个DSBench-FullStack测试,考AI能不能从零写一个完整的网站——包括前端页面、后端逻辑、数据库。预览版37分,正式版68.7分,翻了近一倍。
打个比方:以前这个模型像一个只会写HTML页面的初级前端,现在它能独立搭出一个带数据库、带登录功能的小网站了。
三、"后训练"到底是怎么做的?拿学开车举个例子
很多人还是觉得"后训练"很抽象。我们换个场景理解——
假设你要训练一个人学会开车:
预训练阶段:给他看一万本驾驶手册、交通法规、汽车构造原理。这时候他理论上知道"红灯停绿灯行""方向盘往左打车子往左转"。但真让他坐进驾驶座,他连刹车和油门都分不清。
后训练阶段:让他实际坐进驾驶座,找个教练陪练。先练倒车入库,练100次,每次停歪了就告诉他"往左回半圈";再练侧方停车,练200次;再练高速变道,练300次……练到肌肉记忆形成,不用想就知道脚该放哪。
DeepSeek的做法就是:不去换一个更聪明的"学员",而是换了一个更好的"教练",设计了一套更科学的练车方案。
这套方案好在哪?它不是让模型做选择题("以下哪项是正确的变道方式?"),而是让模型真的去执行任务("去,把这辆车的Bug修了"),做错了就分析错在哪、重新来。这种"干活→犯错→纠正→再干活"的循环,比死记硬背管用得多。
这就是为什么模型脑子没换,干活能力却涨了6倍——不是它变聪明了,是它终于知道"遇到这种问题该怎么动手"了。
四、那对我有什么用?
说一个最实在的:便宜。
这个模型调用100万个Token(大概相当于让它读完三本《三体》的字数):
- 普通调用:花1块钱
- 如果很多内容之前读过、缓存命中了:花2分钱
有开发者实测,用它跑一小时的代码任务,花了不到一块钱。
同时它的价格只有同级别国外模型的几十分之一。
这意味着什么?以前你让AI帮你做一个自动化工作流,比如每天自动抓取新闻、自动整理成表格、自动发邮件,你可能担心成本太高。现在成本低到可以忽略不计,每小时几毛钱。
对于做内容的人、写代码的人、开小店的人,这个模型就像雇了一个24小时不睡觉、工资几乎为零的"数字实习生"。虽然它不是天才,但大部分基础活它能干,而且干得越来越靠谱。
五、这意味着什么?大模型比赛换赛道了
过去两年,所有AI公司都在比一件事:谁家模型更大、参数更多。
你1000亿参数,我就2000亿,他3000亿,像军备竞赛一样。
DeepSeek这次用行动说了一句话:别比谁家脑子大了,比谁家训练得更会干活。
这对小公司是个大好消息。你不需要砸几十亿训练一个超大模型,只要后训练做得好,一个中等规模的模型也能在特定任务上干得很漂亮。
DeepSeek还透露了两个信息:V4-Pro正式版预计8月初上线(性能更强的版本);即将实施峰谷定价(早上9-12点、下午2-6点贵一倍,其他时间便宜)。
峰谷定价这个设计很聪明。就像电费一样,鼓励你把不着急的活安排在晚上跑,成本更低。这对做批量处理任务的人特别友好。
六、一句话总结
大模型能力的上限,不取决于脑子有多大,取决于训练方法有多好。
以前大家觉得"后训练"只是锦上添花。
现在才发现,它才是真正决定一个模型"能不能干活"的关键。
对于普通用户来说,最直接的影响就是:你手上的AI工具会越来越"会用"、越来越便宜。一个能干活、又几乎免费的AI助手,正在变成现实。
热门跟贴