本期节目的嘉宾逯雨鑫是 Mind Lab 的研究员。此前,他以个人开发者的身份,仅花费数百美元,后训练出了两个登顶 Hugging Face Model Trending 榜的模型。

本期播客原文约 15000 字,本文经过删减整理后约 4800 字。

打开网易新闻 查看精彩图片

曲凯:今天大多数人还是觉得训模型是一件非常难的事情,不知道有哪些步骤、具体该怎么做。大家印象中,训模型的人一般也都是各种 PhD、researcher 之类的。但雨鑫你其实不是 AI PhD,此前也没有 AI Lab 的训练经验,为什么能训出两个登顶 Hugging Face 开源模型榜首的小模型?

打开网易新闻 查看精彩图片

雨鑫:其实要训出能在工业界用起来的模型,路径是很明确的,没有大家想象中那么难。只要自学一些基础,再加上现在各种 AI 工具的加成,很多人都可以做到。

曲凯:你训练这两版模型,大概花了多少时间和钱?

雨鑫:第一版花了 5 天左右,第二版时间长一些,大概两三周,然后总共花了几百美元。硬件上,我就用了一张 5090。现在租一张 5090,每小时可能只要一两美元,真正训练一次也就是十几个小时。即便迭代几版,硬件成本也不会超过 100 美元。软件上,我用了一个 200 美元的 Claude Max Plan,主要用来合成目标领域的数据。

曲凯:最后训练出来的效果怎么样?

雨鑫:我的模型主要针对 agentic 场景,把对应的 benchmark 从底座模型的 15 分提升到了 55 - 60 分左右。

不过,个人或应用公司训练模型,往往需要做一些取舍。在资源有限的情况下,你可以让模型在目标能力上变强,但其他 benchmark 或多或少会下降。

曲凯:我能不能简单理解成,你的做法就是用更强的 teacher model 生成数据,通过 SFT 蒸馏出一个特定领域的小模型,让它在某些任务上比原来的底座更强?

雨鑫:是的。

曲凯:这听起来并不复杂,但为什么这件事还没有大众化?是我们有盲区、其实很多人已经在做,还是确实做的人不多?

雨鑫:确实没有那么多人做,最主要的原因是大家认为它非常复杂。但其实这件事的流程没有那么难,总共可以分成五步。

第一步:明确自己要做什么。

很多个人开发者上来会先追热点,或者盲目刷 benchmark。但更应该从自己的真实需求出发,想明白要提升模型哪方面的能力。我的项目能火起来,就是因为抓住了有真实需求的场景,选定了 coding 和 agentic 这两个方向,所以模型发布后有很多下载和使用。

第二步:选底座模型。

这里要考虑模型架构、语言能力和具体场景。比如我用的是 Gemma 4 12B,当时就遇到了一些问题,比如它的中文能力比较差、有时会说粤语,而且架构没那么主流,训练过程会很麻烦。

我个人体感上,Qwen 是坑相对比较少的开源模型。

第三步:设计数据管线。

我用到的数据大概有三类:一种是合成数据,就是让一个模型扮演用户,另一个模型回答;一种是开源数据,在 Hugging Face、ModelScope 这样的平台上其实有很多;还有一种是自己或其他真实用户的使用轨迹。我自己用到的真实数据,很多是关注我这个模型的用户主动贡献的。

然后我有一个比较大的经验是,合成数据可能没有那么好,它更像靶向药,适合定向解决某个问题。实际训练时,我 60% - 70% 还是用的真实轨迹数据,遇到具体问题时才用合成数据。

举个例子。我训练时会遇到模型过度自信的问题,就是跑 benchmark 时,模型明明没有真的完成任务,却说自己完成了。要解决这个问题,很难从公开或者日常使用数据中找到合适的选择,就得有针对性地去合成。

第四步:决定训练方法。

现在工业界比较流行的有两种做法,一种是 SFT,简单来说就是把 teacher model 的能力蒸馏到小模型里,实际效果取决于数据质量;另一种是 RL,被吹得很神,但我个人觉得效果不如前者。

当然还有很多别的方法,比如 OPD(Off-Policy Distillation)。但我感觉 RL 和 OPD 的成本都比较高,更适合锦上添花。对很多应用公司和个人来说,SFT 配上好的数据,就已经能完成很多工业场景里的目标了。我自己也是只选择了 SFT 去训练。

第五步:用特定的 benchmark 测试效果并迭代。一版训练出来的效果不好,就从错题和失败轨迹里找原因,调整数据,再训练下一版。

这整套流程并不复杂。过程中需要的训练脚本、数据、benchmark 和环境等,基本都有开源或第三方服务的解决方案。你可以去找合适的方案,把代码拉下来,再借助 agent 改成适合自己模型的版本。实际训练也很快,几个小时就能跑一版。

其中最大的、甚至唯一的难点和卡点就是数据。我自己 95% 的时间都花在这一环。

曲凯:具体难在哪?

雨鑫:难在你得看懂数据出了什么问题,以及该用什么数据去改变它。

拿合成数据来说,现在的模型还不能稳定地合成高质量数据,需要大量人工审核。我做 V2 时花了更多时间,主要就是因为要审数据。假设合成了 5000 条数据,我可能要自己抽查 500 条,然后告诉模型有什么问题,让它重新生成,再继续检查。

曲凯:那你总共用了多少条数据?

雨鑫:我总共整理了接近一万条数据,清洗、筛选之后,用于训练的有几千条。对特定领域的小模型来说,这个量就已经可以产生明显效果了。

曲凯:我们之前和人交流时,经常听人讲,你没办法预先评估数据的效果,都得拿去训练,再回头改。你的经验是怎样的?

雨鑫:这件事确实没什么捷径,只能不断测试和迭代。而且一版没有达到预期非常正常,继续做就好了。

如果你看数据就知道它有问题,那这版训练大概率也不对。

而且即使你和 AI 都检查过,自己抽样也觉得很好,训练出来仍然可能有问题。这背后的一个重要原因是 capacity gap,也就是 teacher model 太强、学生太弱。比如你要把一个 3T 的模型蒸进一个 12B 小模型,很多能力小模型根本学不来。

曲凯:那怎么评估蒸馏的好坏?从工业级角度看,是不是怎么有效、怎么成本低就怎么来?那最基础、最简单的所谓「硬蒸」,是不是反而最好?

雨鑫:评估数据和蒸馏的标准是一样的,就是看你的操作和目标是不是对齐的。

举个例子,假设你想提升模型的安全边界,却只围绕 benchmark 做数据,那即使分数涨了,也不算好的蒸馏。相反,只要你知道自己想做什么,最后也真的把模型的分布往那个方向拉了,即使其他 benchmark 掉分,也是好的蒸馏。

曲凯:明白。那一家公司自己训练一个小模型,大概要多少钱?

雨鑫:几千到一万元人民币以内,就能训练出一个比较符合需求的小模型。如果要训练大一点的模型,卡量就得跟上,可能需要十几万到二十万元。

不过这里说的只是训练成本。真正部署给用户调用是 serving 端的事,里面还有很多坑,需要考虑 infra 架构、并发量和硬件等问题。如果只是几路或十几路并发,我估计一个小模型加一台 H200 就够了。

曲凯:那你觉得未来训练模型会不会变成中大型公司的标配,就像互联网时代都要做前后端一样?

雨鑫:我觉得会。中大型公司配一个三四人的小团队就行,成本主要就是这几个人的工资以及显卡。

小公司如果暂时没预算,可以先找 AI Lab 或第三方服务商合作。等自己的应用真正起来,有了几百万、几千万用户,再组建内部 AI 团队。

不过,我觉得自己训练模型的成本还会继续下降。现在显卡和内存价格还在高点,部分原因是供应没有跟上 AI 的需求。但随着供应跟上,显卡可能像早期的手机流量一样,一开始很贵,后来越来越便宜,最终甚至成为不限量的基础设施。

曲凯:既然每个环节都有第三方或开源方案,为什么还没有人把它们整合成一套完整的 pipeline,让普通人不用学习每个环节,也能训练出自己的小模型?

雨鑫:训模型可能确实会逐渐商品化,你说的也是很多公司都想做的事。其实海外也已经有 Unsloth 这样的公司。包括 Hugging Face 上的 Jobs 平台,也在做这件事。

目前这种服务的价格还不算便宜,infra 和 serving 也有不少问题。而且即便有这样的方案,数据仍然是最重要的一环。训练脚本可以标准化,但理解业务、发现模型的问题、知道该造什么数据,还是需要人来做。

曲凯:那未来 AI 应用公司和模型公司之间的关系会怎么变化?

雨鑫:我觉得 AI Lab 的数量会减少,但少数头部 AI Lab 仍会成为赢家,并掌握很高的价值。一方面,pre-training 依然得有 AI Lab 来做,因为这件事非常吃资源,应用公司未必能搞定。另一方面,很多早期应用公司得先把产品跑起来,再组建团队训练模型。那在此之前,这些公司还是要找 AI Lab 提供服务。

曲凯:你描述的好像还是当下的状态?但如果按照我们刚刚的推理,未来会有很成熟的训练模型的解决方案,应用公司训练模型的门槛可能会比你刚刚讲的低很多?

以及我自己的感觉是,现在 AI Lab 在明确追求更高 level 的事情,比如解决诺贝尔级别的科学问题、AI4S 或具身等问题,或者解锁一些我们现在没想到的场景。而对于很多日常场景来说,也许大家基于开源模型做一个内部模型,就够用了。

所以最近美国红杉也在讲,AI 应用公司未来反而会变成 Neo Lab。

雨鑫:是。至少后训练很可能逐渐被应用公司接管,因为应用公司离用户更近,拥有最真实的数据,也不愿意把自己的核心数据交给别人。那么行业里领先的应用公司,确实可能会长成 Neo Lab 的样子。而且其中的中大型公司,甚至也可能向更小的公司提供 API 或 token plan。

曲凯:这很像推荐算法时代发生过的事情。字节这样的公司是先有应用、场景、商业闭环和用户数据,才有了更好的推荐算法。你很难找到一家第三方公司,说我只做推荐算法。

这也解释了为什么 AI Lab 愿意花很多钱买数据。现在很多人可能还没有意识到数据的价值,就像移动互联网早期,大家不理解为什么公司要花很高的成本买用户,后来才发现越早获取,成本反而越低。

雨鑫:对。AI Lab 买数据,其实就是想知道用户会提出什么问题、AI 在真实场景里怎样完成任务。所以有些公司让用户免费体验新模型,一方面是为了宣传,另一方面也是为了收集真实使用数据,用来迭代下一代模型。

曲凯:是。然后过去一段时间一直有个论调,觉得模型好像会吃掉一切,应用公司的价值很低。前几周,我们录了一期复盘 AI 应用的节目(回顾:),当时我也比较悲观。

但最近聊下来,我反而觉得 AI Lab 和应用公司的价值都在上升。未来某个时间点,模型的价值可能会逐渐向应用公司让渡。

最后我们再聊聊 Local AI 吧。你觉得这会是一个 PC 级别的机会吗?因为计算机刚出现时,一台机器可能要占满整个房间,后来变成每个人都有一台 PC。AI 会不会也从全球只有几家大模型公司,走向每个人都有一个运行在电脑、手机或其他端侧设备上的模型?

雨鑫:我觉得一定会,而且已经在往这个方向发展。

一个非常重要的驱动力就是数据安全。你在调用上游 API 时,数据一定要流经服务提供方。所以对数据敏感的个人和公司会越来越倾向于 Local AI。这里也提醒大家,一些来路不明的中转站价格看起来很便宜,但存在很大的数据泄露风险。

这可能也是为什么千问一直在发布小模型。随着芯片和统一内存继续升级,本地能运行的模型会越来越大,能力也会越来越强,未来很多人都会有自己的本地模型。

陈皮:抱歉我插个问题。我是陈皮,在42章经做内容。我想问,用户最终会不会还是会追求 SOTA?假设 OpenAI、Anthropic 一直在发布最前沿的模型,即使本地模型已经足够完成日常工作,人们真的愿意使用一个离 SOTA 还有差距的模型吗?

雨鑫:这确实是 Local AI 现在最现实的问题。我自己的 Local AI 使用率也不算高,因为它确实还会犯错,能力没有最前沿的模型强。

但 Local AI 的优势有三点:

一是前面提到的,很多人对数据隐私的需求确实很强烈;

二是在一些领域,比如网络安全、生物领域,SOTA 模型会有拒答的问题,所以即使本地模型不是 SOTA,一些用户还是愿意使用,或者说不得不使用;

三是本地模型更便宜。举个例子,我很喜欢武侠小说,会想用 AI 续写或者改编,但这种任务的 token 消耗特别大。如果全部调用 API,成本可能非常高,而用 Local AI 就不太需要额外支付 API 成本,很划算。

曲凯:我补充一个思考角度,就是对用户来说,到底什么算是 SOTA?今天模型能力已经足够解决很多问题了,那继续追求更好的模型,从性价比上未必一直 make sense。就像很多人觉得 4G 已经够用,不一定非要 5G、6G。

雨鑫:不过很多人确实会盲目追求最强的智能,不管自己是否真的需要。

曲凯:但我觉得,最后可能还是豆包这样的产品用户更多。真正关心模型极致能力的人还是少数,大多数用户更关注产品用起来方不方便、性价比是不是足够高。而且 Local AI 未来也未必需要人主动选择,而是会直接被应用公司和硬件公司做进产品里。

最后,在训练模型这块,雨鑫还有什么想补充的吗?

雨鑫:有三个建议。

一是,如果个人或应用公司对训练模型感兴趣,最好的开始时机可能就是现在。因为如果有一天,模型厂商不再开源好的小模型,将会对应用公司造成很大的打击。所以对有预算的中大型应用公司来说,现在就开始基于优秀开源模型做后训练、持续迭代,是更稳妥的选择。

二是,虽然可以借助 AI,但不要过度相信 AI。遇到问题要及时查真实资料,或者看开源社区里已经成功的案例。

最后,别太快放弃。自己训模型的流程里,每个环节都会遇到坑,这非常正常,一版一版迭代就好。

【活动预告】

9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!

42章经

思考事物本质