大家看一下这个只花了三块钱训练出来的大语言模型怎么样?还可以吧!想真正弄懂大语言模型工作原理或者想弄懂一个大语言模型是怎么训练出来的,这个叫做Mini mind的开源项目,你必须要收藏!

你只需要花3块钱租一张3090,花两个小时就能从零开始训练出自己的大语言模型。这个项目现在在Git Hub上已经涨了6.1万颗星,近8000个fork,训出来的模型只有"6400万参数",体积大概是GPT3的两千七百分之一,普通个人显卡就能跑得动训练。

打开网易新闻 查看精彩图片

你只需要把仓库克隆下来,装好依赖,下载它开源的数据集,跑一条预训练命令,再补一条微调命令,就能得到一个小巧但会中文聊天的模型。还能直接拿Ollama拉起来跑,或者用Openai兼容接口接到openwebui里。

打开网易新闻 查看精彩图片

真正少见的是他把Moe Lora DPO强化学习,蒸馏工具调用这一整条链路的核心算法全用原生Pytorch手写了一遍,没有藏在第三方封装后面,你练的同时每一行都能看懂,甚至还带出视觉和多模态的孪生项目。

想认真搞懂大模型黑盒的人,不妨先拿家里那张显卡把两小时的mini版训一遍玩玩。

AI产品狙击手,关注我获得更多AI工具。