大语言模型进入日常生活还没多久,但它已经成了一门"说不清"的技术。AI专家把它当旧闻,急着入门的新人随手略过,普通大众基本没搞懂。这篇文章要做的事很直接:把LLM拆开,再把最常见的两种模型适配手段——微调和RAG架构——讲清楚。
从规则到统计,NLP走了一段弯路
人工智能领域的研究者花了多年时间试验基于NLP的模型,但始终没能达到理想的原创生成水平。原因在于,NLP模型严格遵循为它们定义的规则,并基于这些规则作答。
这些发现把研究者推向了基于深度学习的模型——用统计方法和概率计算来做决策。最初,他们借助LSTM和RNN架构成功捕捉到了短期依赖关系,但处理长期依赖时,硬件限制就暴露出来了。
大语言模型的首要任务是理解人类语言,并以类似人类的方式回应。仅仅"理解"信息是不够的。具备这种能力的"仅编码器"模型被开发出来,BERT就是这类架构的代表,它在分类、情感分析、文本归类等任务上表现出色。
后来,既能理解用户查询、又能生成合适回应的模型也出现了,它们主要采用"仅解码器"架构。GPT、Claude、Llama、Qwen这些现代模型都建立在这一架构思路上。
编码器和解码器,看文本的方式不一样
仅编码器模型通过查看输入文本的完整全貌来解释它。仅解码器模型则单向(自回归)运作,从左到右生成内容。这两种架构都源自Transformer架构。
现代LLM能完成代码生成、翻译、信息提取、推理、问答等许多创造性任务。传统机器学习或NLP模型是为特定的专门任务设计的,而在需要创造性和多面性的任务上,LLM明显把自己和这些传统模型区分开了。
这种创造性来自Transformer架构和自注意力机制。Vaswani和他的团队在2017年做了这项重要研究,论文《Attention Is All You Need》揭开了LLM底层基础架构的面纱。
注意力机制才是真正的发动机
现代LLM模型依赖"Transformer"架构。粗略看这个架构,会看到它由编码器和解码器模块组成。但真正驱动这些大语言模型的,是Transformer架构里的"注意力"机制。
通过这个机制,模型在句子中的词与词之间建立关系和上下文,解读词与词、对象与对象之间的关系。根据具体任务,LLM给重要的元素分配更高的权重(分数),给不那么重要的词分配更低的权重,编码器和解码器组件负责执行这一功能。
编码器组件读取输入文本,把它的含义转换成数值数据,这个过程叫向量化,目的是让文本更容易被表示为数学向量空间。解码器则利用编码器传来的向量化表示生成新信息。
举个例子。当基于完整Transformer架构的模型被问到"什么是人工智能?"时,编码器先把这个问题拆成称为token的小单元,用自注意力机制理清这些token之间的关系、建立上下文。在创建出语义表示后,它把编码后的数据转发给解码器。
解码器的任务是基于传入的数据生成回应。它首先根据这个表示预测初始token,随后开始按顺序生成新的token,同时参考前面的内容。
这套流程解释了LLM为什么能"创造",也解释了它的边界在哪里——它做的是统计和概率计算,不是按预设规则查表。理解了这一点,再看微调和RAG这两种适配手段,逻辑就顺了。
热门跟贴