大模型的发展并非沿着一条直线匀速推进,而是由若干个关键节点串联起来的跃迁过程。这些节点背后往往是对某个瓶颈的强烈回应:循环神经网络处理长序列时梯度消失,于是有了自注意力;标注数据不足制约任务泛化,于是有了无监督预训练;模型规模增大后难以遵循指令,于是有了对齐技术。理解这些里程碑,本质上就是理解大模型为什么长成今天这个样子。

先说明一点:所谓“时间线”并不要求记住每个发布日期,而是看清技术依赖关系。比如没有Transformer的自注意力,就不会有BERT的双向编码;没有GPT的生成式预训练,就很难涌现出上下文学习;没有指令微调,再大的模型也只会续写文本而不会回答问题。下面从三个维度展开:核心架构突破、预训练范式转变、以及对齐与规模化方法。
架构基石:从循环网络到自注意力
在Transformer出现之前,序列建模的主流是LSTM和GRU这类循环神经网络。它们按时间步递归处理输入,天然适合文本这种有序数据,但存在两个致命问题:一是无法并行训练,序列长度增加时计算耗时急剧上升;二是长距离依赖建模能力有限,虽然门控机制缓解了梯度消失,但超过几十步的关联依然很难捕捉。实际任务中,一段话的语义重点可能出现在开头和结尾相距很远的位置,循环网络对此并不擅长。
Transformer直接把序列中任意两个位置的关系通过注意力权重一次性计算出来。自注意力的核心公式可以简化为:每个位置的表示由所有位置的加权和得到,权重来自查询向量和键向量的点积。这样做既摆脱了递归的顺序限制,又让长距离依赖变成一层矩阵运算就能覆盖的事情。需要注意的是,位置信息本身在自注意力中并不存在,所以必须额外加入位置编码。早期版本使用正弦函数编码绝对位置,后续许多模型改用旋转位置编码或相对位置编码,这是另一个值得单独展开的话题。
import torch
import torch.nn.functional as F
def scaled_dot_product_attention(query, key, value, mask=None):
# query/key/value 形状: (batch, heads, seq_len, d_k)
d_k = query.size(-1)
scores = torch.matmul(query, key.transpose(-2, -1)) / (d_k ** 0.5)
if mask is not None:
scores = scores.masked_fill(mask == 0, -1e9)
attn_weights = F.softmax(scores, dim=-1)
output = torch.matmul(attn_weights, value)
return output, attn_weights
多头注意力进一步把表示空间拆分成多个子空间,允许模型在不同维度上关注不同类型的关系,比如语法依赖、指代关系、语义相似度等。残差连接和层归一化则保证了深层网络的稳定训练。正是因为并行性和长距离建模能力突出,Transformer很快成为自然语言处理乃至计算机视觉领域的基础模块。
预训练范式:从任务特定到通用底座
Transformer刚出来时,大家还是习惯为每个任务单独训练一个模型。机器翻译用编码器-解码器结构,文本分类只用编码器,文本生成只用解码器。这种模式下,每个任务都需要大量标注数据,而且模型之间完全无法复用。BERT的出现改变了游戏规则:先在超大规模无标注语料上做掩码语言模型和下一句预测两个自监督任务,得到一个通用的文本编码器,然后在下游任务上微调,只需要少量标注数据就能达到当时的顶尖效果。
GPT走的是另一条路,采用单向自回归语言模型,即根据前面的词预测下一个词。这个目标看似简单,却让模型天然具备生成能力。当模型规模达到一定程度后,研究者发现它不需要微调,只要在输入中给几个示例,就能直接完成新任务,这就是上下文学习。这种能力是涌现出来的,不是设计出来的,也正是大模型“大”字的真正含义:规模本身带来了质变。
T5则把几乎所有NLP任务统一成文本到文本的格式,输入一段文本,输出一段文本,损失函数统一为交叉熵。这个统一的视角极大简化了多任务训练的工程复杂度。不过T5的编码器-解码器结构后来逐渐被纯解码器的大模型取代,因为纯解码器在生成效率和扩展性上更有优势,而且预训练目标与最终使用方式更加一致。
规模扩展与对齐:当模型开始听懂人话
从GPT-3开始,大家明确观察到参数规模、数据量和计算量之间存在一种可预测的扩展规律。在一定范围内,增加任一维度都会带来损失的稳定下降。但并不是简单堆参数就一定有收益,数据质量、训练稳定性、架构细节同样关键。LLaMA系列证明了在相对合理的计算预算下,用更多高质量数据训练较小模型,可以在很多任务上超过参数更大的模型。
单纯用语言模型目标训练出来的模型,其实并不擅长直接回答用户问题,它更倾向于续写一段文本。为了让模型“听懂人话”,指令微调把大量人工编写的提示词和期望回复作为训练数据,让模型学会遵循指令。这个过程大幅降低了使用门槛,但也带来了新问题:模型可能会输出有害内容、编造事实或者过度迎合用户。
基于人类反馈的强化学习(RLHF)引入了奖励模型,先让标注人员对模型生成的多个回复进行排序,训练出一个能打分的奖励模型,再通过强化学习优化策略模型,使其输出更符合人类偏好。后续出现了一些改进方法,比如直接偏好优化(DPO),通过数学变换把强化学习过程转化为一个简单的分类损失,训练更稳定且不需要单独的奖励模型。这些对齐技术使得大模型真正从实验室走进了产品。
总体来看,大模型的发展是架构创新、预训练策略和规模化工程三者耦合推进的结果。自注意力解决了表示能力,预训练解决了数据效率,规模扩展解决了通用性,而对齐技术解决了可用性。当前的多模态大模型和推理增强模型,依然是在这些基石之上继续叠加新的能力维度。
大模型自然语言处理Transformer修改时间:2026-09-22 21:18:54