Transformers 简明指南
一、什么是 Transformer?
Transformer 是一种基于自注意力机制的深度学习模型架构,由 Google 在 2017 年提出。它彻底改变了自然语言处理(NLP)领域,是 ChatGPT、BERT 等所有主流大模型的底层技术。
核心思想:处理文本时,模型可以一次性看到所有单词,并动态判断哪些词更重要(即“注意力”)。
二、为什么它这么重要?
在 Transformer 之前,主流模型(RNN/LSTM)必须逐词阅读,速度慢且容易忘记前面的内容。Transformer 的突破在于:
- ✅ 并行计算:一次处理整个句子,训练速度大幅提升
- ✅ 长距离记忆:直接关注任意两个词的关系,不会遗忘
- ✅ 可扩展性:模型越大,效果越好(催生了 GPT 系列)
三、核心概念(一句话版)
| 概念 | 一句话解释 |
|---|---|
| 自注意力 | 让每个词关注句子中所有其他词,并分配权重 |
| 多头注意力 | 多个注意力头并行,各抓取不同维度的信息 |
| 位置编码 | 给词标注序号,让模型知道顺序 |
| 编码器-解码器 | 编码器理解输入,解码器生成输出 |
四、两大流派
| 流派 | 代表模型 | 能力 |
|---|---|---|
| 编码器-Only | BERT | 理解文本(分类、问答) |
| 解码器-Only | GPT | 生成文本(对话、创作) |
五、Hugging Face Transformers(工具库)
这是一个 Python 库,让你几行代码就能调用强大的预训练模型。
安装
bashpip install transformers

