Transformer · 起点
Transformer:从注意力到现代大模型
面向工程师的 Transformer 架构深挖教程。覆盖:2017 经典机制 → 注意力数学 → 整体架构 → 训练/推理不对称 → RoPE/GQA/MoE 等现代演化。
·适合谁
这份教程假设读者具备三项能力,三项都对得上,阅读体验最顺:
- 会用 Python 调一次 LLM API。
- 知道神经网络、向量、矩阵乘法是什么。
- 想真正搞懂 LLM 底层那块"地基"——不是调 API 技巧,是机制本身。
·不适合谁
- 完全没碰过编程或线性代数:这份教程的公式、形状分析和代码示意会让阅读体验很差;先补基础再回来。
- 只想调 API、不关心内部机制:直接去 prompt-engineering 和 llm-api,那两份教程面向使用侧。
- 想要完整数学证明或做研究:原论文(Vaswani 2017 arxiv 1706.03762)加教科书是正途,本教程不是研究入门。
·读完之后你能做到什么
读完,你能把任何一个现代 LLM 的架构图(Llama/DeepSeek/Qwen 的某层)拆开,逐个零件说出它在解决什么问题、替代了 2017 原版的什么、代价是什么——而不是把 transformer 当成一个会出魔法的黑箱。
- 说清 attention 的 QKV 软查表机制:query 发出、key 匹配、value 聚合,三者各自扮演什么角色。
- 解释为什么除以
√d_k、为什么要位置编码、为什么 pre-norm 取代 post-norm。 - 说清训练并行(teacher forcing + 因果掩码)与推理自回归的不对称,以及 KV-cache 由此而来的逻辑。
- 在 RoPE、GQA、MLA、FlashAttention、MoE 里按场景辨析选型,并说得出每条替代了什么、代价是什么。
- 判断某任务该用 encoder-only(BERT 类)、decoder-only(GPT 类)还是 encoder-decoder(T5 类),并给出依据。
一句话本质
Transformer = 用一个可微的「软字典查找」(attention:每个位置发出 query,与所有位置的 key 算相似度、softmax 成权重,再对 value 加权平均)让 token 跨位置交换信息,再用逐位置的 FFN 加工;两者交替堆叠 N 层——没有循环,训练可全并行。Attention 是整张网络里 token 之间唯一能通信的地方。
三个贯穿全程、一旦明白就不可逆的认知:
- 注意力不是"模型在看哪些词"的玄学,是 QKV 软查表;且注意力权重本身 ≠ 重要度——value 向量的范数是缺失的另一半,光看注意力热力图会误导。
- block = 通信(attention)+ 计算(FFN)交替(Karpathy 框架):attention 是唯一跨位置算子,FFN 逐位置独立处理;这解释了为什么两者都要、顺序不能换。
- 训练并行 vs 推理串行的不对称:训练用 teacher forcing + 因果掩码一次算完所有位置;推理是一次一个 token 自回归喂回去。几乎所有人在这卡过。
·现状速览(截至 2026-06)
已稳定(2017 至今没变):scaled dot-product attention 公式、multi-head 概念、残差连接、堆叠 N 层、decoder 因果掩码。这些是地基,放心学。
现代标配(约 2019–2023 完成切换,已稳定):decoder-only 取代 encoder-decoder 成 LLM 主流;RoPE 取代正弦位置编码;RMSNorm + pre-norm 取代 LayerNorm + post-norm;SwiGLU 取代 ReLU;GQA 取代朴素 MHA;FlashAttention 成标准 kernel。Llama/Mistral/Qwen/DeepSeek/Gemma 全系采用这套配方。
仍在快速变化(截至 2026-06,带日期学):MoE 成前沿主流扩展(Mixtral 2024 / DeepSeek-V3 2024-12 / Llama 4 2025-04 / Qwen3 2025 / Kimi K2 2025-06),但路由与专家粒度仍演化;QK-norm 在 2025 大模型(Gemma 3、OLMo 2、Qwen3、Kimi K2)快速普及;MLA(DeepSeek-V2, 2024-05)低秩压缩 KV 仍属个别;长上下文方案(YaRN 2024、iRoPE/NoPE Llama4 2025)未收敛;FlashAttention-3(2024-07, Hopper)仍在铺开;SSM/Mamba(Mamba-3 ICLR 2026)长序列吞吐有优势但推理质量仍落后,2026 年 transformer 仍主导前沿。
已过时(别当现状学):正弦/学习式绝对位置编码、ALiBi、post-norm、ReLU-FFN、朴素全 KV 的 MHA。第 05 章逐条说明替代方案与日期。
这份教程会刻意在每章末尾设置自测题。原因是:流畅地读完一段,和真正建立起机制理解,是两回事。读的时候如果冒出这三句心里话,它们多半是错觉信号,不是掌握信号——
「我读得很顺」(熟悉,不等于学会);「我做题很快」(多半是题型眼熟);「我没卡壳」(多半没真正碰到难点)。碰到自测题,先合上教程动笔,再对答案。
·概念地图
这张图是后面所有细节的挂钩。从顶部的 token/embedding 出发,沿中心脊柱向下走,是从原始 transformer 到现代演化的完整依赖链;左右两侧是各节点的配套概念。学习时脑子里有这张图,每章的细节才有地方挂。
·学习路径建议
按目的挑一条线,不必从头读到尾:
- 只想懂直觉、不被"注意力"这个词搞蒙:第 01 章(心智模型)→ 第 02 章前两节(QKV 直觉)→ 第 06 章概念层自测。
- 要彻底搞懂机制(公式 + 形状 + 陷阱):全程通读,不跳章。第 02、03、04 章密度最高,每章末自测必做。
- 要读懂现代模型架构图(Llama/DeepSeek/Qwen):第 01–03 章打底 → 第 05 章(经典到现代)重点阅读 → 对照目标模型架构图逐件拆解。
- 准备面试("transformer 的注意力机制是什么""为什么用 KV-cache""MoE 是什么"是高频题):全程通读 + 第 06 章应用辨析题。
·目录
·学完之后
这份教程之后,几个自然的下一步,以及它们在已有结构上加了什么:
- 检索增强生成(RAG):理解了 transformer encoder 怎么把 token 变成 embedding,才能真正理解为什么 embedding 能做语义相似度检索——去 rag 直接从向量检索机制开始。
- Agent 推理模式:CoT、ReAct、Tree-of-Thought 都建立在对 decoder 自回归生成的理解上——去 agent-reasoning-patterns 看推理期算力怎么换可靠性。
- LLM API 工程实践:把 transformer 机制映射到 API 参数(temperature/top-p/max-tokens 背后的逻辑)——去 llm-api。
- Prompt 工程:知道 attention 怎么工作、上下文窗口的本质是什么,prompt 设计就从玄学变成工程——去 prompt-engineering。