深度精讲 · 概念为主 · 半天
大模型是怎么训练出来的
从一堆网页文本,到一个会听话、有用、会推理的助手,中间隔着三个完全不同的训练阶段。这份教程拆开整条流水线,建立一套能在面试和设计讨论里讲清楚的心智模型——不是 API 教程,是机制教程。
·适合谁 / 不适合谁
适合你,如果——
- 能读 Python 伪代码、看得懂 σ()、log、期望 E[·] 这类数学记号(不要求会推反向传播)
- 用过 ChatGPT / Claude 这类对话模型,知道 token、prompt、上下文是什么
- 大致知道神经网络靠"算 loss → 求梯度 → 更新参数"在学,想搞懂这套机器在大模型上具体怎么转
先去别处,如果——
- 完全没接触过神经网络/梯度下降:先看 3Blue1Brown 神经网络系列或吴恩达课程,再回来
- 只想动手跑微调脚本:去 Hugging Face TRL / Unsloth 的 hands-on 文档,本教程讲的是"为什么"
- 只关心怎么写 prompt 调好一次输出:那是 prompt engineering,不是训练
·读完之后你能做到什么
读完你能向人讲清楚一件多数工程师讲不清的事:为什么"拿业务数据微调一下模型"既不能可靠地往模型里灌知识、又常常让它更爱胡说——因为知识几乎全在预训练阶段灌进去,后训练动的是行为不是知识,而用监督微调去教模型"它本来不知道的答案",等于在训练它自信地编。能讲清这一条,你就握住了整条流水线的因果。
具体地,你将能够:
- 对任意一个对话模型,说出它从随机初始化到上线经历了哪几个训练阶段,每个阶段改变了什么、没改变什么
- 用一句话区分预训练 / SFT / RLHF / DPO / RLVR,并说出各自优化的是哪个 loss、需要几个模型在显存里
- 判断一个业务需求该用微调、RAG、还是换个对齐方法,并说出依据
- 看懂 2025–2026 推理模型(o1 / R1)为什么把"训练"的重心从预训练挪到了后训练 RL,以及这对"后训练不增加能力"的经典观点意味着什么
- 识别 reward hacking、灾难性遗忘、谄媚、DPO 概率漂移等失败模式的根因,而不只是名字
一句话本质
大模型训练不是"喂数据让它变聪明"这一件事,而是两件不同的事叠加:预训练用预测下一个 token 从海量文本里"长出"能力(知识、世界模型、推理的雏形);后训练(SFT / RLHF / DPO)几乎不再注入新知识,只是把这些已有能力对齐成人类想要的行为(听话、有用、无害)。而每一个阶段的工程本质,都是把一个无法直接求导的目标,想办法变成一个能反向传播的 loss。
稳定内核:三阶段流水线(预训练 → SFT → 偏好优化)自 InstructGPT(2022) 以来没变;Transformer + 预测下一个 token + AdamW + 大致 Chinchilla 式的 scaling 直觉,都是定论。
正在快速变化:推理模型范式(OpenAI o1 2024-09、DeepSeek-R1 2025-01)用可验证奖励 RLVR 取代了"学一个偏好奖励模型";GRPO 砍掉了 PPO 的价值网络;合成数据 + 蒸馏成为后训练主力;DPO 衍生出 SimPO / KTO / ORPO / 在线 DPO 一大家子。核心争论:RL 到底是"激发"还是"教会"了能力——pass@k 证据显示基座模型本就藏着这些推理路径。
已被取代:把"纯 PPO-RLHF + 人工偏好标注"当默认配方;把人工指令集当主要训练信号;把 Chinchilla 的 20 token/参数当训练目标(现在为推理省钱刻意"过度训练",Llama 3 8B 跑到约 1875 token/参数);用 BLEU/ROUGE、单次 pass@1 当能力指标。
这份教程会刻意在某些地方让你停下来预测、自测。请警惕三种"假装学会了"的信号:
"我读得很顺"——顺,往往只说明文字熟悉,不等于你能合上教程复述出机制。
"我做题很快"——快,常常是因为答案就在上一段,你在抄不是在回忆。
"我没卡壳"——没卡壳,往往是因为你压根没碰到需要重构理解的地方。真正的学习几乎都伴随短暂的"卡住"。
看到 想一想 和 self-check 时,先合上答案,真的在脑子里(或纸上)答一遍再展开。
·概念地图
·怎么读这份教程
四个内容章节按流水线顺序排列,每章都在上一章的存档点上继续。根据你的目的挑一条线:
- 只想建立全景认知:第 1 章(全景)+ 每章开头的 schema 清单 + 各章 self-check,跳过推导细节也能拿到完整地图。
- 准备面试被问"大模型怎么训练":完整读,重点啃第 4 章的算法对比表和第 5 章的"应用判别"场景题——面试官最爱在 SFT vs RLHF vs DPO、RLHF vs RLVR 的边界上追问。
- 想判断业务上要不要自己训 / 微调:第 1 章 + 第 3 章(SFT 的能与不能、微调 vs RAG)+ 第 4 章对齐方法选型,足够支撑决策。
·学完之后往哪走
- 动手微调:Hugging Face TRL / Unsloth / Axolotl——把第 3、4 章的 SFT/DPO 概念变成跑得起来的脚本,给你的 schema 加上"工具与显存"维度。
- 推理与部署:vLLM / 量化 / KV-cache——训练的对面是推理,理解 GQA、过度训练为何省推理钱后,自然接到这里。
- Agent 与工具调用:训练出的对齐模型如何接工具、做规划——把"一个会听话的模型"变成"一个会干活的 agent",是你职业方向的下一站。
- 对齐与安全前沿:Constitutional AI、可扩展监督、RLVR 的能力边界——第 4 章的争论往深里走。