深度精讲 · 概念为主 · 半天

大模型是怎么训练出来的

从一堆网页文本,到一个会听话、有用、会推理的助手,中间隔着三个完全不同的训练阶段。这份教程拆开整条流水线,建立一套能在面试和设计讨论里讲清楚的心智模型——不是 API 教程,是机制教程。

基准:2026-06 的公开做法(含 GPT/o 系列、Llama 3/4、DeepSeek-V3/R1、Qwen3) 形式:概念 + 公式 + 伪代码(不含可运行训练脚本) 验证状态:公式与伪代码未在本机执行,用于讲解机制

·适合谁 / 不适合谁

适合你,如果——

  • 能读 Python 伪代码、看得懂 σ()、log、期望 E[·] 这类数学记号(不要求会推反向传播)
  • 用过 ChatGPT / Claude 这类对话模型,知道 token、prompt、上下文是什么
  • 大致知道神经网络靠"算 loss → 求梯度 → 更新参数"在学,想搞懂这套机器在大模型上具体怎么转

先去别处,如果——

  • 完全没接触过神经网络/梯度下降:先看 3Blue1Brown 神经网络系列或吴恩达课程,再回来
  • 只想动手跑微调脚本:去 Hugging Face TRL / Unsloth 的 hands-on 文档,本教程讲的是"为什么"
  • 只关心怎么写 prompt 调好一次输出:那是 prompt engineering,不是训练

·读完之后你能做到什么

读完你能向人讲清楚一件多数工程师讲不清的事:为什么"拿业务数据微调一下模型"既不能可靠地往模型里灌知识、又常常让它更爱胡说——因为知识几乎全在预训练阶段灌进去,后训练动的是行为不是知识,而用监督微调去教模型"它本来不知道的答案",等于在训练它自信地编。能讲清这一条,你就握住了整条流水线的因果。

具体地,你将能够:

  • 对任意一个对话模型,说出它从随机初始化到上线经历了哪几个训练阶段,每个阶段改变了什么、没改变什么
  • 用一句话区分预训练 / SFT / RLHF / DPO / RLVR,并说出各自优化的是哪个 loss、需要几个模型在显存里
  • 判断一个业务需求该用微调、RAG、还是换个对齐方法,并说出依据
  • 看懂 2025–2026 推理模型(o1 / R1)为什么把"训练"的重心从预训练挪到了后训练 RL,以及这对"后训练不增加能力"的经典观点意味着什么
  • 识别 reward hacking、灾难性遗忘、谄媚、DPO 概率漂移等失败模式的根因,而不只是名字

一句话本质

大模型训练不是"喂数据让它变聪明"这一件事,而是两件不同的事叠加:预训练用预测下一个 token 从海量文本里"长出"能力(知识、世界模型、推理的雏形);后训练(SFT / RLHF / DPO)几乎不再注入新知识,只是把这些已有能力对齐成人类想要的行为(听话、有用、无害)。而每一个阶段的工程本质,都是把一个无法直接求导的目标,想办法变成一个能反向传播的 loss。

现状速览 · 截至 2026-06

稳定内核:三阶段流水线(预训练 → SFT → 偏好优化)自 InstructGPT(2022) 以来没变;Transformer + 预测下一个 token + AdamW + 大致 Chinchilla 式的 scaling 直觉,都是定论。

正在快速变化:推理模型范式(OpenAI o1 2024-09、DeepSeek-R1 2025-01)用可验证奖励 RLVR 取代了"学一个偏好奖励模型";GRPO 砍掉了 PPO 的价值网络;合成数据 + 蒸馏成为后训练主力;DPO 衍生出 SimPO / KTO / ORPO / 在线 DPO 一大家子。核心争论:RL 到底是"激发"还是"教会"了能力——pass@k 证据显示基座模型本就藏着这些推理路径。

已被取代:把"纯 PPO-RLHF + 人工偏好标注"当默认配方;把人工指令集当主要训练信号;把 Chinchilla 的 20 token/参数当训练目标(现在为推理省钱刻意"过度训练",Llama 3 8B 跑到约 1875 token/参数);用 BLEU/ROUGE、单次 pass@1 当能力指标。

读之前 · 关于"读懂了"的错觉

这份教程会刻意在某些地方让你停下来预测、自测。请警惕三种"假装学会了"的信号:

"我读得很顺"——顺,往往只说明文字熟悉,不等于你能合上教程复述出机制。
"我做题很快"——快,常常是因为答案就在上一段,你在抄不是在回忆。
"我没卡壳"——没卡壳,往往是因为你压根没碰到需要重构理解的地方。真正的学习几乎都伴随短暂的"卡住"。

看到 想一想 和 self-check 时,先合上答案,真的在脑子里(或纸上)答一遍再展开。

·概念地图

预训练 SFT 偏好优化 海量文本 网页·代码·书 基座模型 base·有能力 指令模型 instruct·会听话 对齐/推理模型 有用·无害·会推理 预训练:长出能力 后训练:不增知识,只塑形行为 每根箭头 = 把一个无法直接求导的目标,变成一个可反向传播的 loss 2025–26 松动点 RLVR / 推理 RL 让"后训练只对齐、不增能力"这条线开始模糊
图 0.1整条流水线,从左到右。 注意三件事:① 中间那 3 个"模型"是 3 个不同的存档点,不是同一个东西变好;② 左侧一根箭头管"能力",右侧两根箭头管"行为",泾渭分明;③ 红框是 2025 年后这条分界线开始被推理 RL 打破的地方——后面第 4 章会专门讲。

·怎么读这份教程

四个内容章节按流水线顺序排列,每章都在上一章的存档点上继续。根据你的目的挑一条线:

  • 只想建立全景认知:第 1 章(全景)+ 每章开头的 schema 清单 + 各章 self-check,跳过推导细节也能拿到完整地图。
  • 准备面试被问"大模型怎么训练":完整读,重点啃第 4 章的算法对比表和第 5 章的"应用判别"场景题——面试官最爱在 SFT vs RLHF vs DPO、RLHF vs RLVR 的边界上追问。
  • 想判断业务上要不要自己训 / 微调:第 1 章 + 第 3 章(SFT 的能与不能、微调 vs RAG)+ 第 4 章对齐方法选型,足够支撑决策。

·学完之后往哪走

  • 动手微调:Hugging Face TRL / Unsloth / Axolotl——把第 3、4 章的 SFT/DPO 概念变成跑得起来的脚本,给你的 schema 加上"工具与显存"维度。
  • 推理与部署:vLLM / 量化 / KV-cache——训练的对面是推理,理解 GQA、过度训练为何省推理钱后,自然接到这里。
  • Agent 与工具调用:训练出的对齐模型如何接工具、做规划——把"一个会听话的模型"变成"一个会干活的 agent",是你职业方向的下一站。
  • 对齐与安全前沿:Constitutional AI、可扩展监督、RLVR 的能力边界——第 4 章的争论往深里走。