Chapter 05

自测与辨析

前四章建好了整条流水线和每一段的机制。这一章不教新东西,而是逼你把它们调出来用:合上前面的内容,先答题,再对照。读得顺不等于学会了——能在场景题里选对、并说清依据,才算。

这一章怎么用

  • 三层题:概念层(回忆)→ 原理层(理解)→ 应用判别层(迁移到真实场景)
  • 所有答案集中在文末一个折叠块里。先在纸上/编辑器里写完,再展开——直接看答案等于重读一遍
  • 越往后越像面试现场:应用判别层的每道题都要你在 ≥2 章的方案之间做选择,并讲出依据
应用判别层 跨章场景 · 迁移 原理层 机制为什么这样 · 第 2–4 章 概念层 词汇与流水线 · 回忆 · 第 1 章 难度递增 回忆
图 5.1三层题对应三种掌握程度。 注意:能答对底层的"是什么"不代表能答对顶层的"该选哪个"——面试和真实工作几乎都发生在顶层,所以别在概念层答顺了就停。

A概念层 · 词汇与流水线

A1一个对话模型的"出厂"分哪三个阶段?逐段说出它改变了什么、没改变什么。
A2"预测下一个 token"是个看似无聊的目标,为什么足以让模型长出事实记忆和推理能力?(提示:§1.2 的"压缩")
A3交叉熵 loss −log P(正确 token):当正确 token 的概率是 0.5 时 loss 约多少?概率趋近 0 时 loss 怎样变化?这说明它重罚哪种错误?
A4base / instruct / reasoning 三种存档点,对"9.11 和 9.9 哪个大"分别会怎么反应?各自多了哪一步训练?
A5"能力"和"行为"两条进度条,分别主要由流水线的哪一段填满?这条不对称为什么是全书最重要的一句话?

B原理层 · 机制为什么这样

B1(预训练)"自监督"具体指什么?为什么唯独预训练能吃下万亿 token,而后训练吃不下?
B2(预训练)Chinchilla 说约 20 token/参数最优,Llama 3-8B 却用了约 1875。两个"最优"优化的目标分别是什么?
B3(预训练)数据并行 DP、张量并行 TP、流水线并行 PP、ZeRO/FSDP,各自"切"的是什么?哪一种最吃卡间带宽?
B4(SFT)SFT 和预训练是不是同一个 loss?唯一的机制区别在哪?为什么要对 prompt 部分做掩码?
B5(SFT)为什么"在模型并不知道答案的问答对上做 SFT"会训出更爱幻觉的模型?修复的方向是什么?
B6(对齐)RLHF/PPO 为什么要 4 个模型?逐个说出它们的职责。KL 惩罚去掉会发生什么?
B7(对齐)DPO 怎么做到不训练单独的奖励模型?用一句话说出闭式解的洞察,并说出它省掉了哪几样东西。
B8(对齐)GRPO 砍掉了 PPO 的哪个模型?用什么机制代替它的作用?RLVR 的奖励又从哪来,和经典 RLHF 差在哪?

C应用判别层 · 跨章场景

下面五道是这份教程的重头。每道题都给一个真实场景,要你在不同章节的方案之间做选择,并讲清依据。这正是面试官追问的层次。先自己判断,再展开答案。

场景 S1 · 跨 §1.3 能力/对齐 + §3.5 微调 vs RAG

产品要一个客服助手:① 能用每天更新的内部知识库回答用户的事实性问题;② 所有回复都以固定话术开头、用公司规定的语气。把这两个需求拆开,各自该用什么手段?为什么不能两个都用微调?

场景 S2 · 跨 §4.3 DPO + §4.5 RLVR

你要把一个开源 base 模型对齐成"数学竞赛解题助手"。算力管够,但人类偏好标注预算很少。SFT 之后,接 DPO 还是接 RLVR-GRPO?为什么 RLVR 在这里几乎是免费的午餐?换成"把回复写得更有共情"这个目标,同样的理由还成立吗?

场景 S3 · 跨 §1.3 能力/对齐 + §4 RLHF + §3.5

一个团队抱怨:花大价钱做了 RLHF,模型说话更顺了,却还是不懂自己行业的专业知识。用一句话诊断他们把哪条进度条的工具用在了哪条进度条的目标上。正确的补救路线是什么?

场景 S4 · 跨 §4.1 奖励模型 + §4.4 失败模式

模型上线后出现三个症状:回答又臭又长;张口就是"作为一个 AI 语言模型……";用户说什么它都顺着附和。把这三个症状分别对应到一个有名字的失败模式,并指出它们共同的根因来自哪个环节。

场景 S5 · 跨 §4.5 RLVR / 蒸馏 + §1.3

要把一个 70B 推理模型的解题能力"塞进"一个 1.5B 小模型上线。两条路:(a) 直接在 1.5B 上跑 RLVR-GRPO;(b) 用 70B 生成大量推理轨迹,对 1.5B 做 SFT 蒸馏。选哪条?这和"后训练不增加能力"那条分界有什么关系?

亲手画一张图

合上整份教程,在纸上画出完整流水线,只用这几样元素:3 个阶段箭头 + 3 个存档点 + 每个阶段优化的 loss + 每个阶段需要几个模型在显存里。画完回到 §1.5 的表对照——你画的图里,从 RLHF 的 4 个模型砍到 DPO 的 2 个,省掉的是哪两个?GRPO 又砍掉了哪一个?画得出这张图,你就真正握住了整条流水线。

§答案(先把三层都做完再展开)

忍住"瞄一眼"的冲动。你在场景题上卡住的地方,正是值得回到对应章节重读的地方。

展开全部答案

A · 概念层

  1. A1:① 预训练——用海量无标注文本灌入能力(语言、知识、推理雏形),但只学会"续写",不改对话行为;② SFT——用"指令→回答"教会听话/回答这种行为,不灌新知识;③ 偏好优化——用人类偏好把回答推向有用、无害、风格好,仍然几乎不动知识。一句话:第一段改能力,后两段改行为。
  2. A2:要在真实文本上把下一个 token 预测准,模型被迫存下事实(续写"法国的首都是__")、学会计算("x+3=7 则 x=__")、建出意图模型(续写对话)。预测准 = 把世界压缩进参数,能力是压缩的副产品。
  3. A3:0.5 时 loss = −log(0.5) ≈ 0.69;概率趋近 0 时 loss 趋近 +∞。它重罚"很自信却把正确答案的概率压得很低",所以模型有动力别太离谱。
  4. A4:base 会续写更多类似问句而不回答;instruct 直接给答案但可能凭直觉答错、不展开;reasoning 先在长链思考里逐位比较 0.11 与 0.90、自行纠错再给"9.9 更大"。instruct 比 base 多了 SFT(+偏好优化),reasoning 比 instruct 多了可验证奖励 RL(RLVR)。
  5. A5:能力条几乎全由预训练填,行为条几乎全由后训练填,两条近乎镜像。重要,是因为教程里绝大多数困惑(微调能不能加知识、RLHF 是不是让模型变聪明)都来自把这两条混为一谈。

B · 原理层

  1. B1:自监督 = 标签就是文本里的下一个 token,无需人工标注。因此信号极其稠密、数据近乎免费,能堆到万亿级;后训练依赖人工写/标注或偏好比较,数据天花板只有百万级,吃不下那个量。
  2. B2:Chinchilla 优化的是训练计算最优(给定训练算力,loss 最低);Llama 3 优化的是推理摊薄后的总成本——要服务海量请求时,把较小模型过度训练,换更便宜的单 token 推理更划算。目标换了,最优点就从 20 跳到约 1875。
  3. B3:DP 切数据(每卡整模型副本);TP 切单层的权重矩阵;PP 切层(不同层放不同卡);ZeRO/FSDP 切优化器状态/梯度/参数。TP 每层前后向都要 all-reduce,最吃带宽,所以通常只在单机 NVLink 8 卡内用。
  4. B4:同一个交叉熵 loss。唯一区别:SFT 只在"回答"部分的 token 上算 loss,对 prompt 部分掩码(label=-100)。掩码是因为目标是"给定这种输入该说什么",不是去拟合用户的指令本身。
  5. B5:SFT 是对人类答案做行为克隆。若答案是模型内部不掌握的,等于训练它"没有依据也要自信地给答案"——学会了"永远回答"这个行为,没学会"只答我知道的"这个边界。修复方向:行为克隆教行为、用 RL 教边界(何时说"我不知道")。
  6. B6:策略模型(在训)、参考模型(frozen SFT,算 KL)、奖励模型(frozen,打分)、价值模型(critic,估基线给 PPO 算 advantage)。去掉 KL,PPO 会迅速钻奖励模型的漏洞,策略塌成对人无意义但 RM 高分的乱码(reward hacking)。
  7. B7:洞察是——带 KL 约束的 RLHF 最优策略与奖励之间有闭式关系,于是奖励可以用"策略相对参考模型的对数比"表示,代入 Bradley-Terry 就变成偏好对上的逻辑回归。它省掉了:单独的奖励模型、RL 回路、在线采样、价值网络(4 个模型砍到 2 个)。
  8. B8:GRPO 砍掉价值/critic 模型,用"对同一 prompt 采样一组回答、以组内奖励的均值/标准差当基线"代替。RLVR 的奖励来自确定性验证器(数学答案对错、代码跑测试),不是学出来的偏好模型——所以它是激发"能力",而经典 RLHF 是对齐"行为"。

C · 应用判别层

  1. S1:拆成两条进度条。① 事实知识——每天更新、要可溯源,属"能力/知识",用 RAG(检索),不要微调(微调灌不动且会过时);② 固定话术/语气——属"行为/格式",用 SFT(或 LoRA)。两个都用微调会同时踩中"微调灌知识不可靠"和"知识一更新就得重训"两个失败模式。正解是 RAG 管事实 + 微调管格式。
  2. S2:接 RLVR-GRPO。数学题答案可被验证器判对错,奖励信号是"免费"的、不需要人类偏好标注——正好补上预算缺口。换成"更有共情"就不成立了:共情没有可验证的对错,只能退回偏好型信号(DPO 或 RLHF),又把人类标注预算这个瓶颈请回来了。这道题考的是"奖励从哪来"。
  3. S3:他们把"行为条"的工具(RLHF)用在了"能力条"的目标(灌专业知识)上。RLHF 只会让说话更顺,不会注入领域知识。补救:领域知识靠预训练/继续预训练(贵)或 RAG(实际),RLHF/DPO 留给调风格与偏好。这就是 §1.3 的分界在生产里被违反的典型。
  4. S4:又臭又长 = 奖励模型的长度/冗长偏置(verbosity bias);"作为一个 AI……" = reward hacking / 模式塌缩(钻 RM 高分模板);一味附和 = 谄媚(sycophancy)。三者共同根因:奖励模型只是人类偏好的代理,优化压力一上来就会在代理和真实偏好的缝隙里走捷径(Goodhart)。根子在 §4.1 的"代理奖励"和 §4.4 的失败模式。
  5. S5:选 (b) 蒸馏。2025 证据(pass@k)显示直接在小模型上跑 RLVR 主要是"把它已有能力的采样磨锋利",撬不动它本来就没有的能力天花板;而用更强老师的轨迹做 SFT 蒸馏,能把新的推理模式真正搬进小模型(R1-Distill-Qwen-1.5B 靠纯蒸馏在 MATH 上超过 GPT-4o)。这恰好印证 §1.3:要"增加能力",靠的不是在原模型上 RL,而是换更强的来源。
进阶挑战 · 把整条线讲给别人听

五分钟白板

找个人(或对着镜头),用五分钟、不看教程,从"一堆网页"讲到"一个会推理的助手":每个阶段在优化什么 loss、信号从哪来、改了能力还是行为、显存里几个模型。讲到卡壳的地方,就是你 schema 上还没连牢的地方——回到那一章,而不是重看全书。能流畅讲完,这份教程的目标就达成了。