Appearance
速查表 · 九域检索索引
版本:2026-10-10 v2。覆盖第 1–23 章与前沿参考页的检索层快照,数字与结论全部收割自课程正文。
用法:本页是检索索引,不是替代品——每个条目以
→链到承载推导、证明与实验的深度小节;公式只给结论,符号在紧邻句就地定义,本页不设全局记号表。术语的完整定义、前端类比与代码定位以术语表为事实源;论文出处一律见必读论文索引,不在本页堆叠。
贯穿示例:全页用 TinyGPT 与一句中文语料「今天天气真不错」做同一条线索,缝合分词、注意力、训练、推理系统与强化学习各域;相关条目以 例 标注。
域导航
| 域 | 主题 | 主承载 |
|---|---|---|
| ① | 数学底座 | 第3、4章 |
| ② | 分词与表示 | 第5、6章 |
| ③ | 注意力与 Transformer | 第8、10章 |
| ④ | 训练与稳定性 | 第7、9章 |
| ⑤ | 推理优化与部署 | 第10、12章 |
| ⑥ | 后训练与对齐 | 第11章 |
| ⑦ | RL 理论与推理训练 | 第11、12章 + RL 基础 |
| ⑧ | Agent 工程化 | 第13–20章、第22章 |
| ⑨ | 评估与验收 | 第21、22章 |
① 数学底座
这一域回答:梯度和概率从哪里来、训练损失在数学上是什么。
数值与微分
- ❒ 计算图(computational graph) —— 把一次前向计算记成有向无环图:节点是中间值,边是算子依赖;反向传播按拓扑序逆行回收梯度。→ 第4章
- ❒ 链式法则(chain rule) —— 设
,则 :复合函数的导数等于各层导数相乘,反向传播的数学依据。→ 第4章 - ❒ 梯度(gradient) —— 损失对参数的偏导向量
,指出参数往哪边调整能降 loss;一步更新 ( 是学习率, 是当前梯度)。→ 第4章 - ❒ 有限差分对拍(gradient check) —— 用
估算导数并与自动微分结果比对,验证反向实现正确——先有权威基线,再谈修复。→ 第4章
概率与信息论
- ❒ softmax —— 把 logits(未归一化实值分数
)映射为概率分布: ;必须作用在词表维(最后一维),逐行和为 1。→ 第5章 - ❒ 自信息与交叉熵(self-information / cross-entropy) —— 用
给预测计分:模型给正确 token 的概率 越小罚得越重( 时约 0.22, 时约 2.3)。对一批 token 取平均即 NLL 训练损失 ( 是第 个位置的正确 token)。→ 第5章 - ❒ KL 散度(KL divergence) —— 两个分布间的信息距离:
( 是交叉熵, 是熵)。one-hot 标签下 ,最小化交叉熵与最小化 KL 梯度等价;对齐场景的参考分布 熵不为零,必须显式计算 比值——交叉熵管「拟合标准答案」,KL 管「约束行为边界」。→ 第11章 - ❒ 无偏估计(unbiased estimator) —— 估计量的期望恰好等于被估量:
。策略梯度的每一步方差缩减增强都先证无偏再谈方差,GRPO 的偏置分析全靠这门语言。→ RL 基础 · 策略梯度 - ❒ 条件期望与塔性质(tower property) —— 全期望公式对嵌套条件的反复使用:先对一部分随机性取条件期望,期望不变、方差不增(Rao–Blackwell 视角)。策略梯度「去掉过去奖励」与「baseline 无偏」的证明都以它为工具。→ 第3章、RL 基础 · 策略梯度
Remark(底数):手算用
对齐「比特」直觉,代码实现用自然对数,两者只差常数 ;数字对不上时先查底数再查实现。→ 第5章
② 分词与表示
这一域回答:文本如何变成整数、整数如何变成向量、向量如何变回概率。
token、BPE 与 embedding
- ❒ token —— 模型处理文本的最小单位,粒度介于字符与词之间。例:「今天天气真不错」在字符级词表里是 7 个 token,在子词词表里通常更少(如「今天 / 天气 / 真不错」三段)。→ 第6章
- ❒ 字节对编码(Byte-Pair Encoding, BPE) —— 子词分词算法:从字节或字符起步,反复合并语料中最高频的相邻对,直到词表达到目标大小;核心训练循环不过二十行代码,编码任意文本、解码无损还原。→ 第6章
- ❒ 嵌入(embedding) —— 一张
查表( 是词表大小, 是向量维度):token id 取出第 行作为向量。相似的 token 自动获得相近的向量,模型对未见过的上下文也能给出合理猜测——这是神经网络取代计数表的根本原因。→ 第5章
Remark(词表成员):一个 token 是否在词表里由合并顺序、词表大小与语料共同决定;向已训练词表添加新 token(如 chat template 的特殊标记)意味着嵌入矩阵扩行、随机初始化后靠微调快速学会。→ 第6章 · 词表成员
Remark(字节层兜底):字符、字节、token 是文本的三层表示;byte 级 BPE 保证任意 UTF-8 文本都能被编码与无损还原,不依赖「词表里有没有这个词」。→ 第6章
从计数表到神经语言模型
- ❒ 自回归分解(autoregressive factorization) —— 一段文本的概率拆成逐步条件概率连乘
;生成就是反复回答同一个问题:下一个 token 是什么。例: → 第5章 - ❒ Bigram(二元计数表) —— 只看前一个字符的条件概率表:条件概率 = 搭配次数 ÷ 当前字符总次数(即最大似然估计)。上下文一长,表大小按
爆炸,这是走向连续向量空间泛化的动机。→ 第5章
解码采样三旋钮
| 旋钮 | 机制 | 典型效果 |
|---|---|---|
| 温度(temperature) | 用 | |
| Top-k | 只保留概率最高的 | 候选个数固定,拦住长尾噪声词 |
| Top-p(核采样 nucleus) | 按概率降序累加至刚好超过 | 候选个数自适应:模型笃定时收窄、模糊时放宽 |
Remark(三者边界):三个旋钮都只改解码期的分布——不进入训练损失、不改权重。temperature 是除 logits 不是乘(乘是经典故障,低温反而更随机);top-k 截固定个数,top-p 截累计概率质量。→ 第5章
③ 注意力与 Transformer
这一域回答:模型如何在一步内看见整个前缀、位置与归一化如何组织成现代 block。
注意力本体
- ❒ 缩放点积注意力(scaled dot-product attention) ——
( 是查询/键/值矩阵, 是头维度);除以 防止点积随维度增大把 softmax 推向 one-hot。例:生成「不错」时,「不错」的 与「天气」的 点积高,「天气」的 就在输出里占大权重。→ 第8章 - ❒ 多头注意力(Multi-Head Attention, MHA) —— 把
维切成 个头并行做注意力再拼接:每个头在自己的子空间里看一种关系。MQA/GQA/MLA 是它的 KV 共享谱系(见⑤)。→ 第8章 - ❒ 因果掩码(causal mask) —— 上三角置
,保证位置 只看见 的历史:既是自回归生成的正确性来源,也是 KV Cache「历史 K/V 永不改变」的根据。→ 第8章 - ❒ 混合专家(Mixture of Experts, MoE) —— 把 FFN 替换成
个专家子网络加学习的路由,每个 token 只激活得分最高的 top- 个:总参数随 线性涨、单 token 计算量接近 dense 模型;不加约束会负载坍缩到少数热门专家。→ 第12章
位置、归一化与 FFN
- ❒ 旋转位置编码(RoPE) —— 不加位置向量,直接把每两个维度组成的平面按位置
旋转角度 ;关键性质是点积只依赖位置差: ——相对位置免费进入注意力得分。→ 第10章
Remark(外推):长度外推改的是各维频率,不是配置里的最大长度;全部频率同除一个常数会让相邻 token 相位差一起变小,高频维保角、低频维插值(YaRN 的分治)是正确做法。→ 第10章
- ❒ RMSNorm —— LayerNorm 砍掉去均值、只留缩放:
( 可学习, 防除零);少一路计算、少一个参数,是 LLaMA 系的现代默认。→ 第10章 - ❒ SwiGLU —— 带门控的 FFN:
;三个矩阵各管一件事—— 出门控、 出内容、 做出口投影, 决定每个维度放行多少信息。→ 第10章 - ❒ 共享嵌入(tied embedding) —— 输入查表与输出投影共用同一张
表:「token 变向量」与「向量变回概率」是同一个空间的两个方向;GPT-2 small 词表占参数约三成,共享后整块省掉,反向时两处梯度自动累加。→ 第10章
Remark(家族边界):encoder-only / decoder-only / encoder-decoder 变体对照在课程中仅作边界级带过(本课主线是 decoder-only 文本链路);多模态与 RNN 前史同样在范围边界之外。→ 第8章
组装
- ❒ Transformer Block —— 「注意力 + FFN + 归一化 + 残差」的自重复堆叠单元:残差连接给梯度留高速通路,注意力负责混 token 间信息、FFN 负责逐位置非线性变换;TinyGPT 就是若干个这样的 block 加上嵌入与 LM head。→ 第8章
④ 训练与稳定性
这一域回答:训练循环长什么样、loss 的正常读数、优化器与调度怎么配。
目标与基线
- ❒ teacher forcing —— 训练时把真实前缀喂给模型、要求预测下一个 token,一次前向算出所有位置的 loss(TinyGPT 的训练形态);与生成期「吃自己输出」的差别是暴露偏差的来源。→ 第9章
- ❒ 初始损失基线(initial loss sanity check) —— 随机初始化的模型应当均匀猜测,第 0 步交叉熵必须约等于
( 是词表大小): 时约 4.17(TinyGPT 实测 4.1742), 时约 10.8。初始 loss 远大于 说明初始化方差过大,远小于说明发生了数据泄漏。→ 第5章 - ❒ 时间切分(train/val split) —— 语言模型数据是时间序列,按文本顺序切分训练/验证窗口;随机打乱会把未来泄露进验证集,val loss 虚低。→ 第5章
优化器与调度
- ❒ AdamW —— 一阶矩
(梯度滑动平均)与二阶矩 (梯度平方滑动平均)给出按维度自适应的步长,weight decay 解耦地直接作用于参数而不是混进梯度(这是 AdamW 相对 Adam+L2 的关键区别)。仓库 TinyGPT 诊断配置:lr=1e-3、weight_decay=0.01。→ 第7章 - ❒ 梯度裁剪(gradient clipping) ——
( 是阈值,仓库用 1.0):超过阈值时不改方向、只等比缩小,保留各维度相对比例。→ 第9章 - ❒ warmup + cosine decay —— 学习率先从 0 线性升到
(warmup 给 AdamW 动量估计的偏差校正留时间),再按余弦曲线平滑降到 ;梯度裁剪管梯度量级,调度管步长,互补而不可互相替代。→ 第9章
诊断与配方
- ❒ one-batch overfit —— 正式训练前先在同一个 batch 上反复训练,loss 应能降到接近 0:这是「前向与反向电路是否接通」的检查,与泛化能力无关。→ 第9章
- ❒ 混合精度(mixed precision) —— BF16 保留与 FP32 相同的 8 位指数、只砍尾数,动态范围对齐,从而免去 FP16 必需的动态 loss scaling;FP8(E4M3 前向激活 / E5M2 反向梯度)再进一步,是训练侧的省带宽路线。→ 第7章
- ❒ Chinchilla 缩放 —— 固定算力预算下,参数量
与训练 token 数 应等比例放大(模型翻倍、数据翻倍),修正了「只放大参数」的早期实践; 累计的是被监督 token,不是优化器步数。→ 第9章
例(贯穿):TinyGPT(词表 65、约 10.8 万参数)在「今天天气真不错」这类语料上的验收链:初始 loss ≈
⑤ 推理优化与部署
这一域回答:为什么生成慢、显存去哪了、系统侧有哪些无损与有损的提速手段。
prefill / decode 两相
| 阶段 | 输入形态 | 计算特征 | 瓶颈 | 用户感知指标 |
|---|---|---|---|---|
| prefill | 整个 prompt 一次并行处理 | 矩阵乘矩阵(GEMM),算力吃满 | 计算受限(compute-bound) | TTFT(首 token 延迟) |
| decode | 每步只进 1 个新 token | 矩阵乘向量(GEMV),GPU 利用率常跌至 1%–5% | 显存带宽受限(memory-bound) | TPOT(单 token 生成耗时) |
- ❒ KV Cache —— 因果掩码保证历史 token 的 K/V 一旦算出不再改变,缓存后每步只算新 token 的 Q/K/V;容量 = 2(K 与 V)× 层数 × KV 头数 × 头维 × 序列长 × batch × 每元素字节。例:生成「今天天气真不错」的第 5 个字时,无缓存要把前 4 个字的 K/V 全部重算,有缓存只新算第 5 个。LLaMA-2 70B 在 100 并发 × 4096 上下文下 KV Cache 约 268 GB,超过权重本身。→ 第10章
KV 瘦身与显存管理
- ❒ GQA / MQA —— 多个 query head 共享同一组 K/V head(MQA 是全部共享的极端),KV Cache 从
降到 ;约束 ,repeat 顺序错位是故障表第一项。→ 第10章 - ❒ MLA(Multi-head Latent Attention) —— 把 KV 压缩进低秩 latent 再按需解压:DeepSeek-V3 每 token 每层缓存
维(压缩向量 + 共享 RoPE key),与 query head 数无关。→ 第12章 - ❒ PagedKV —— 借操作系统虚拟内存思路:cache 切成固定大小的 block,每个请求维护 block_table(逻辑块号 → 物理块),按需增长、用完即还,多个请求共享相同 prefix 时直接共享物理块。→ 第10章
- ❒ 连续批处理(continuous batching) —— 调度粒度降到每次 decode 迭代:先完成的请求立刻出队、物理块立即回收,新请求随时入场;吞吐升高的代价是调度器每步重算组批,「批内跑多少请求」成为显式旋钮。→ 第10章
- ❒ 滑动窗口注意力(Sliding Window Attention) —— 每个 token 只看最近
个 token,KV Cache 截断为最多 条,显存从 降到 (Mistral 7B 用 ,并交替全注意力层让跨窗口信息逐层传播);节省的是缓存容量与带宽,窗口内 FLOPs 不变。→ 第10章
计算与带宽
- ❒ FlashAttention / 在线 softmax —— 分块把 Q/K/V 装进片上 SRAM(约 19 TB/s,对比 HBM 的 1.5–3.0 TB/s),用「旧分母乘尺度补偿再合并」的递推避免实体化
中间矩阵;数学输出与整行 softmax 完全一致,省掉的只是 HBM 读写。→ 第10章 - ❒ 推测解码(speculative decoding) —— 小草稿模型串行提出
个候选,目标大模型单次前向并行验证,接受率 ( 是草稿分布, 是目标分布);拒绝分支从截断差分分布重采样,最终分布与目标模型严格恒等(无损保证),工业常见 2–3 倍吞吐。→ 第10章 - ❒ 算术强度与 roofline —— 峰值算力 ÷ 显存带宽 = 脊点(H100 例:
次运算每字节);batch=1 的 decode 算术强度约 1、落在脊点左侧,出词上限 ≈ 带宽 ÷ 权重字节 ≈ 24 token/s。加大 batch、量化、算子融合都是在移动这条线上的工作点。→ 第10章
量化
- ❒ 权重量化(INT8/INT4) —— 每组权重记一个 scale,存储整数、计算前反量化回浮点;group-wise(每个「输出行 × 列组」一个 scale)比 per-tensor 更贴合局部动态范围。→ 第10章
- ❒ GPTQ-style 误差补偿 —— 用校准 Hessian
( 是校准输入, 是防秩亏的阻尼项)把已量化列的重建误差传播到未量化列;无阻尼的实现必须被门禁拒绝。→ 第10章
Remark(正交性与三本账):KV Cache 量化与权重量化正交,可独立组合精度(如 INT8 权重 + FP8 KV Cache);压缩存储、算法质量与推理吞吐是三个独立结论——无低比特 kernel 时反量化路径可能更慢。→ 第10章、第12章
训练-推理双侧的吞吐组件
- ❒ MTP(Multi-Token Prediction) —— 一次前向同时预测未来多个 token,把训练目标变稠密;推理侧可作 self-speculative 草稿(自己的 MTP 头提候选、主模型验证),与⑤的推测解码同一接受/拒绝框架。→ 第12章
- ❒ DualPipe 与计算通信重叠 —— 双向流水线并行:让前向与反向的计算 bubble 和 all-to-all 通信互相填充,是 MoE 推理(专家并行的 all-to-all 瓶颈)与大规模训练共用的吞吐手段。→ 第12章
⑥ 后训练与对齐
这一域回答:预训练模型如何变成助手,SFT / LoRA / 偏好优化各自改动什么。
SFT
- ❒ 监督微调(SFT, supervised fine-tuning) —— 用「指令 → 回答」样例把续写器改造成助手;loss 只算在 assistant 片段:
( 是掩码,assistant 位置为 1、system/user/padding 为 0),不 mask 会连用户输入一起学。→ 第11章 - ❒ chat template 与特殊 token —— 对话以特殊标记分角色(如 ChatML 的
<|im_start|>);特殊 token 意味着词表扩行、随机初始化后靠微调学会,tied embedding 下 LM head 同步扩行——缺少稳定边界,模型就要从裸文本重新推断「谁在说话」。→ 第11章 - ❒ SFT 数据配方(TÜLU 3 口径) —— 5–20 万条严格清洗的精选样本胜过百万级噪声数据;混合配比约:代码 25% / 数学 25% / 严格指令遵循 20% / 通识对话 30%;多任务混训对单一任务反而更好(任务多样性的反直觉收益)。→ 第11章
- ❒ 灾难性遗忘(catastrophic forgetting) —— 窄域 SFT 后窄域指标上升、原有能力下降;主要缓解手段:SFT 数据混入原域数据(replay)、降低学习率、用 adapter(冻结主干只训旁路——LoRA 本身就是 adapter 家族)。评测时显式报告遗忘,而不是只报微调目标的提升。→ 第11章
LoRA 家族
- ❒ LoRA(Low-Rank Adaptation) —— 冻结主干
,并联低秩增量 ( 、 ,秩 远小于原维度);768×768 主干配 只训约 2% 参数。 零初始化保证起步是 no-op,部署时增量折叠回 、推理零额外开销。→ 第11章 - ❒ QLoRA —— 把冻结的主干量化到 4-bit 存放、只训高精度 LoRA 参数,显存降一个数量级、单卡可微调数 B 模型;merge 前需反量化,精度敏感任务要做合并前后对拍。→ 第11章
偏好优化
- ❒ Bradley–Terry 偏好模型 —— 人类偏好概率满足逻辑斯蒂差分:
( 是 chosen / rejected 回答, 是奖励)。→ 第11章 - ❒ DPO(Direct Preference Optimization) —— 从 KL 约束最优策略的闭式解反解出隐式奖励,只依赖输入
的配分函数 在 chosen/rejected 做差时精确对消,得到纯监督式的二分类损失——无需 reward model、无需在线采样。 控制允许偏离参考策略多远:工业常用 0.01–0.1。→ 第11章
Remark(DPO 双陷阱):① 长度偏置——未归一化的序列对数似然让「每 token 微小正贡献 × 多写 100 token ≈ +5.0 margin」,注水拉长即可降损失;② 模式塌缩——离线隐式奖励无界,迭代过深后输出熵断崖下跌、复读化。解法是长度归一化,或 SimPO(平均对数似然 + 目标边界
,彻底丢弃参考模型、显存减半)。→ 第11章
- ❒ KTO(Kahneman-Tversky Optimization) —— 借前景理论的损失厌恶,直接消费点赞/点踩这类非成对单点反馈,无需构造偏好对,解放对齐数据管线。→ 第11章
三范式选型矩阵
| 维度 | DPO | PPO | GRPO |
|---|---|---|---|
| 独立 reward model | 不需要(隐式对消) | 必须常驻 | 不需要,天然适配规则判分(RLVR) |
| 常驻模型实例 | 2 份(actor + 冻结 ref;SimPO 可减至 1) | 4 份(actor + critic + ref + RM) | 2 份(actor + ref),无 critic |
| 梯度稳定性 | 方差小;离线易长度作弊与塌缩 | 超参敏感、易训练崩溃 | 组内均值基线无偏,训练鲁棒 |
| 探索能力 | 弱(需 iterative/on-policy 补齐) | 强(在线连续采样) | 强(组内采样自由探索) |
| 适用场景 | 通用对话、风格对齐、算力受限 | 无法规则判分的开放多维任务 | 数学/代码/逻辑等可验证深度推理 |
Remark(选型一句话):让 7B 对话模型「说话更温柔、格式更整洁」且显存有限,首选 SimPO / 长度归一化 DPO;要做 DeepSeek-R1 式长思考链推理模型,必须走可验证环境下的 GRPO / RLVR。Prompt / RAG / 微调三层选型罗盘见第11章。→ 第11章
Remark(对齐税):强化安全与格式的过程中,通用推理/数学/代码能力常伴随下降——多目标冲突下,「无害性 × 有用性」受制于帕累托前沿(过度拒答伤有用性);工程目标是把这条前沿整体向外推,而不是在单点上加码。→ 第11章
⑦ RL 理论与推理训练
这一域回答:为什么对 LLM 做 RL 必须走策略梯度这条路,PPO/GRPO/RLVR 的记账单位各是什么。
生成 MDP 与策略梯度
- ❒ 生成 MDP(token MDP) —— 把一次生成写成有限步 MDP:状态
是已写前缀,动作 是下一个 token,转移是确定拼接,中间奖励为 0、序列结束记标量 , 在 terminal-only 奖励下合法。例:「今天天气真不错」的每个前缀(「今」「今天」……)是状态,采样下一个字是动作,终答判定是终态奖励。→ 第11章 · 生成 MDP - ❒ 对数导数技巧(log-derivative trick) ——
把不可导的离散采样变成可计算的期望: ;高分回答提概率、低分回答压概率——REINFORCE 的全部。→ 第11章 - ❒ 策略梯度定理(policy gradient theorem) ——
,其中优势 :这个动作比该状态的平均水平好多少( 是动作价值, 是状态价值)。→ 第11章 · 一般定理、RL 基础 - ❒ baseline 无偏性 —— 减去任何不依赖当前动作的基线
,期望不变( )而方差下降;GRPO 组均值、RLOO 留一均值、critic 的 都是这条恒等式的实例。全正奖励且无 baseline 时,每个被采到的动作都在被推高,只剩 softmax 归一化的相对挤压在提供信号——baseline 是必需品而非优化项。→ 第11章 - ❒ stop-gradient /
.detach()—— TD 目标里的是同一个网络的输出,训练时把它当常数、切断反向图(PyTorch 的 target.detach());这种「半梯度」可证明不是任何目标的梯度下降,但实证上常优于理论更纯的全梯度版本。→ 第11章 · actor-critic
PPO
- ❒ PPO-clip 目标 ——
,其中 是新旧策略概率比, 是优势估计。正常值: ,同批数据重用约 10 个 epoch,样本量按 token 数计。→ 第11章
Remark(clip 的读法):clip 是激励机制不是禁令——似然比超过
之后更新仍可继续推,只是目标不再为超出部分付报酬;「走得太远」变得无利可图。TRPO 把信任域写成显式 KL 约束,PPO 把它折进回报结构。→ 第11章、第11章 · 策略优势视角
- ❒ KL 安全绳与奖励黑客(reward hacking) —— 目标中加入
:reward model 存在分布外盲区,「指标变成目标就不再是好指标」(古德哈特定律),策略会学会堆砌讨好话术刷分;KL 把策略锁在 RM 仍可信的邻域内。InstructGPT 三网络:策略 175B + RM 6B + value 6B(小近 30 倍换稳定性与算力)。→ 第11章 - ❒ GAE(Generalized Advantage Estimation) —— 一步 TD 残差
的指数加权和: ;正常值 、 (折扣放宽、 收小,兼顾长视野与低方差)。→ 第11章 · 生成 MDP
GRPO
- ❒ GRPO(Group Relative Policy Optimization) —— 同一 prompt 采
个回答,advantage 直接组内归一化: ( 是第 个回答的奖励),省掉整个 critic;目标仍是 PPO 式 clipped surrogate,KL 项显式加在目标里。→ 第12章
| 维度 | PPO | GRPO |
|---|---|---|
| baseline 来源 | 学到的 value model(critic) | 同 prompt 组内 reward 均值 |
| advantage 估计 | GAE(critic 递推) | 组内归一化 |
| KL 位置 | 通常折算进逐 token 奖励 | 显式项 |
| 组件数 | actor + critic + reward + ref | actor + reward(可纯规则)+ ref |
| 显存与训练成本 | 高(多一个同规模 critic) | 省一档 |
Remark(GRPO 两处偏置 → Dr. GRPO):① 逐 token 损失除以回答长度
——答错时把回答写长可摊薄惩罚;② advantage 除以组内 std——太易或太难的题(std 趋 0)权重被放大甚至零梯度。Dr. GRPO 把两处归一化都删掉,等于按 缩放的无偏策略梯度。术语诚实注脚: 是组内中心化奖励,并非 advantage 函数的无偏估计。→ 第12章 · GRPO 偏置
RLVR 与推理训练
- ❒ RLVR(Reinforcement Learning with Verifiable Reward) —— 奖励不是学出来的 RM,而是可自动判定的结果:答案相等、代码过单元测试、输出匹配正则;梯度信号无噪声,天然适配规则判分。R1-Zero 在 V3-Base 上纯 GRPO + 规则奖励:AIME 2024 pass@1 从 15.6% 涨到 71.0%(maj@64 达 86.7%)。→ 第11章
- ❒ ORM / PRM —— 结果奖励模型(只在终答打分:可全自动、标注极低,但过程可能蒙对答案)对照过程奖励模型(对思维链逐步打分:可定位错误从哪一步开始,但标注昂贵);RLVR 是 ORM 的规则化极端。→ 第11章
- ❒ expert iteration / STaR —— 不用策略梯度也能学推理:当前模型 + 测试时增强 + 结果验证构造出更强的「教师」,再用监督拟合(RL 阶段产出正确轨迹 → 拒绝采样做结果验证 → SFT 拟合,正是 R1 阶段三的工业版)。例:让模型对同一道题采
条解法、只保留判对的轨迹重新 SFT——题目哪怕是「用今天天气真不错造句」,这个循环也是最小 expert iteration。→ 第11章 · STaR - ❒ Best-of-N —— 同 prompt 独立采
个回答让 RM 挑最高分,不动权重;它是任何「用 RM 做 RL」管线必须先报的 baseline——训练后的策略打不过免训练的 BoN,训练环节就没有净收益。→ 第11章 - ❒ RL-LLM 选型三性质 —— ① 动作空间离散且巨大(词表
量级);② 预训练初始策略是绝对前提(tabula rasa 对 LLM 不成立);③ 方法必须能利用预训练策略继续改进。DQN 系(策略只是 Q 的贪心壳)与 DDPG/TD3/SAC 系(连续控制)被这三条直接筛掉。→ 第11章 · 选型边界 - ❒ 熵坍缩(entropy collapse) —— 输出分布的熵在 RL 训练早期骤降、策略过早收敛到窄输出集、探索枯竭;防住它(DAPO 损失组件 + 周期性重置 KL 惩罚)是长时间 RL 能否学到新策略的先决条件,也是「RLVR 学到新推理了吗」辩论的一方论据。→ 第11章 · rlvr-debate
- ❒
的三种病态 —— 无折扣时分三种情形:terminal-only 奖励(有限 MDP、值有限)合法;存在正奖励自环则 ;回报序列不可和则总回报无定义——RL-LLM 的 合法性靠的是第一种。→ RL 基础 · Bellman 与 VI
理论根基(深读指针)
| 主题 | 锚点 |
|---|---|
| 一般 MDP 五元组、吸收态记号工程 | RL 基础 · general MDP |
| Bellman 方程、压缩映射、价值/策略迭代 | RL 基础 · Bellman 与 VI |
| MC → TD → k-step 估计谱系( | RL 基础 · TD 谱系 |
| 四步方差缩减与 actor-critic 谱系 | RL 基础 · 策略梯度 · 第11章 |
| AlphaGo 四步训练、MCTS、test-time compute | RL 基础 · AlphaGo |
| 为什么 RL-LLM 筛掉 DQN / SAC | 第11章 · 选型边界 |
| Cliff Walk 表格 REINFORCE(本课唯一真实策略梯度循环) | 第11章 · Cliff Walk |
| 「RLVR 学到新推理了吗」未收敛辩论 | 第11章 · rlvr-debate |
⑧ Agent 工程化
这一域回答:检索、工具、记忆、编排如何组装成可控可恢复的 Agent 系统。
RAG 检索管线
- ❒ RAG(Retrieval-Augmented Generation) —— 检索增强生成:embedding 召回 → 重排 → 带引用生成;擅长动态知识与可溯源事实,不擅长改变语言风格——风格归微调管。→ 第13章
- ❒ 分块(chunking) —— 把文档切成可检索的块;块大小与重叠是召回质量的第一旋钮,工业级分块策略有量化对比。→ 第13章、第14章
- ❒ 混合检索与重排(hybrid retrieval / rerank) —— 关键词(BM25)与向量召回互补,Convex 融合后再用 cross-encoder 重排;ColBERT 的 MaxSim(token 级最大相似度求和)是迟交互重排的代表。→ 第14章
- ❒ 向量库压测与 HNSW 退化 —— 高并发下近似最近邻索引(HNSW)的召回与延迟会退化,缓存与索引参数改造是检索服务的容量必修课;上线前用压测数据说话。→ 第14章
工具、协议与恢复
- ❒ Agent 状态机 —— 把 agent 建成显式状态机:规划 → 执行 → 观察 → 终止或重规划,类型化工具调用是状态转移边;fixture 驱动的确定性测试只证明编排合同,不证明 live planner 质量。→ 第15章
- ❒ 类型化工具与权限分级(typed tools / policy) —— 工具参数带 schema 校验,模型建议与系统允许的动作分离:越权动作在边界被策略拒绝,人在回路(HITL)审批高危操作。→ 第15章
- ❒ MCP(Model Context Protocol) —— 工具与数据源的互操作协议;协议边界不等于授权边界——接入了协议还要过权限策略这一关。→ 第15章 · MCP
- ❒ 幂等与可恢复(idempotency / checkpoint) —— 工具调用带幂等键、执行状态落 checkpoint,崩溃后从断点续跑;重试无幂等等于把副作用放大。→ 第15章
记忆与上下文工程
- ❒ 记忆四代谱系 —— 无记忆 → 短期窗口 → 摘要/滚动记忆 → 显式海马长效记忆(图结构检索);context rot(长上下文退化)是推动谱系演进的三硬伤之一。→ 第17章
- ❒ Context Engineering 预算模型 —— 把上下文窗口当预算显式分配:system prompt 四段式、few-shot 示例、工具结果、记忆各占多少是设计决策,MCP 工具清单膨胀同样吃这份预算。→ 第17章
- ❒ 结构化输出 —— 按三档从宽松到严格收紧输出约束,保证下游可解析;与第16章 function calling 的参数校验同一条纪律。→ 第17章
编排、多智能体与交付
- ❒ 工作流编排(workflow vs agent) —— StateGraph/LangGraph 一类的显式图编排适合可预先分解的流程,agent 循环适合需要动态决策的任务;从最简单的方案起步是第一纪律。→ 第18章
- ❒ subagent / multi-agent —— 第一收益是上下文隔离而非分工:子任务在独立窗口跑完,主 agent 只收结构化结论;代价约 15 倍 token 量级,「子任务可独立理解、独立验证、可结构化合并」三条不满足时保持单 agent。→ 第20章
- ❒ API 客户端纪律与流式交付 —— 429 限流的指数退避加抖动(确定性可测)、流式消费与用户中断、成本意识;服务端 SSE 分块与前端增量渲染构成全双工链路。→ 第16章、第19章
⑨ 评估与验收
这一域回答:怎么证明系统真的在变好——冻结规范、裁判校准、双层验收与证据。
评估纪律
- ❒ 冻结评估规范(frozen eval spec) —— 阈值在看到结果之前冻结(仓库
eval/eval-spec-v1.yaml);事后挑阈值等于把随机性写进结论。→ 第21章 - ❒ pass@k / maj@k —— 两种能力账:pass@1 是单次采样答对率;maj@64 是同题独立采样 64 次取多数(self-consistency),属推理时扩展。maj 与 pass@1 的差是推理时算力买来的,与训练改进不能混算。例:让模型把「今天天气真不错」译成英文 64 次,多数答案的正确率通常高于单次采样。→ 第12章
- ❒ 困惑度(perplexity) ——
,数值越低模型对序列越不「惊讶」;它与 tokenizer 绑定,不同词表的 NLL 不可直接比较,只在同一 tokenizer、同一语料下横向有意义。→ 第11章
LLM-as-a-Judge
- ❒ LLM-as-a-Judge(LaaJ) —— 用裁判模型自动评分;必须以人工高质量标注为真值锚点,报告一致率与分歧样例(仓库合成标注 30 条、一致率 0.9、显式列 3 条分歧),用 Judge 输出直接训练 Judge 会自我确认滚雪球。→ 第21章
| 偏置 | 机制 | 对策 |
|---|---|---|
| 自评偏置(self-enhancement) | 偏爱同系列或同范式模型 | 多模型陪审团(committee) |
| 长度偏置(verbosity) | 偏爱冗长繁复排版 | 细粒度量规(rubric) |
| 位置偏置(position) | 成对对比偏爱固定位置 | 成对交换对称性:(A,B) 与 (B,A) 双测一致才计胜 |
| 风格偏置(style) | 偏爱礼貌与术语密集 | rubric 事实项逐条 Pass/Fail |
| 对抗脆弱(adversarial) | 被注入「评满分」指令劫持 | 陪审团 + 输入隔离 |
- ❒ pointwise vs pairwise —— 逐项打分(开销随模型数线性,便于固定基准分)对照成对盲测(人类更擅长相对比较、区分度更高,用循环赛制或 Elo/Bradley-Terry 聚合)。→ 第21章
- ❒ ECE 与 Cohen's kappa —— 期望校准误差(置信度与实际准确率分箱比对,揭「高置信判错」)与扣除偶然一致的 kappa(Judge 与人工标注吻合度的标准统计量);两个评分器差异的显著性用 McNemar 检验。→ 第21章
Agent 验收
- ❒ component / trajectory 双层验收 —— 组件级(单工具、单检索的质量)与轨迹级(整条执行链是否达成目标)分开评估,对应第21章的评测面与第22章的 Capstone 验收链。→ 第21章、第22章
- ❒ Agent 生产稳定性清单 —— 上线前的 6 维工程 Checklist:从输入层(截断、意图白名单、编码清洗)到模型层(受限解码、采样确定性绑定、降级路由)再到工具层(幂等键与重试配额),每一项都配可验证断言,不是自评作文。→ 第21章
- ❒ 证据绑定(evidence binding) —— 声称完成必须附可复现命令与真实输出;机器快照与学习者提交分开存档,浏览器证据绑定 dist 哈希,站点重建后旧证据失效、需按约定重采。→ 第22章
附:高频故障速查(跨域收割)
各章「故障注入与预期信号」表的最小检索版:按症状找机制,再跳对应章修。
| 域 | 注入 | 预期失败信号 | 深读 |
|---|---|---|---|
| ② | temperature 乘而非除 logits | 低温反而更随机,分布尖锐度反转 | 第5章 |
| ② | softmax 作用在 batch 维 | 每个 token 的概率和不为 1 | 第5章 |
| ② | target 未右移 | 模型学成复制当前 token,loss 虚低 | 第5章 |
| ④ | 训练/验证用同一份数据 | val loss 看似在降,实际复读训练集 | 第5章 |
| ⑤ | cache append 时重置 position | RoPE 相位错乱,输出分布漂移 | 第10章 |
| ⑤ | GQA 的 K/V head repeat 错位 | 输出与 MHA 对照不一致 | 第10章 |
| ⑤ | 量化后忘记反量化 scale | 输出尺度整体偏移、loss 假低 | 第10章 |
| ⑤ | SwiGLU 把 | 反向梯度符号错误 | 第10章 |
| ⑤ | GPTQ 校准无阻尼(秩亏) | 必须被门禁拒绝(gate) | 第10章 |
| ⑥ | SFT 不加 assistant mask | 模型连用户输入一起学、替用户说话 | 第11章 |
| ⑥ | DPO 用未归一化对数似然 | 注水冗长回答被判优(margin 虚高) | 第11章 |
| ⑦ | REINFORCE 关掉 baseline | 跨 seed 不稳定,部分 seed 坠入失败循环 | 第11章 · Cliff Walk |
来源与相关页面
- 本页的知识体系是本课程自有正文(第 1–23 章与前沿参考页)的最小检索投影;条目与术语表呼应但不复制其全文,所有数值以对应章节正文为准。
- 排版形态(❒ 术语卡 + Remark 双通道、判断支持型对照表、结论式公式就地定义、贯穿示例、两深层级纪律)参考 Stanford CME295 VIP Cheatsheet(Amidi & Amidi, 2026, MIT License)的设计解剖,内容零复制;形态分析与取用边界见覆盖差距审计(2026-10-05)。
- 深读入口:术语表 · 必读论文索引 · RL 基础:从 MDP 到策略梯度 · 形式化验证