Skip to content

速查表 · 九域检索索引 ​

版本:2026-10-10 v2。覆盖第 1–23 章与前沿参考页的检索层快照,数字与结论全部收割自课程正文。

用法:本页是检索索引,不是替代品——每个条目以 → 链到承载推导、证明与实验的深度小节;公式只给结论,符号在紧邻句就地定义,本页不设全局记号表。术语的完整定义、前端类比与代码定位以术语表为事实源;论文出处一律见必读论文索引,不在本页堆叠。

贯穿示例:全页用 TinyGPT 与一句中文语料「今天天气真不错」做同一条线索,缝合分词、注意力、训练、推理系统与强化学习各域;相关条目以 例 标注。

域导航 ​

域主题主承载
①数学底座第3、4章
②分词与表示第5、6章
③注意力与 Transformer第8、10章
④训练与稳定性第7、9章
⑤推理优化与部署第10、12章
⑥后训练与对齐第11章
⑦RL 理论与推理训练第11、12章 + RL 基础
⑧Agent 工程化第13–20章、第22章
⑨评估与验收第21、22章

① 数学底座 ​

这一域回答:梯度和概率从哪里来、训练损失在数学上是什么。

数值与微分 ​

  • ❒ 计算图(computational graph) —— 把一次前向计算记成有向无环图:节点是中间值,边是算子依赖;反向传播按拓扑序逆行回收梯度。→ 第4章
  • ❒ 链式法则(chain rule) —— 设 L=g(f(x)),则 ∂L∂x=∂L∂y∂y∂x:复合函数的导数等于各层导数相乘,反向传播的数学依据。→ 第4章
  • ❒ 梯度(gradient) —— 损失对参数的偏导向量 ∇wL,指出参数往哪边调整能降 loss;一步更新 w←w−ηg(η 是学习率,g 是当前梯度)。→ 第4章
  • ❒ 有限差分对拍(gradient check) —— 用 f(x+ϵ)−f(x−ϵ)2ϵ 估算导数并与自动微分结果比对,验证反向实现正确——先有权威基线,再谈修复。→ 第4章

概率与信息论 ​

  • ❒ softmax —— 把 logits(未归一化实值分数 z)映射为概率分布:pi=ezi/∑jezj;必须作用在词表维(最后一维),逐行和为 1。→ 第5章
  • ❒ 自信息与交叉熵(self-information / cross-entropy) —— 用 −log⁡p 给预测计分:模型给正确 token 的概率 p 越小罚得越重(p=0.8 时约 0.22,p=0.1 时约 2.3)。对一批 token 取平均即 NLL 训练损失 L=−1N∑ilog⁡pi,yi(yi 是第 i 个位置的正确 token)。→ 第5章
  • ❒ KL 散度(KL divergence) —— 两个分布间的信息距离:DKL(P∥Q)=H(P,Q)−H(P)(H(P,Q) 是交叉熵,H(P) 是熵)。one-hot 标签下 H(P)=0,最小化交叉熵与最小化 KL 梯度等价;对齐场景的参考分布 πref 熵不为零,必须显式计算 πθ/πref 比值——交叉熵管「拟合标准答案」,KL 管「约束行为边界」。→ 第11章
  • ❒ 无偏估计(unbiased estimator) —— 估计量的期望恰好等于被估量:E[θ^]=θ。策略梯度的每一步方差缩减增强都先证无偏再谈方差,GRPO 的偏置分析全靠这门语言。→ RL 基础 · 策略梯度
  • ❒ 条件期望与塔性质(tower property) —— 全期望公式对嵌套条件的反复使用:先对一部分随机性取条件期望,期望不变、方差不增(Rao–Blackwell 视角)。策略梯度「去掉过去奖励」与「baseline 无偏」的证明都以它为工具。→ 第3章、RL 基础 · 策略梯度

Remark(底数):手算用 log2 对齐「比特」直觉,代码实现用自然对数,两者只差常数 ln⁡2;数字对不上时先查底数再查实现。→ 第5章


② 分词与表示 ​

这一域回答:文本如何变成整数、整数如何变成向量、向量如何变回概率。

token、BPE 与 embedding ​

  • ❒ token —— 模型处理文本的最小单位,粒度介于字符与词之间。例:「今天天气真不错」在字符级词表里是 7 个 token,在子词词表里通常更少(如「今天 / 天气 / 真不错」三段)。→ 第6章
  • ❒ 字节对编码(Byte-Pair Encoding, BPE) —— 子词分词算法:从字节或字符起步,反复合并语料中最高频的相邻对,直到词表达到目标大小;核心训练循环不过二十行代码,编码任意文本、解码无损还原。→ 第6章
  • ❒ 嵌入(embedding) —— 一张 (V,D) 查表(V 是词表大小,D 是向量维度):token id 取出第 i 行作为向量。相似的 token 自动获得相近的向量,模型对未见过的上下文也能给出合理猜测——这是神经网络取代计数表的根本原因。→ 第5章

Remark(词表成员):一个 token 是否在词表里由合并顺序、词表大小与语料共同决定;向已训练词表添加新 token(如 chat template 的特殊标记)意味着嵌入矩阵扩行、随机初始化后靠微调快速学会。→ 第6章 · 词表成员

Remark(字节层兜底):字符、字节、token 是文本的三层表示;byte 级 BPE 保证任意 UTF-8 文本都能被编码与无损还原,不依赖「词表里有没有这个词」。→ 第6章

从计数表到神经语言模型 ​

  • ❒ 自回归分解(autoregressive factorization) —— 一段文本的概率拆成逐步条件概率连乘 P(x1:T)=∏tP(xt∣x<t);生成就是反复回答同一个问题:下一个 token 是什么。例:P(今天天气真不错)=P(今)×P(天∣今)×⋯ → 第5章
  • ❒ Bigram(二元计数表) —— 只看前一个字符的条件概率表:条件概率 = 搭配次数 ÷ 当前字符总次数(即最大似然估计)。上下文一长,表大小按 Vk 爆炸,这是走向连续向量空间泛化的动机。→ 第5章

解码采样三旋钮 ​

旋钮机制典型效果
温度(temperature)用 T 除 logits 再 softmax:pi=softmax(z/T)iT<1 分布尖锐,适合代码与算术;T>1 平缓,更有创造性;工程上常夹在 [0.5,1.5]
Top-k只保留概率最高的 k 个候选,其余 logits 置 −∞ 后重新归一化候选个数固定,拦住长尾噪声词
Top-p(核采样 nucleus)按概率降序累加至刚好超过 p(如 0.9),只在头部概率质量内采样候选个数自适应:模型笃定时收窄、模糊时放宽

Remark(三者边界):三个旋钮都只改解码期的分布——不进入训练损失、不改权重。temperature 是除 logits 不是乘(乘是经典故障,低温反而更随机);top-k 截固定个数,top-p 截累计概率质量。→ 第5章


③ 注意力与 Transformer ​

这一域回答:模型如何在一步内看见整个前缀、位置与归一化如何组织成现代 block。

注意力本体 ​

  • ❒ 缩放点积注意力(scaled dot-product attention) —— Attention(Q,K,V)=softmax(QK⊤/dk)V(Q,K,V 是查询/键/值矩阵,dk 是头维度);除以 dk 防止点积随维度增大把 softmax 推向 one-hot。例:生成「不错」时,「不错」的 Q 与「天气」的 K 点积高,「天气」的 V 就在输出里占大权重。→ 第8章
  • ❒ 多头注意力(Multi-Head Attention, MHA) —— 把 d 维切成 H 个头并行做注意力再拼接:每个头在自己的子空间里看一种关系。MQA/GQA/MLA 是它的 KV 共享谱系(见⑤)。→ 第8章
  • ❒ 因果掩码(causal mask) —— 上三角置 −∞,保证位置 t 只看见 ≤t 的历史:既是自回归生成的正确性来源,也是 KV Cache「历史 K/V 永不改变」的根据。→ 第8章
  • ❒ 混合专家(Mixture of Experts, MoE) —— 把 FFN 替换成 N 个专家子网络加学习的路由,每个 token 只激活得分最高的 top-k 个:总参数随 N 线性涨、单 token 计算量接近 dense 模型;不加约束会负载坍缩到少数热门专家。→ 第12章

位置、归一化与 FFN ​

  • ❒ 旋转位置编码(RoPE) —— 不加位置向量,直接把每两个维度组成的平面按位置 m 旋转角度 mω;关键性质是点积只依赖位置差:⟨RoPE(q,m),RoPE(k,n)⟩=f(m−n)——相对位置免费进入注意力得分。→ 第10章

Remark(外推):长度外推改的是各维频率,不是配置里的最大长度;全部频率同除一个常数会让相邻 token 相位差一起变小,高频维保角、低频维插值(YaRN 的分治)是正确做法。→ 第10章

  • ❒ RMSNorm —— LayerNorm 砍掉去均值、只留缩放:RMSNorm(x)i=γixi/mean(x2)+ϵ(γ 可学习,ϵ 防除零);少一路计算、少一个参数,是 LLaMA 系的现代默认。→ 第10章
  • ❒ SwiGLU —— 带门控的 FFN:(SiLU(xW1)⊙xW2)W3;三个矩阵各管一件事——W1 出门控、W2 出内容、W3 做出口投影,⊙ 决定每个维度放行多少信息。→ 第10章
  • ❒ 共享嵌入(tied embedding) —— 输入查表与输出投影共用同一张 (V,D) 表:「token 变向量」与「向量变回概率」是同一个空间的两个方向;GPT-2 small 词表占参数约三成,共享后整块省掉,反向时两处梯度自动累加。→ 第10章

Remark(家族边界):encoder-only / decoder-only / encoder-decoder 变体对照在课程中仅作边界级带过(本课主线是 decoder-only 文本链路);多模态与 RNN 前史同样在范围边界之外。→ 第8章

组装 ​

  • ❒ Transformer Block —— 「注意力 + FFN + 归一化 + 残差」的自重复堆叠单元:残差连接给梯度留高速通路,注意力负责混 token 间信息、FFN 负责逐位置非线性变换;TinyGPT 就是若干个这样的 block 加上嵌入与 LM head。→ 第8章

④ 训练与稳定性 ​

这一域回答:训练循环长什么样、loss 的正常读数、优化器与调度怎么配。

目标与基线 ​

  • ❒ teacher forcing —— 训练时把真实前缀喂给模型、要求预测下一个 token,一次前向算出所有位置的 loss(TinyGPT 的训练形态);与生成期「吃自己输出」的差别是暴露偏差的来源。→ 第9章
  • ❒ 初始损失基线(initial loss sanity check) —— 随机初始化的模型应当均匀猜测,第 0 步交叉熵必须约等于 ln⁡V(V 是词表大小):V=65 时约 4.17(TinyGPT 实测 4.1742),V=50257 时约 10.8。初始 loss 远大于 ln⁡V 说明初始化方差过大,远小于说明发生了数据泄漏。→ 第5章
  • ❒ 时间切分(train/val split) —— 语言模型数据是时间序列,按文本顺序切分训练/验证窗口;随机打乱会把未来泄露进验证集,val loss 虚低。→ 第5章

优化器与调度 ​

  • ❒ AdamW —— 一阶矩 m(梯度滑动平均)与二阶矩 v(梯度平方滑动平均)给出按维度自适应的步长,weight decay 解耦地直接作用于参数而不是混进梯度(这是 AdamW 相对 Adam+L2 的关键区别)。仓库 TinyGPT 诊断配置:lr=1e-3、weight_decay=0.01。→ 第7章
  • ❒ 梯度裁剪(gradient clipping) —— g←g⋅min(1,c/∥g∥)(c 是阈值,仓库用 1.0):超过阈值时不改方向、只等比缩小,保留各维度相对比例。→ 第9章
  • ❒ warmup + cosine decay —— 学习率先从 0 线性升到 ηmax(warmup 给 AdamW 动量估计的偏差校正留时间),再按余弦曲线平滑降到 ηmin;梯度裁剪管梯度量级,调度管步长,互补而不可互相替代。→ 第9章

诊断与配方 ​

  • ❒ one-batch overfit —— 正式训练前先在同一个 batch 上反复训练,loss 应能降到接近 0:这是「前向与反向电路是否接通」的检查,与泛化能力无关。→ 第9章
  • ❒ 混合精度(mixed precision) —— BF16 保留与 FP32 相同的 8 位指数、只砍尾数,动态范围对齐,从而免去 FP16 必需的动态 loss scaling;FP8(E4M3 前向激活 / E5M2 反向梯度)再进一步,是训练侧的省带宽路线。→ 第7章
  • ❒ Chinchilla 缩放 —— 固定算力预算下,参数量 N 与训练 token 数 D 应等比例放大(模型翻倍、数据翻倍),修正了「只放大参数」的早期实践;D 累计的是被监督 token,不是优化器步数。→ 第9章

例(贯穿):TinyGPT(词表 65、约 10.8 万参数)在「今天天气真不错」这类语料上的验收链:初始 loss ≈ ln⁡65 → one-batch overfit 通过 → 全语料 loss 下降 → held-out loss 独立可解释。→ 第9章


⑤ 推理优化与部署 ​

这一域回答:为什么生成慢、显存去哪了、系统侧有哪些无损与有损的提速手段。

prefill / decode 两相 ​

阶段输入形态计算特征瓶颈用户感知指标
prefill整个 prompt 一次并行处理矩阵乘矩阵(GEMM),算力吃满计算受限(compute-bound)TTFT(首 token 延迟)
decode每步只进 1 个新 token矩阵乘向量(GEMV),GPU 利用率常跌至 1%–5%显存带宽受限(memory-bound)TPOT(单 token 生成耗时)
  • ❒ KV Cache —— 因果掩码保证历史 token 的 K/V 一旦算出不再改变,缓存后每步只算新 token 的 Q/K/V;容量 = 2(K 与 V)× 层数 × KV 头数 × 头维 × 序列长 × batch × 每元素字节。例:生成「今天天气真不错」的第 5 个字时,无缓存要把前 4 个字的 K/V 全部重算,有缓存只新算第 5 个。LLaMA-2 70B 在 100 并发 × 4096 上下文下 KV Cache 约 268 GB,超过权重本身。→ 第10章

KV 瘦身与显存管理 ​

  • ❒ GQA / MQA —— 多个 query head 共享同一组 K/V head(MQA 是全部共享的极端),KV Cache 从 O(Hq⋅T) 降到 O(Hkv⋅T);约束 HqmodHkv=0,repeat 顺序错位是故障表第一项。→ 第10章
  • ❒ MLA(Multi-head Latent Attention) —— 把 KV 压缩进低秩 latent 再按需解压:DeepSeek-V3 每 token 每层缓存 512+64=576 维(压缩向量 + 共享 RoPE key),与 query head 数无关。→ 第12章
  • ❒ PagedKV —— 借操作系统虚拟内存思路:cache 切成固定大小的 block,每个请求维护 block_table(逻辑块号 → 物理块),按需增长、用完即还,多个请求共享相同 prefix 时直接共享物理块。→ 第10章
  • ❒ 连续批处理(continuous batching) —— 调度粒度降到每次 decode 迭代:先完成的请求立刻出队、物理块立即回收,新请求随时入场;吞吐升高的代价是调度器每步重算组批,「批内跑多少请求」成为显式旋钮。→ 第10章
  • ❒ 滑动窗口注意力(Sliding Window Attention) —— 每个 token 只看最近 W 个 token,KV Cache 截断为最多 W 条,显存从 O(T) 降到 O(W)(Mistral 7B 用 W=4096,并交替全注意力层让跨窗口信息逐层传播);节省的是缓存容量与带宽,窗口内 FLOPs 不变。→ 第10章

计算与带宽 ​

  • ❒ FlashAttention / 在线 softmax —— 分块把 Q/K/V 装进片上 SRAM(约 19 TB/s,对比 HBM 的 1.5–3.0 TB/s),用「旧分母乘尺度补偿再合并」的递推避免实体化 N×N 中间矩阵;数学输出与整行 softmax 完全一致,省掉的只是 HBM 读写。→ 第10章
  • ❒ 推测解码(speculative decoding) —— 小草稿模型串行提出 k 个候选,目标大模型单次前向并行验证,接受率 α(x)=min(1,q(x)/p(x))(p 是草稿分布,q 是目标分布);拒绝分支从截断差分分布重采样,最终分布与目标模型严格恒等(无损保证),工业常见 2–3 倍吞吐。→ 第10章
  • ❒ 算术强度与 roofline —— 峰值算力 ÷ 显存带宽 = 脊点(H100 例:989/3.35≈295 次运算每字节);batch=1 的 decode 算术强度约 1、落在脊点左侧,出词上限 ≈ 带宽 ÷ 权重字节 ≈ 24 token/s。加大 batch、量化、算子融合都是在移动这条线上的工作点。→ 第10章

量化 ​

  • ❒ 权重量化(INT8/INT4) —— 每组权重记一个 scale,存储整数、计算前反量化回浮点;group-wise(每个「输出行 × 列组」一个 scale)比 per-tensor 更贴合局部动态范围。→ 第10章
  • ❒ GPTQ-style 误差补偿 —— 用校准 Hessian H=X⊤X/N+λI(X 是校准输入,λI 是防秩亏的阻尼项)把已量化列的重建误差传播到未量化列;无阻尼的实现必须被门禁拒绝。→ 第10章

Remark(正交性与三本账):KV Cache 量化与权重量化正交,可独立组合精度(如 INT8 权重 + FP8 KV Cache);压缩存储、算法质量与推理吞吐是三个独立结论——无低比特 kernel 时反量化路径可能更慢。→ 第10章、第12章

训练-推理双侧的吞吐组件 ​

  • ❒ MTP(Multi-Token Prediction) —— 一次前向同时预测未来多个 token,把训练目标变稠密;推理侧可作 self-speculative 草稿(自己的 MTP 头提候选、主模型验证),与⑤的推测解码同一接受/拒绝框架。→ 第12章
  • ❒ DualPipe 与计算通信重叠 —— 双向流水线并行:让前向与反向的计算 bubble 和 all-to-all 通信互相填充,是 MoE 推理(专家并行的 all-to-all 瓶颈)与大规模训练共用的吞吐手段。→ 第12章

⑥ 后训练与对齐 ​

这一域回答:预训练模型如何变成助手,SFT / LoRA / 偏好优化各自改动什么。

SFT ​

  • ❒ 监督微调(SFT, supervised fine-tuning) —— 用「指令 → 回答」样例把续写器改造成助手;loss 只算在 assistant 片段:LSFT=−∑tmtlog⁡pθ(yt∣x≤t)(mt 是掩码,assistant 位置为 1、system/user/padding 为 0),不 mask 会连用户输入一起学。→ 第11章
  • ❒ chat template 与特殊 token —— 对话以特殊标记分角色(如 ChatML 的 <|im_start|>);特殊 token 意味着词表扩行、随机初始化后靠微调学会,tied embedding 下 LM head 同步扩行——缺少稳定边界,模型就要从裸文本重新推断「谁在说话」。→ 第11章
  • ❒ SFT 数据配方(TÜLU 3 口径) —— 5–20 万条严格清洗的精选样本胜过百万级噪声数据;混合配比约:代码 25% / 数学 25% / 严格指令遵循 20% / 通识对话 30%;多任务混训对单一任务反而更好(任务多样性的反直觉收益)。→ 第11章
  • ❒ 灾难性遗忘(catastrophic forgetting) —— 窄域 SFT 后窄域指标上升、原有能力下降;主要缓解手段:SFT 数据混入原域数据(replay)、降低学习率、用 adapter(冻结主干只训旁路——LoRA 本身就是 adapter 家族)。评测时显式报告遗忘,而不是只报微调目标的提升。→ 第11章

LoRA 家族 ​

  • ❒ LoRA(Low-Rank Adaptation) —— 冻结主干 W,并联低秩增量 W′=W+αrBA(A∈Rr×din、B∈Rdout×r,秩 r 远小于原维度);768×768 主干配 r=8 只训约 2% 参数。B 零初始化保证起步是 no-op,部署时增量折叠回 W、推理零额外开销。→ 第11章
  • ❒ QLoRA —— 把冻结的主干量化到 4-bit 存放、只训高精度 LoRA 参数,显存降一个数量级、单卡可微调数 B 模型;merge 前需反量化,精度敏感任务要做合并前后对拍。→ 第11章

偏好优化 ​

  • ❒ Bradley–Terry 偏好模型 —— 人类偏好概率满足逻辑斯蒂差分:P(yw≻yl∣x)=σ(r(x,yw)−r(x,yl))(yw/yl 是 chosen / rejected 回答,r 是奖励)。→ 第11章
  • ❒ DPO(Direct Preference Optimization) —— 从 KL 约束最优策略的闭式解反解出隐式奖励,只依赖输入 x 的配分函数 Z(x) 在 chosen/rejected 做差时精确对消,得到纯监督式的二分类损失——无需 reward model、无需在线采样。β 控制允许偏离参考策略多远:工业常用 0.01–0.1。→ 第11章

Remark(DPO 双陷阱):① 长度偏置——未归一化的序列对数似然让「每 token 微小正贡献 × 多写 100 token ≈ +5.0 margin」,注水拉长即可降损失;② 模式塌缩——离线隐式奖励无界,迭代过深后输出熵断崖下跌、复读化。解法是长度归一化,或 SimPO(平均对数似然 + 目标边界 γ,彻底丢弃参考模型、显存减半)。→ 第11章

  • ❒ KTO(Kahneman-Tversky Optimization) —— 借前景理论的损失厌恶,直接消费点赞/点踩这类非成对单点反馈,无需构造偏好对,解放对齐数据管线。→ 第11章

三范式选型矩阵 ​

维度DPOPPOGRPO
独立 reward model不需要(隐式对消)必须常驻不需要,天然适配规则判分(RLVR)
常驻模型实例2 份(actor + 冻结 ref;SimPO 可减至 1)4 份(actor + critic + ref + RM)2 份(actor + ref),无 critic
梯度稳定性方差小;离线易长度作弊与塌缩超参敏感、易训练崩溃组内均值基线无偏,训练鲁棒
探索能力弱(需 iterative/on-policy 补齐)强(在线连续采样)强(组内采样自由探索)
适用场景通用对话、风格对齐、算力受限无法规则判分的开放多维任务数学/代码/逻辑等可验证深度推理

Remark(选型一句话):让 7B 对话模型「说话更温柔、格式更整洁」且显存有限,首选 SimPO / 长度归一化 DPO;要做 DeepSeek-R1 式长思考链推理模型,必须走可验证环境下的 GRPO / RLVR。Prompt / RAG / 微调三层选型罗盘见第11章。→ 第11章

Remark(对齐税):强化安全与格式的过程中,通用推理/数学/代码能力常伴随下降——多目标冲突下,「无害性 × 有用性」受制于帕累托前沿(过度拒答伤有用性);工程目标是把这条前沿整体向外推,而不是在单点上加码。→ 第11章


⑦ RL 理论与推理训练 ​

这一域回答:为什么对 LLM 做 RL 必须走策略梯度这条路,PPO/GRPO/RLVR 的记账单位各是什么。

生成 MDP 与策略梯度 ​

  • ❒ 生成 MDP(token MDP) —— 把一次生成写成有限步 MDP:状态 st 是已写前缀,动作 at 是下一个 token,转移是确定拼接,中间奖励为 0、序列结束记标量 R(y),γ=1 在 terminal-only 奖励下合法。例:「今天天气真不错」的每个前缀(「今」「今天」……)是状态,采样下一个字是动作,终答判定是终态奖励。→ 第11章 · 生成 MDP
  • ❒ 对数导数技巧(log-derivative trick) —— ∇θπθ(y)=πθ(y)∇θlog⁡πθ(y) 把不可导的离散采样变成可计算的期望:∇θJ=Ey∼πθ[∇θlog⁡πθ(y)⋅R(y)];高分回答提概率、低分回答压概率——REINFORCE 的全部。→ 第11章
  • ❒ 策略梯度定理(policy gradient theorem) —— ∇θJ=E[∑tγt∇θlog⁡πθ(at∣st)Aπ(st,at)],其中优势 Aπ(s,a)=Qπ(s,a)−Vπ(s):这个动作比该状态的平均水平好多少(Q 是动作价值,V 是状态价值)。→ 第11章 · 一般定理、RL 基础
  • ❒ baseline 无偏性 —— 减去任何不依赖当前动作的基线 b(st),期望不变(E[∇log⁡π⋅b]=0)而方差下降;GRPO 组均值、RLOO 留一均值、critic 的 Vϕ 都是这条恒等式的实例。全正奖励且无 baseline 时,每个被采到的动作都在被推高,只剩 softmax 归一化的相对挤压在提供信号——baseline 是必需品而非优化项。→ 第11章
  • ❒ stop-gradient / .detach() —— TD 目标里的 Vϕ(s′) 是同一个网络的输出,训练时把它当常数、切断反向图(PyTorch 的 target.detach());这种「半梯度」可证明不是任何目标的梯度下降,但实证上常优于理论更纯的全梯度版本。→ 第11章 · actor-critic

PPO ​

  • ❒ PPO-clip 目标 —— LCLIP=E^t[min(rtA^t, clip(rt,1−ε,1+ε)A^t)],其中 rt=πθ(at∣st)/πold(at∣st) 是新旧策略概率比,A^t 是优势估计。正常值:ε=0.2,同批数据重用约 10 个 epoch,样本量按 token 数计。→ 第11章

Remark(clip 的读法):clip 是激励机制不是禁令——似然比超过 1+ε 之后更新仍可继续推,只是目标不再为超出部分付报酬;「走得太远」变得无利可图。TRPO 把信任域写成显式 KL 约束,PPO 把它折进回报结构。→ 第11章、第11章 · 策略优势视角

  • ❒ KL 安全绳与奖励黑客(reward hacking) —— 目标中加入 −βDKL(πθ∥πref):reward model 存在分布外盲区,「指标变成目标就不再是好指标」(古德哈特定律),策略会学会堆砌讨好话术刷分;KL 把策略锁在 RM 仍可信的邻域内。InstructGPT 三网络:策略 175B + RM 6B + value 6B(小近 30 倍换稳定性与算力)。→ 第11章
  • ❒ GAE(Generalized Advantage Estimation) —— 一步 TD 残差 δt=rt+γV(st+1)−V(st) 的指数加权和:A^t=∑l(γλ)lδt+l;正常值 γ=0.995、λ=0.96(折扣放宽、λ 收小,兼顾长视野与低方差)。→ 第11章 · 生成 MDP

GRPO ​

  • ❒ GRPO(Group Relative Policy Optimization) —— 同一 prompt 采 G 个回答,advantage 直接组内归一化:Ai=(ri−mean(r))/std(r)(ri 是第 i 个回答的奖励),省掉整个 critic;目标仍是 PPO 式 clipped surrogate,KL 项显式加在目标里。→ 第12章
维度PPOGRPO
baseline 来源学到的 value model(critic)同 prompt 组内 reward 均值
advantage 估计GAE(critic 递推)组内归一化 (r−μ)/σ
KL 位置通常折算进逐 token 奖励显式项 −βDKL(π|πref)
组件数actor + critic + reward + refactor + reward(可纯规则)+ ref
显存与训练成本高(多一个同规模 critic)省一档

Remark(GRPO 两处偏置 → Dr. GRPO):① 逐 token 损失除以回答长度 |oi|——答错时把回答写长可摊薄惩罚;② advantage 除以组内 std——太易或太难的题(std 趋 0)权重被放大甚至零梯度。Dr. GRPO 把两处归一化都删掉,等于按 N−1N 缩放的无偏策略梯度。术语诚实注脚:r−mean 是组内中心化奖励,并非 advantage 函数的无偏估计。→ 第12章 · GRPO 偏置

RLVR 与推理训练 ​

  • ❒ RLVR(Reinforcement Learning with Verifiable Reward) —— 奖励不是学出来的 RM,而是可自动判定的结果:答案相等、代码过单元测试、输出匹配正则;梯度信号无噪声,天然适配规则判分。R1-Zero 在 V3-Base 上纯 GRPO + 规则奖励:AIME 2024 pass@1 从 15.6% 涨到 71.0%(maj@64 达 86.7%)。→ 第11章
  • ❒ ORM / PRM —— 结果奖励模型(只在终答打分:可全自动、标注极低,但过程可能蒙对答案)对照过程奖励模型(对思维链逐步打分:可定位错误从哪一步开始,但标注昂贵);RLVR 是 ORM 的规则化极端。→ 第11章
  • ❒ expert iteration / STaR —— 不用策略梯度也能学推理:当前模型 + 测试时增强 + 结果验证构造出更强的「教师」,再用监督拟合(RL 阶段产出正确轨迹 → 拒绝采样做结果验证 → SFT 拟合,正是 R1 阶段三的工业版)。例:让模型对同一道题采 N 条解法、只保留判对的轨迹重新 SFT——题目哪怕是「用今天天气真不错造句」,这个循环也是最小 expert iteration。→ 第11章 · STaR
  • ❒ Best-of-N —— 同 prompt 独立采 N 个回答让 RM 挑最高分,不动权重;它是任何「用 RM 做 RL」管线必须先报的 baseline——训练后的策略打不过免训练的 BoN,训练环节就没有净收益。→ 第11章
  • ❒ RL-LLM 选型三性质 —— ① 动作空间离散且巨大(词表 105 量级);② 预训练初始策略是绝对前提(tabula rasa 对 LLM 不成立);③ 方法必须能利用预训练策略继续改进。DQN 系(策略只是 Q 的贪心壳)与 DDPG/TD3/SAC 系(连续控制)被这三条直接筛掉。→ 第11章 · 选型边界
  • ❒ 熵坍缩(entropy collapse) —— 输出分布的熵在 RL 训练早期骤降、策略过早收敛到窄输出集、探索枯竭;防住它(DAPO 损失组件 + 周期性重置 KL 惩罚)是长时间 RL 能否学到新策略的先决条件,也是「RLVR 学到新推理了吗」辩论的一方论据。→ 第11章 · rlvr-debate
  • ❒ γ=1 的三种病态 —— 无折扣时分三种情形:terminal-only 奖励(有限 MDP、值有限)合法;存在正奖励自环则 V=+∞;回报序列不可和则总回报无定义——RL-LLM 的 γ=1 合法性靠的是第一种。→ RL 基础 · Bellman 与 VI

理论根基(深读指针) ​

主题锚点
一般 MDP 五元组、吸收态记号工程RL 基础 · general MDP
Bellman 方程、压缩映射、价值/策略迭代RL 基础 · Bellman 与 VI
MC → TD → k-step 估计谱系(k=5 缺省)RL 基础 · TD 谱系
四步方差缩减与 actor-critic 谱系RL 基础 · 策略梯度 · 第11章
AlphaGo 四步训练、MCTS、test-time computeRL 基础 · AlphaGo
为什么 RL-LLM 筛掉 DQN / SAC第11章 · 选型边界
Cliff Walk 表格 REINFORCE(本课唯一真实策略梯度循环)第11章 · Cliff Walk
「RLVR 学到新推理了吗」未收敛辩论第11章 · rlvr-debate

⑧ Agent 工程化 ​

这一域回答:检索、工具、记忆、编排如何组装成可控可恢复的 Agent 系统。

RAG 检索管线 ​

  • ❒ RAG(Retrieval-Augmented Generation) —— 检索增强生成:embedding 召回 → 重排 → 带引用生成;擅长动态知识与可溯源事实,不擅长改变语言风格——风格归微调管。→ 第13章
  • ❒ 分块(chunking) —— 把文档切成可检索的块;块大小与重叠是召回质量的第一旋钮,工业级分块策略有量化对比。→ 第13章、第14章
  • ❒ 混合检索与重排(hybrid retrieval / rerank) —— 关键词(BM25)与向量召回互补,Convex 融合后再用 cross-encoder 重排;ColBERT 的 MaxSim(token 级最大相似度求和)是迟交互重排的代表。→ 第14章
  • ❒ 向量库压测与 HNSW 退化 —— 高并发下近似最近邻索引(HNSW)的召回与延迟会退化,缓存与索引参数改造是检索服务的容量必修课;上线前用压测数据说话。→ 第14章

工具、协议与恢复 ​

  • ❒ Agent 状态机 —— 把 agent 建成显式状态机:规划 → 执行 → 观察 → 终止或重规划,类型化工具调用是状态转移边;fixture 驱动的确定性测试只证明编排合同,不证明 live planner 质量。→ 第15章
  • ❒ 类型化工具与权限分级(typed tools / policy) —— 工具参数带 schema 校验,模型建议与系统允许的动作分离:越权动作在边界被策略拒绝,人在回路(HITL)审批高危操作。→ 第15章
  • ❒ MCP(Model Context Protocol) —— 工具与数据源的互操作协议;协议边界不等于授权边界——接入了协议还要过权限策略这一关。→ 第15章 · MCP
  • ❒ 幂等与可恢复(idempotency / checkpoint) —— 工具调用带幂等键、执行状态落 checkpoint,崩溃后从断点续跑;重试无幂等等于把副作用放大。→ 第15章

记忆与上下文工程 ​

  • ❒ 记忆四代谱系 —— 无记忆 → 短期窗口 → 摘要/滚动记忆 → 显式海马长效记忆(图结构检索);context rot(长上下文退化)是推动谱系演进的三硬伤之一。→ 第17章
  • ❒ Context Engineering 预算模型 —— 把上下文窗口当预算显式分配:system prompt 四段式、few-shot 示例、工具结果、记忆各占多少是设计决策,MCP 工具清单膨胀同样吃这份预算。→ 第17章
  • ❒ 结构化输出 —— 按三档从宽松到严格收紧输出约束,保证下游可解析;与第16章 function calling 的参数校验同一条纪律。→ 第17章

编排、多智能体与交付 ​

  • ❒ 工作流编排(workflow vs agent) —— StateGraph/LangGraph 一类的显式图编排适合可预先分解的流程,agent 循环适合需要动态决策的任务;从最简单的方案起步是第一纪律。→ 第18章
  • ❒ subagent / multi-agent —— 第一收益是上下文隔离而非分工:子任务在独立窗口跑完,主 agent 只收结构化结论;代价约 15 倍 token 量级,「子任务可独立理解、独立验证、可结构化合并」三条不满足时保持单 agent。→ 第20章
  • ❒ API 客户端纪律与流式交付 —— 429 限流的指数退避加抖动(确定性可测)、流式消费与用户中断、成本意识;服务端 SSE 分块与前端增量渲染构成全双工链路。→ 第16章、第19章

⑨ 评估与验收 ​

这一域回答:怎么证明系统真的在变好——冻结规范、裁判校准、双层验收与证据。

评估纪律 ​

  • ❒ 冻结评估规范(frozen eval spec) —— 阈值在看到结果之前冻结(仓库 eval/eval-spec-v1.yaml);事后挑阈值等于把随机性写进结论。→ 第21章
  • ❒ pass@k / maj@k —— 两种能力账:pass@1 是单次采样答对率;maj@64 是同题独立采样 64 次取多数(self-consistency),属推理时扩展。maj 与 pass@1 的差是推理时算力买来的,与训练改进不能混算。例:让模型把「今天天气真不错」译成英文 64 次,多数答案的正确率通常高于单次采样。→ 第12章
  • ❒ 困惑度(perplexity) —— PP=exp⁡(mean NLL),数值越低模型对序列越不「惊讶」;它与 tokenizer 绑定,不同词表的 NLL 不可直接比较,只在同一 tokenizer、同一语料下横向有意义。→ 第11章

LLM-as-a-Judge ​

  • ❒ LLM-as-a-Judge(LaaJ) —— 用裁判模型自动评分;必须以人工高质量标注为真值锚点,报告一致率与分歧样例(仓库合成标注 30 条、一致率 0.9、显式列 3 条分歧),用 Judge 输出直接训练 Judge 会自我确认滚雪球。→ 第21章
偏置机制对策
自评偏置(self-enhancement)偏爱同系列或同范式模型多模型陪审团(committee)
长度偏置(verbosity)偏爱冗长繁复排版细粒度量规(rubric)
位置偏置(position)成对对比偏爱固定位置成对交换对称性:(A,B) 与 (B,A) 双测一致才计胜
风格偏置(style)偏爱礼貌与术语密集rubric 事实项逐条 Pass/Fail
对抗脆弱(adversarial)被注入「评满分」指令劫持陪审团 + 输入隔离
  • ❒ pointwise vs pairwise —— 逐项打分(开销随模型数线性,便于固定基准分)对照成对盲测(人类更擅长相对比较、区分度更高,用循环赛制或 Elo/Bradley-Terry 聚合)。→ 第21章
  • ❒ ECE 与 Cohen's kappa —— 期望校准误差(置信度与实际准确率分箱比对,揭「高置信判错」)与扣除偶然一致的 kappa(Judge 与人工标注吻合度的标准统计量);两个评分器差异的显著性用 McNemar 检验。→ 第21章

Agent 验收 ​

  • ❒ component / trajectory 双层验收 —— 组件级(单工具、单检索的质量)与轨迹级(整条执行链是否达成目标)分开评估,对应第21章的评测面与第22章的 Capstone 验收链。→ 第21章、第22章
  • ❒ Agent 生产稳定性清单 —— 上线前的 6 维工程 Checklist:从输入层(截断、意图白名单、编码清洗)到模型层(受限解码、采样确定性绑定、降级路由)再到工具层(幂等键与重试配额),每一项都配可验证断言,不是自评作文。→ 第21章
  • ❒ 证据绑定(evidence binding) —— 声称完成必须附可复现命令与真实输出;机器快照与学习者提交分开存档,浏览器证据绑定 dist 哈希,站点重建后旧证据失效、需按约定重采。→ 第22章

附:高频故障速查(跨域收割) ​

各章「故障注入与预期信号」表的最小检索版:按症状找机制,再跳对应章修。

域注入预期失败信号深读
②temperature 乘而非除 logits低温反而更随机,分布尖锐度反转第5章
②softmax 作用在 batch 维每个 token 的概率和不为 1第5章
②target 未右移模型学成复制当前 token,loss 虚低第5章
④训练/验证用同一份数据val loss 看似在降,实际复读训练集第5章
⑤cache append 时重置 positionRoPE 相位错乱,输出分布漂移第10章
⑤GQA 的 K/V head repeat 错位输出与 MHA 对照不一致第10章
⑤量化后忘记反量化 scale输出尺度整体偏移、loss 假低第10章
⑤SwiGLU 把 ⊙ 写成 +反向梯度符号错误第10章
⑤GPTQ 校准无阻尼(秩亏)必须被门禁拒绝(gate)第10章
⑥SFT 不加 assistant mask模型连用户输入一起学、替用户说话第11章
⑥DPO 用未归一化对数似然注水冗长回答被判优(margin 虚高)第11章
⑦REINFORCE 关掉 baseline跨 seed 不稳定,部分 seed 坠入失败循环第11章 · Cliff Walk

来源与相关页面 ​

  • 本页的知识体系是本课程自有正文(第 1–23 章与前沿参考页)的最小检索投影;条目与术语表呼应但不复制其全文,所有数值以对应章节正文为准。
  • 排版形态(❒ 术语卡 + Remark 双通道、判断支持型对照表、结论式公式就地定义、贯穿示例、两深层级纪律)参考 Stanford CME295 VIP Cheatsheet(Amidi & Amidi, 2026, MIT License)的设计解剖,内容零复制;形态分析与取用边界见覆盖差距审计(2026-10-05)。
  • 深读入口:术语表 · 必读论文索引 · RL 基础:从 MDP 到策略梯度 · 形式化验证

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥