Skip to content

术语表 — 180+ 核心概念速查 ​

面向前端/跨端工程师。每个词条给出:英文、所属章节、一句话定义、公式(如有)、前端类比、代码定位。 判定标准:能用自己的话讲清 + 能指出代码在哪 + 能说出它坏掉时的表现。

如何使用 ​

  • 从 实验索引 或 教程正文 跳转过来时,直接用浏览器 Ctrl/Cmd + F 搜英文名。
  • 词条里的「代码定位」是本仓库的真实文件,可直接 rg 定位。
  • 概念对照的论文见 必读论文索引。

一、数学基础、计算图与自动微分(第2章, 第3章, 第4章, 第7章) ​

计算图 ​

  • 英文:computational graph
  • 章节:第4章
  • 定义:把一次前向计算记录成有向无环图,节点是中间值,边是算子依赖。
  • 公式:L=g(f(x))
  • 前端类比:像 Vue/React 的响应式依赖图——先建依赖,再按拓扑序回流。
  • 代码定位:python/llm_core/autograd.py

autograd ​

  • 英文:automatic differentiation
  • 章节:第4章
  • 定义:自动把每一步运算反向传播成梯度,免去手写偏导。
  • 公式:—
  • 前端类比:像 ESLint 自动定位错误,不必逐行 console.log。
  • 代码定位:python/llm_core/autograd.py

链式法则 ​

  • 英文:chain rule
  • 章节:第4章
  • 定义:复合函数的导数等于各层导数相乘,反向传播的数学依据。
  • 公式:∂L∂x=∂L∂y∂y∂x
  • 前端类比:像中间件链:ctx.next() 把请求与回写串起来。
  • 代码定位:python/llm_core/autograd.py

拓扑排序 ​

  • 英文:topological sort
  • 章节:第4章
  • 定义:保证每个节点只在所有前置节点算完之后才被处理,决定反向传播的顺序。
  • 公式:—
  • 前端类比:像 Webpack 的 loader 链,从入口到产物按依赖先后产出。
  • 代码定位:python/llm_core/autograd.py

叶子节点 ​

  • 英文:leaf node
  • 章节:第4章
  • 定义:没有 prev 的输入节点,梯度会在这里停下并写入 .grad。
  • 公式:—
  • 前端类比:像组件树里的 props 入口——依赖的终点。
  • 代码定位:python/llm_core/autograd.py

梯度累加 ​

  • 英文:gradient accumulation
  • 章节:第7章
  • 定义:把多次小 batch 的梯度相加,模拟出大 batch 的效果。
  • 公式:g=∑igi
  • 前端类比:像 Array.reduce 把多条流合并成一条。
  • 代码定位:python/llm_core/tensor_grad.py

有限差分 / gradcheck ​

  • 英文:finite difference / gradient check
  • 章节:第4章
  • 定义:用极小扰动 ϵ 估算导数,与自动微分结果比对,验证反向正确。
  • 公式:f(x+ϵ)−f(x−ϵ)2ϵ
  • 前端类比:像单元测试里的快照比对——确认实现没写错。
  • 代码定位:python/llm_core/gradcheck.py

微分与导数 ​

  • 英文:derivative vs. differential
  • 章节:第3章, 第4章
  • 定义:导数是切线斜率,微分是无限小增量;神经网络里通常混用。
  • 公式:dy=f′(x)dx
  • 前端类比:像 Math.h 里 Math.round vs Math.trunc 的差别。
  • 代码定位:python/llm_core/autograd.py

梯度 ​

  • 英文:gradient
  • 章节:第4章
  • 定义:损失函数对参数的偏导向量,标明了参数往哪边调能降 loss。
  • 公式:∇wL
  • 前端类比:像 Webpack 的 sourcemap,告诉你改动会影响哪些输出。
  • 代码定位:python/llm_core/autograd.py

参数更新 ​

  • 英文:parameter update
  • 章节:第7章
  • 定义:按学习率与梯度把参数往反方向推一步,公式 w←w−ηg。
  • 公式:w←w−ηg
  • 前端类比:像 git rebase 把提交按目标线串起来。
  • 代码定位:python/llm_core/optimizer.py

loss ​

  • 英文:loss function
  • 章节:第4章
  • 定义:衡量模型预测与真值的差距,训练目标就是最小化它。
  • 公式:L(y^,y)
  • 前端类比:像 CI 里的失败计数——越低越好。
  • 代码定位:python/llm_core/bigram.py

反向传播 ​

  • 英文:backpropagation
  • 章节:第4章
  • 定义:从 loss 回溯到每个叶子,沿链式法则累乘梯度。
  • 公式:—
  • 前端类比:像事件冒泡:捕获阶段一路收信息,最后统一处理。
  • 代码定位:python/llm_core/autograd.py

SVD 奇异值分解 ​

  • 英文:singular value decomposition
  • 章节:第3章, 第10章
  • 定义:将任意实矩阵分解为正交矩阵与奇异值对角阵乘积 A=UΣV⊤;截断微小奇异值可获得最优低秩近似。
  • 公式:A=UΣV⊤=∑i=1rσiuivi⊤
  • 前端类比:像 Canvas 位图或 WebP 图像压缩——保留能量最高的主轮廓与底色,丢弃高频噪声。
  • 代码定位:docs/chapters/03-math-bridge.md

PCA 主成分分析 ​

  • 英文:principal component analysis
  • 章节:—(仅术语对照:本课正文无 PCA 专题,覆盖差距审计 2026-10-05 将经典无监督专题划在边界外)
  • 定义:通过正交变换将线性相关的特征投影到方差最大的少数几个不相关方向(主成分)上;与 SVD 的关系是 X 的主成分即 X 右奇异向量方向。
  • 公式:z=Xv1,Var(z) 最大化
  • 前端类比:像用热力图或趋势折线代替数万条散点埋点日志——提取关键走势。
  • 代码定位:—(无正文绑定;与之最近的主线内容是 第3章 的 SVD 奇异值分解与低秩近似)

条件数 condition number ​

  • 英文:condition number
  • 章节:第3章, 第7章
  • 定义:衡量矩阵可逆性与数值敏感度的指标(最大奇异值与最小奇异值之比);条件数极大时称为病态矩阵,导致损失曲面呈现险峻狭谷。
  • 公式:κ(A)=σmaxσmin
  • 前端类比:像 CSS Flex 布局比例严重失调(flex: 1 vs flex: 10000)——微小的视口变化导致界面剧烈变形。
  • 代码定位:docs/chapters/03-math-bridge.md

矩阵范数 matrix norm ​

  • 英文:matrix norm / Frobenius norm
  • 章节:第3章, 第7章
  • 定义:衡量张量或矩阵总体尺度的指标;常用 Frobenius 范数(所有元素平方和开方)度量权重体量与梯度裁剪阈值。
  • 公式:∥A∥F=∑i,jAij2
  • 前端类比:像计算 Webpack 构建产物的总体 bundle 体积(字节大小)。
  • 代码定位:docs/chapters/03-math-bridge.md

雅可比矩阵与海森矩阵 Jacobian & Hessian ​

  • 英文:Jacobian and Hessian matrices
  • 章节:第3章, 第4章
  • 定义:雅可比矩阵是一阶偏导构成的矩阵(向量到向量映射);海森矩阵是标量函数关于多元变量的二阶偏导方阵,决定损失曲面的局部曲率与极值形态。
  • 公式:Jij=∂fi∂xj,Hij=∂2L∂xi∂xj
  • 前端类比:像物理引擎中的速度(一阶导,向量)与加速度/曲率(二阶导,张量)。
  • 代码定位:python/llm_core/autograd.py

全期望公式与塔式性质 ​

  • 英文:Law of Total Expectation / Tower Property
  • 章节:第3章, 第11章, 第12章
  • 定义:总期望等于对局部条件期望再求外层期望,即 E[X]=EY[E[X∣Y]]。这是将强化学习全局奖励期望解耦为外层采样 Prompt、内层采样回答的坚实数学根基。
  • 公式:J(θ)=E(x,y)[R(x,y)]=Ex∼D[Ey∼πθ(⋅∣x)[R(x,y)]]
  • 前端类比:像全站页面平均加载耗时——不需要挨个加总数百万条埋点日志,只需先按机型(低端/高端)算局部加权平均,再按机型用户占比求一次外层期望。
  • 代码定位:docs/chapters/03-math-bridge.md

无偏估计 unbiased estimator ​

  • 英文:unbiased estimator / unbiasedness
  • 章节:第3章, 第11章, 第12章
  • 定义:估计量的期望恰好等于被估参数。单次估计必然受抽样运气影响而偏移,无偏性只承诺「反复采样重算、再取平均,平均意义上落在真值」。组均值基线不改变期望、蒙特卡洛回报「无偏但高方差」、Dr. GRPO 的 N−1N 缩放修正,全部以这一行定义为公共语言。
  • 公式:Bias(θ^)=E[θ^]−θ,θ^ 无偏⟺E[θ^]=θ
  • 前端类比:像性能监控的采样聚合——单次采集抖动大,长时间均值稳定落在真实水位上。
  • 代码定位:docs/chapters/03-math-bridge.md(无偏估计小节)

协方差 covariance ​

  • 英文:covariance
  • 章节:第3章
  • 定义:度量两个随机变量共同线性变化的趋势:独立必推出零协方差,反之不成立(零协方差只排除线性关联)。Xavier/He 初始化的方差守恒推导与 baseline 无偏性论证所依赖的期望代数都在这张速查表上。
  • 公式:Cov(X,Y)=E[XY]−E[X]E[Y]
  • 前端类比:像两个埋点指标的相关性监控——同步涨落只说明线性联动,不能证明因果或任意形式的关联。
  • 代码定位:docs/chapters/03-math-bridge.md(方差、协方差与常见分布速查小节)

Jensen 不等式 Jensen's inequality ​

  • 英文:Jensen's inequality
  • 章节:第3章, 第11章
  • 定义:g 为凸函数时随机变量函数值的期望不小于期望的函数值。它是 RL 方差缩减的理论支点——Rao–Blackwell「条件期望不增方差」的论证用的正是它。
  • 公式:E[g(X)]≥g(E[X])(g 凸)
  • 前端类比:像先对明细套函数再聚合,与先聚合再套函数,两种报表口径在凸函数下结果有序不平等。
  • 代码定位:docs/chapters/03-math-bridge.md(方差、协方差与常见分布速查小节)

二、语言建模基础(第5章) ​

Token ​

  • 英文:token
  • 章节:第5章
  • 定义:模型处理的最小语义单元,可以是字、子词或符号。
  • 公式:—
  • 前端类比:像 Babel 编译后的最小语法单元——AST 节点。
  • 代码定位:python/llm_core/bigram.py

词表 vocab ​

  • 英文:vocabulary
  • 章节:第5章
  • 定义:模型能识别的全部 token 及其索引映射表。
  • 公式:|V|=V
  • 前端类比:像 i18n 字典——把字符串 ID 化。
  • 代码定位:python/llm_core/bpe.py

embedding ​

  • 英文:embedding
  • 章节:第5章
  • 定义:把离散 token 映射成连续向量,捕捉语义相似度。
  • 公式:e=E[token_id]
  • 前端类比:像 SVG <symbol>——把抽象 ID 渲染成可视片段。
  • 代码定位:python/llm_core/bigram.py

logits ​

  • 英文:logits
  • 章节:第5章
  • 定义:模型最后一层未归一化的分数,喂给 softmax 得到概率。
  • 公式:z=Wh+b
  • 前端类比:像 Promise.all 返回前的中间态——还没决定谁赢。
  • 代码定位:python/llm_core/mlp_lm.py

softmax ​

  • 英文:softmax
  • 章节:第5章
  • 定义:把 logits 指数化再归一,得到离散分布,公式 σ(zi)=ezi/∑jezj。
  • 公式:σ(zi)=ezi∑jezj
  • 前端类比:像 CSS 优先级 !important——把所有权重放大到一目了然。
  • 代码定位:python/llm_core/mlp_lm.py

交叉熵 CE ​

  • 英文:cross-entropy
  • 章节:第5章
  • 定义:衡量两个分布之间的距离,分类任务最常用的损失。
  • 公式:H(p,q)=−∑pilog⁡qi
  • 前端类比:像 Git diff——逐位对照找出偏差。
  • 代码定位:python/llm_core/mlp_lm.py

负对数似然 NLL ​

  • 英文:negative log-likelihood
  • 章节:第5章
  • 定义:把正确 token 的预测概率取负对数,是交叉熵在独热标签下的简化。
  • 公式:NLL=−log⁡p(y|x)
  • 前端类比:像没命中 cache 时的 cache-miss 日志——必然要付出代价。
  • 代码定位:python/llm_core/mlp_lm.py

最大似然估计 MLE ​

  • 英文:maximum likelihood estimation
  • 章节:第5章
  • 定义:让模型在训练数据上的似然最大,等价于最小化交叉熵。
  • 公式:θ∗=arg⁡maxθ∏ipθ(xi)
  • 前端类比:像调 ESLint 规则让代码最合规。
  • 代码定位:python/llm_core/mlp_lm.py

teacher forcing ​

  • 英文:teacher forcing
  • 章节:第5章
  • 定义:训练时用真实 token 而不是模型自己的预测作为下一步输入,加速收敛。
  • 公式:—
  • 前端类比:像 IDE 自动补全——引导你输入正确答案。
  • 代码定位:python/llm_core/mlp_lm.py

困惑度 perplexity ​

  • 英文:perplexity
  • 章节:第5章
  • 定义:交叉熵的指数,越低说明模型越确定地预测下一个 token。
  • 公式:PPL=eNLL
  • 前端类比:像 RPS(请求每秒)——越低越稳。
  • 代码定位:python/llm_core/mlp_lm.py

bigram ​

  • 英文:bigram
  • 章节:第5章
  • 定义:只用上一个 token 预测下一个,是 n-gram 的最小形式。
  • 公式:p(xt|xt−1)
  • 前端类比:像组件只看直接 prop,不递归——最朴素的依赖。
  • 代码定位:python/llm_core/bigram.py

n-gram ​

  • 英文:n-gram
  • 章节:第5章
  • 定义:连续 n 个 token 片段的统计,用于语言建模的早期方法。
  • 公式:p(wt|wt−n+1:t−1)
  • 前端类比:像 Array.slice(n-1) 拿最近一段窗口。
  • 代码定位:python/llm_core/bigram.py

三、分词(第6章) ​

BPE ​

  • 英文:byte-pair encoding
  • 章节:第6章
  • 定义:从基表出发反复合并最高频相邻符号,最终得到子词词表。本章的 byte BPE 以 256 个字节为基表。
  • 公式:—
  • 前端类比:像 PostCSS 把 CSS 合并成更短的语法糖。
  • 代码定位:python/llm_core/bpe.py

merge ​

  • 英文:merge operation
  • 章节:第6章
  • 定义:BPE 训练时把出现频率最高的相邻符号对合成一个新符号。
  • 公式:count(a,b)→ab
  • 前端类比:像 Git 的 merge --squash——把多笔提交压成一笔。
  • 代码定位:python/llm_core/bpe.py

byte 级分词 ​

  • 英文:byte-level tokenization
  • 章节:第6章
  • 定义:把任意 UTF-8 字节序列纳入词表,避免 OOV(未登录词)问题。
  • 公式:—
  • 前端类比:像 Buffer/Uint8Array——总能拆到底层。
  • 代码定位:python/llm_core/bpe.py

UTF-8 ​

  • 英文:UTF-8
  • 章节:第6章
  • 定义:变长 Unicode 编码,向后兼容 ASCII,是现代 NLP 的事实标准。
  • 公式:—
  • 前端类比:像 <meta charset="utf-8">——写对字符集才不会乱码。
  • 代码定位:python/llm_core/bpe.py

特殊 token ​

  • 英文:special tokens
  • 章节:第6章
  • 定义:<bos> <eos> <pad> 等控制性符号,用于对齐与边界识别。代码补全还会保留填充中间(FIM)的哨兵 token。它们按声明占用 id,不由 merge 频次产生。
  • 公式:—
  • 前端类比:像 React Fragment <>——存在但不影响结构。
  • 代码定位:python/llm_core/bpe.py

预分词 ​

  • 英文:pre-tokenization
  • 章节:第6章
  • 定义:在统计相邻对之前,用正则或数字切分器把文本切成允许合并的片段。它是初始化参数,不从语料频次里学出来。
  • 公式:—
  • 前端类比:像 CSS 的 word-break——先决定断行边界,再排版。
  • 代码定位:—

WordPiece ​

  • 英文:WordPiece
  • 章节:第6章
  • 定义:与 BPE 一样从字母表向上生长,但选择更抬高训练数据语言模型似然的相邻对,而不是原始共现最多的对。BERT 使用的公开重建只保留最终词表,从词首做最长匹配;一旦无法继续匹配,整个词变成 [UNK],不保留已经匹配的前缀。Schuster、Nakajima(2012)沿合并树向下切分,并声称不会产生未登录词。
  • 公式:文献重建分数为 freq(ab)/(freq(a)×freq(b));Google 未开源训练器,该式不是官方实现。
  • 前端类比:像按「一起出现是否超出各自单独出现」来决定要不要做成连字。
  • 代码定位:—

Unigram 子词 ​

  • 英文:Unigram language model tokenization
  • 章节:第6章
  • 定义:从大于目标大小的种子词表出发,按一元语言模型反复删掉似然损失最小的符号,直到词表缩到目标大小。方向与 BPE 的向上合并相反。
  • 公式:—
  • 前端类比:像从一份过长的组件清单里删掉对页面影响最小的组件,直到包体达标。
  • 代码定位:—

round-trip 往返 ​

  • 英文:round-trip
  • 章节:第6章
  • 定义:encode 后再 decode 必须能还原原串,是分词正确性的最基本断言。
  • 公式:decode(encode(s))=s
  • 前端类比:像 JSON 序列化测试——JSON.parse(JSON.stringify(o)) 不丢字段。
  • 代码定位:python/tests/test_bpe.py

token 边界 ​

  • 英文:token boundary
  • 章节:第6章
  • 定义:分词结果里相邻 token 之间的分界点,影响子词粒度。
  • 公式:—
  • 前端类比:像 ESLint 单词边界 \b 正则——边界要识别清楚。
  • 代码定位:python/llm_core/bpe.py

预训练数据提纯管线 Data Curation ​

  • 英文:pretraining data curation pipeline
  • 章节:第6章
  • 定义:将原始海量网页转化为高质量训练语料的标准工程管线,涵盖文本提取清洗、启发式质量过滤(Gopher 规则)、语言模型困惑度过滤(KenLM)、模糊去重与隐私脱敏。
  • 公式:—
  • 前端类比:像现代前端生产构建管线:Babel 语法降级 → DOMPurify 清洗 XSS → 摇树优化(Tree-shaking) → 最小化压缩打包。
  • 代码定位:docs/chapters/06-bpe.md

MinHash LSH 局部敏感哈希 ​

  • 英文:MinHash Locality-Sensitive Hashing
  • 章节:第6章
  • 定义:利用随机哈希最小值的碰撞概率度量 Jaccard 相似度的模糊去重算法,结合波段(bands)分桶技术将 O(N2) 两两比对复杂度降至近乎线性的 O(N)。
  • 公式:P(minh(A)=minh(B))=J(A,B)=|A∩B||A∪B|
  • 前端类比:像大型前端工程中对万级 AST 抽象语法树节点做快速近邻结构查重与冗余代码消解。
  • 代码定位:docs/chapters/06-bpe.md

四、注意力与 Transformer(第8章) ​

Attention ​

  • 英文:attention
  • 章节:第8章
  • 定义:通过 query 与 key 的相似度给 value 加权,让模型关注相关上下文。
  • 公式:Attn(Q,K,V)=softmax(QK⊤)V
  • 前端类比:像 CSS :hover 选择器——匹配了才生效。
  • 代码定位:python/llm_core/attention.py

scaled dot-product attention ​

  • 英文:scaled dot-product attention
  • 章节:第8章
  • 定义:把点积除以 dk,避免维度大时 softmax 进入饱和区。
  • 公式:softmax(QK⊤dk)V
  • 前端类比:像 transform: scale(0.5)——按比例缩放避免溢出。
  • 代码定位:python/llm_core/attention.py

query ​

  • 英文:query
  • 章节:第8章
  • 定义:当前位置发出的「我想要什么」向量,用于检索。
  • 公式:Q=XWQ
  • 前端类比:像浏览器的搜索词——是检索的入口。
  • 代码定位:python/llm_core/attention.py

key ​

  • 英文:key
  • 章节:第8章
  • 定义:每个位置的「我是什么」向量,与 query 做相似度。
  • 公式:K=XWK
  • 前端类比:像数据库索引——能让你快速定位。
  • 代码定位:python/llm_core/attention.py

value ​

  • 英文:value
  • 章节:第8章
  • 定义:被加权的「实际内容」向量,是 attention 的输出来源。
  • 公式:V=XWV
  • 前端类比:像 Map.get(key) 返回的真实载荷。
  • 代码定位:python/llm_core/attention.py

causal mask ​

  • 英文:causal mask
  • 章节:第8章
  • 定义:把未来位置的注意力分数置为 −∞,保证解码时只看历史。
  • 公式:Mij=0 if i≥j else −∞
  • 前端类比:像 aria-hidden="true"——屏蔽未来还没渲染的内容。
  • 代码定位:python/llm_core/attention.py

多头注意力 multi-head ​

  • 英文:multi-head attention
  • 章节:第8章
  • 定义:把 Q/K/V 切成多组并行 attention,让模型同时关注不同子空间。
  • 公式:MHA=Concat(H1,…,Hh)WO
  • 前端类比:像多个 <input> 并列工作,每个关注不同字段。
  • 代码定位:python/llm_core/attention.py

注意力头 head ​

  • 英文:attention head
  • 章节:第8章
  • 定义:多头的其中一支,往往学到不同语义关系(语法、指代等)。
  • 公式:—
  • 前端类比:像 Tailwind 的工具类插槽——每个 head 是独立的 utility。
  • 代码定位:python/llm_core/attention.py

残差连接 ​

  • 英文:residual connection
  • 章节:第8章
  • 定义:把输入直连到输出 y=x+f(x),缓解梯度消失。
  • 公式:y=x+f(x)
  • 前端类比:像 Promise 链里的 try/finally——保证出口存在。
  • 代码定位:python/llm_core/blocks.py

位置编码 ​

  • 英文:positional encoding
  • 章节:第8章
  • 定义:把位置信息注入 token embedding,让模型感知顺序。
  • 公式:PE(pos,2i)=sin⁡(pos/100002i/d)
  • 前端类比:像 CSS Grid 的 grid-row——给元素一个明确位置。
  • 代码定位:python/llm_core/transformer.py

Transformer Block ​

  • 英文:transformer block
  • 章节:第8章
  • 定义:Attention + FFN + 残差 + LN 的标准组合,是 LLM 的基本单元。
  • 公式:—
  • 前端类比:像 React 函数组件——可复用、有 props、有输出。
  • 代码定位:python/llm_core/blocks.py

前馈层 FFN ​

  • 英文:feed-forward network
  • 章节:第8章
  • 定义:块内的两层 MLP,提供 token 级别的非线性变换。
  • 公式:FFN(x)=W2σ(W1x+b1)+b2
  • 前端类比:像 Vue 的 computed——拿到数据做加工再输出。
  • 代码定位:python/llm_core/blocks.py

tied embedding ​

  • 英文:tied embedding
  • 章节:第8章
  • 定义:输入 embedding 与输出 logits 共享权重,节省参数。
  • 公式:Wout=E⊤
  • 前端类比:像同一份 CSS 类同时控制颜色与字体——共享样式源。
  • 代码定位:python/llm_core/tied_embedding.py

五、归一化与激活(第7章, 第8章, 第10章) ​

LayerNorm ​

  • 英文:layer normalization
  • 章节:第7章
  • 定义:对单样本内特征维度做归一化,稳定训练。
  • 公式:y=γx−μσ+β
  • 前端类比:像组件内的 useMemo——把不稳定输入归一化。
  • 代码定位:python/llm_core/blocks.py

RMSNorm ​

  • 英文:root mean square layer norm
  • 章节:第7章, 第10章
  • 定义:只缩放不中心化的简化 LayerNorm,推理更省时。
  • 公式:y=γxmean(x2)
  • 前端类比:像 CSS 的 aspect-ratio——计算简单又常用。
  • 代码定位:python/llm_core/rmsnorm.py

SwiGLU ​

  • 英文:swiGLU activation
  • 章节:第10章
  • 定义:用 SiLU 门控线性单元的前馈层,比 ReLU 表达力更强。
  • 公式:SwiGLU(x)=SiLU(W1x)⊙(W2x)
  • 前端类比:像 v-if 控制可见性——门控后才有输出。
  • 代码定位:python/llm_core/swiglu.py

GELU ​

  • 英文:Gaussian Error Linear Unit
  • 章节:第7章, 第8章
  • 定义:高斯误差线性单元,平滑地保留负值信息。
  • 公式:GELU(x)≈0.5x(1+tanh⁡(2/π(x+0.044715x3)))
  • 前端类比:像 Intl.NumberFormat——平滑格式化。
  • 代码定位:python/llm_core/blocks.py

权重初始化 ​

  • 英文:weight initialization
  • 章节:第7章
  • 定义:用 Xavier/Kaiming 等策略给参数赋初值,影响收敛速度。
  • 公式:Var(W)=2/fin
  • 前端类比:像 Webpack 的 entry——出发点定好后续路径才顺。
  • 代码定位:python/llm_core/tensor_grad.py

梯度裁剪 ​

  • 英文:gradient clipping
  • 章节:第7章
  • 定义:把梯度的范数或值限制在阈值内,防止爆炸。
  • 公式:g←g⋅min(1,θ/||g||)
  • 前端类比:像 ESLint 的 max-len——超过阈值就强制收敛。
  • 代码定位:python/llm_core/optimizer.py

学习率调度 ​

  • 英文:learning rate schedule
  • 章节:第7章
  • 定义:warmup + cosine 衰减等节奏,控制训练步幅。
  • 公式:ηt=ηmin+12(ηmax−ηmin)(1+cos⁡(πt/T))
  • 前端类比:像 CDN 缓存预热——先把资源加载到位再用。
  • 代码定位:python/llm_train/train.py

六、训练与优化(第7章, 第9章) ​

SGD ​

  • 英文:stochastic gradient descent
  • 章节:第7章
  • 定义:用随机小 batch 的梯度更新参数的最基础优化器。
  • 公式:w←w−η∇L
  • 前端类比:像 Array.sort——一步步逼近最优顺序。
  • 代码定位:python/llm_core/optimizer.py

AdamW ​

  • 英文:Adam with decoupled weight decay
  • 章节:第7章
  • 定义:在 Adam 基础上把权重衰减与梯度更新解耦,是 LLM 训练的事实标准。
  • 公式:mt←β1mt−1+(1−β1)g
  • 前端类比:像 Vue3 的 reactivity——细节封装好,开箱即用。
  • 代码定位:python/llm_core/optimizer.py

动量 ​

  • 英文:momentum
  • 章节:第7章
  • 定义:把历史梯度指数平均加入更新,平滑震荡。
  • 公式:vt=βvt−1+g
  • 前端类比:像 requestAnimationFrame——保留惯性,避免抖动。
  • 代码定位:python/llm_core/optimizer.py

weight decay ​

  • 英文:weight decay
  • 章节:第7章
  • 定义:在损失上加入参数正则项,抑制过拟合。
  • 公式:L′=L+λ∥w∥2
  • 前端类比:像 ESLint 的 no-unused-vars——压一压没用上的代码。
  • 代码定位:python/llm_core/optimizer.py

batch ​

  • 英文:batch
  • 章节:第7章
  • 定义:一次前向/反向所用的样本数,影响显存与梯度噪声。
  • 公式:—
  • 前端类比:像 Promise.all([...])——并发处理一组。
  • 代码定位:python/llm_train/data.py

epoch 与 step ​

  • 英文:epoch / step
  • 章节:第7章
  • 定义:epoch 是看完一遍数据集,step 是单次参数更新。
  • 公式:steps_per_epoch=N/B
  • 前端类比:像 npm install 一次次直到 lockfile 收敛。
  • 代码定位:python/llm_train/train.py

checkpoint ​

  • 英文:checkpoint
  • 章节:第7章, 第9章
  • 定义:训练中定期保存的模型权重快照,可用于恢复与推理。
  • 公式:—
  • 前端类比:像 Git tag——关键时刻打个标记。
  • 代码定位:python/llm_train/checkpoint.py

seed 与可复现性 ​

  • 英文:seed / reproducibility
  • 章节:第7章
  • 定义:固定随机种子,让 Python/NumPy/CUDA 的随机结果一致。
  • 公式:—
  • 前端类比:像 package-lock.json——锁住依赖保证一致。
  • 代码定位:python/llm_train/config.py

train/validation 切分 ​

  • 英文:train / validation split
  • 章节:第7章
  • 定义:把数据分成训练集和验证集,前者学、后者评。
  • 公式:—
  • 前端类比:像 dev/staging/prod 环境隔离。
  • 代码定位:python/llm_train/data.py

过拟合 ​

  • 英文:overfitting
  • 章节:第7章
  • 定义:模型在训练集上很好但在验证集上差,缺乏泛化。
  • 公式:—
  • 前端类比:像硬编码常量——换个环境就崩。
  • 代码定位:python/llm_train/train.py

scaling law ​

  • 英文:scaling law
  • 章节:第9章
  • 定义:描述模型能力随参数/数据/算力变化的幂律关系。
  • 公式:L≈N−α
  • 前端类比:像 CDN 命中率的边际收益曲线。
  • 代码定位:—(本课只做概念对照,不实现)

万能逼近定理 universal approximation theorem ​

  • 英文:universal approximation theorem
  • 章节:第7章
  • 定义:包含非线性激活函数的单隐藏层前馈网络,只要隐藏节点充足,可在紧致集上以任意精度逼近任意连续函数。
  • 公式:f(x)=∑iviσ(wix+bi)
  • 前端类比:像图灵完备性(Turing Completeness)——规则足够简单但理论上能计算一切。
  • 代码定位:docs/chapters/07-training-stability.md

偏差-方差权衡 bias-variance tradeoff ​

  • 英文:bias-variance tradeoff
  • 章节:第7章
  • 定义:模型均方误差由偏差(欠拟合)、方差(过拟合)和噪声三者构成;现代过参数化大模型通过良性过拟合与双重下降突破传统瓶颈。
  • 公式:E[(y−f^(x))2]=Bias2+Variance+σ2
  • 前端类比:像前端防抖(Debounce)的时间阈值设置——设太大(高偏差反应迟钝),设太小(高方差频繁抖动)。
  • 代码定位:docs/chapters/07-training-stability.md

死亡神经元 dying ReLU ​

  • 英文:dying ReLU
  • 章节:第7章
  • 定义:当输入落入负半轴时 ReLU 梯度严格为 0;若权重更新使神经元持续输出负值,则梯度彻底断流无法恢复。
  • 公式:ddxReLU(x)=0(∀x<0)
  • 前端类比:像 Promise 链中遗漏了 catch 导致静默挂死、后续链条永不触发。
  • 代码定位:python/llm_core/tensor_grad.py

Xavier 初始化 xavier initialization ​

  • 英文:Xavier / Glorot initialization
  • 章节:第7章
  • 定义:基于前向与反向传播方差守恒假定,按输入与输出维度调和平均初始化权重,防止深层信号弥散或爆炸。
  • 公式:Var(w)=2nin+nout
  • 前端类比:像音频播放器的音量自动归一化(Normalize)——防止不同曲目忽大忽小。
  • 代码定位:docs/chapters/07-training-stability.md

He 初始化 he / kaiming initialization ​

  • 英文:He / Kaiming initialization
  • 章节:第7章
  • 定义:针对 ReLU 等单边抑制激活函数设计的初始化方案,补偿负半轴截断导致的二分之一能量衰减。
  • 公式:Var(w)=2nin
  • 前端类比:像信号衰减补偿放大器——信号被削弱一半就放大两倍补回来。
  • 代码定位:docs/chapters/07-training-stability.md

GPT 残差缩放初始化 gpt residual scaling ​

  • 英文:residual projection scaling initialization
  • 章节:第7章, 第9章
  • 定义:GPT-2 与 nanoGPT 采用的权重缩放策略,对 Attention 与 MLP 投影层权重按 1/2L 缩小标准差,抑制深层残差方差随层数线性发散。
  • 公式:Wproj∼N(0,0.022L)
  • 前端类比:像深层嵌套事件流的节流阀——层数越深越要克制单次派发幅度。
  • 代码定位:python/llm_core/transformer.py、docs/chapters/07-training-stability.md

全局梯度裁剪 gradient clipping ​

  • 英文:gradient clipping by global norm
  • 章节:第7章, 第9章
  • 定义:当所有参数梯度的全局 L2 范数超过阈值时按比例整体等比缩放,严格保持梯度空间相对方向,杜绝离群 batch 摧毁模型权重。前提是方向本身仍有信息:它治梯度爆炸,治不了梯度消失——封顶一个本来就不存在的量没有意义。
  • 公式:g←g×min(1,c∥g∥2)
  • 前端类比:像网络请求熔断器与限流器——方向正确但步长超标时强制按比例限速。
  • 代码定位:python/llm_train/train.py、docs/chapters/09-tinygpt.md、前史参考页 · 裁剪与门控(机理级对照:为什么裁剪救爆炸、救不了消失)

算力利用率 MFU / HFU ​

  • 英文:model / hardware FLOPs utilization (MFU / HFU)
  • 章节:第9章
  • 定义:衡量分布式预训练实际计算效率与硬件峰值理论吞吐比值的黄金指标,排除激活重计算开销的纯模型吞吐比即为 MFU(工业级通常达 35%~55%)。
  • 公式:MFU=Tokens/sec×6ΦPeak Hardware TFLOPs
  • 前端类比:像前端帧率利用率与渲染管道管线打满率(Pipeline Saturation)。
  • 代码定位:docs/chapters/09-tinygpt.md

显存开销解构 memory footprint (16Φ) ​

  • 英文:training memory footprint
  • 章节:第9章
  • 定义:AdamW 训练时模型静态显存由参数(2 字节)、梯度(2 字节)与优化器状态(12 字节)构成,总计 16Φ 字节每参数。
  • 公式:Memorystatic=16×Φ bytes
  • 前端类比:像 SPA 应用不仅要存 DOM 节点本身,还要存虚拟 DOM 树与快照历史。
  • 代码定位:docs/chapters/09-tinygpt.md

分布式并行 distributed parallelism ​

  • 英文:distributed parallelism (DP, TP, PP)
  • 章节:第9章, 分布式训练收拢地图
  • 定义:大模型训练的并行拆分策略,包括数据并行(DDP,每卡完整模型各拿不同 batch、反向后一次梯度 All-Reduce)、张量并行(TP,如 Megatron,切单个矩阵乘、机内 NVLink 极高频通信)与流水线并行(PP,按层切纵深、激活值 P2P 可跨机、代价是流水线气泡)。口诀:通信频率决定物理位置。
  • 公式:—
  • 前端类比:像微前端架构(按路由拆分流水线)与 Web Worker 线程池(按任务切分数据)。
  • 代码定位:docs/chapters/09-tinygpt.md(三大并行心智模型与通信原语收拢见 分布式训练收拢地图)

FSDP 完全分片数据并行 ​

  • 英文:Fully Sharded Data Parallel (ZeRO-3)
  • 章节:第9章, 分布式训练收拢地图
  • 定义:将模型权重、梯度与优化器状态全部分片到集群所有 GPU 上,打破单卡显存墙。
  • 公式:Memoryper_gpu=16ΦNgpus
  • 前端类比:像分布式文件系统中的数据块分片(Sharding)。
  • 代码定位:docs/chapters/09-tinygpt.md(三阶段记账见 收拢地图 · ZeRO)

ZeRO 冗余优化器 ​

  • 英文:Zero Redundancy Optimizer (ZeRO stage 1/2/3)
  • 章节:第9章, 分布式训练收拢地图
  • 定义:保留数据并行的执行方式、把每卡冗余的训练状态按阶段切片:ZeRO-1 切优化器状态(每卡 4Φ+12Φ/N)、ZeRO-2 再切梯度(2Φ+14Φ/N)、ZeRO-3 全切(16Φ/N,即 FSDP)。ZeRO-1/2 通信量与标准 DDP 完全相同——内存收益是「白拿的」;ZeRO-3 参数不再常驻、逐层临时 All-Gather 拼齐即释放,通信量约增 50%,本质是通信换内存的交易。
  • 公式:ZeRO-1 每卡 4Φ+12Φ/N;ZeRO-2 每卡 2Φ+14Φ/N;ZeRO-3 每卡 16Φ/N
  • 前端类比:像集群缓存不再每节点全量冗余,改为按成员分片存储——谁用到谁临时拉齐,用完即释放。
  • 代码定位:—(本课边界:L1 概念级,不实现;收拢视图见 分布式训练收拢地图)

激活重计算 activation checkpointing ​

  • 英文:activation checkpointing / gradient checkpointing
  • 章节:第9章
  • 定义:前向传播时不保留中间层激活值,反向传播时重新前向计算一次,用 25%~30% 算力换取显存大降 60%~70%。
  • 公式:—
  • 前端类比:像按需懒计算 Getter 代替在内存中缓存全部衍生状态(Derived State)。
  • 代码定位:docs/chapters/09-tinygpt.md

七、推理与效率(第10章) ​

KV Cache ​

  • 英文:key-value cache
  • 章节:第10章
  • 定义:把每一步算过的 K/V 缓存下来,避免重复计算。
  • 公式:—
  • 前端类比:像 useMemo 缓存 expensive 结果。
  • 代码定位:python/llm_core/kv_cache.py

PagedKV / PagedAttention ​

  • 英文:paged KV cache / PagedAttention
  • 章节:第10章
  • 定义:把 KV Cache 切成固定大小的物理块,按需分配、跨请求共享,避免连续显存分配造成的碎片。
  • 公式:—
  • 前端类比:像操作系统虚拟内存的分页——逻辑块号映射到物理页帧,也像 IndexedDB 的分页存储。
  • 代码定位:clean_room/paged_kv.py、python/llm_core/paged_kv.py

RoPE ​

  • 英文:rotary positional embedding
  • 章节:第10章
  • 定义:把位置信息编码成复平面旋转,相对长度可外推。
  • 公式:q′=Rθq
  • 前端类比:像 CSS 的 transform: rotate()——位置由角度表达。
  • 代码定位:python/llm_core/transformer.py

NoPE ​

  • 英文:no positional embedding
  • 章节:第10章(RoPE 小节的反直觉对照)
  • 定义:decoder-only 模型完全不加位置编码的设置。位置信息并没有真正丢失:causal mask 让每个位置能 attend 的 token 数各不相同,各层据此能「数」出绝对位置;「必须显式注入位置信号」的必要性在 encoder-only 侧更强(无掩码则对顺序彻底不敏感)。Llama 4 已在层间交错 RoPE 层与 NoPE 层。
  • 公式:—
  • 前端类比:像不用 index 也能感知位置的长列表渲染——只要每个槽位的可见子元素数量不同,渲染顺序信息就藏在了结构里。
  • 代码定位:第10章 RoPE 小节 NoPE 注脚(本课边界:概念级对照,不实现)

GQA ​

  • 英文:grouped-query attention
  • 章节:第10章
  • 定义:多组 query 共享同一份 K/V,省显存又不损质量。
  • 公式:—
  • 前端类比:像 SWR 的 stale-while-revalidate——多个请求共用一份缓存。
  • 代码定位:python/llm_core/attention.py

MQA ​

  • 英文:multi-query attention
  • 章节:第10章
  • 定义:所有 query 头共享一份 K/V,极致省显存。
  • 公式:—
  • 前端类比:像多租户单例——所有人共用同一份资源。
  • 代码定位:python/llm_core/attention.py

量化 ​

  • 英文:quantization
  • 章节:第10章
  • 定义:把 fp32/fp16 权重压成低位整数,牺牲一点精度换吞吐。
  • 公式:xq=round(x/s)+z
  • 前端类比:像图片 WebP 压缩——更小但仍可识别。
  • 代码定位:python/llm_core/blocks.py

int8 ​

  • 英文:8-bit integer
  • 章节:第10章
  • 定义:8 位整数量化,相比 fp16 再省一半显存。
  • 公式:—
  • 前端类比:像把 CSS class 名压缩成单字符短类名。
  • 代码定位:python/llm_core/blocks.py

int4 ​

  • 英文:4-bit integer
  • 章节:第10章
  • 定义:4 位整数量化,边缘设备首选。
  • 公式:—
  • 前端类比:像图片转成 grayscale 灰度图。
  • 代码定位:python/llm_core/blocks.py

fp8 ​

  • 英文:8-bit floating point
  • 章节:第10章 / 第12章
  • 定义:8 位浮点格式(e4m3:4 位指数 + 3 位尾数 + 1 位符号),动态范围约 ±448;V3 首次在公开训练中稳定使用 FP8 混合精度训练,把权重/激活的量化和高精度累加结合,训练吞吐接近 fp16 的两倍。
  • 公式:—
  • 前端类比:像 CSS color: #abc——更短但仍可辨。
  • 代码定位:python/llm_core/blocks.py(量化接口);V3 FP8 tile/block 级 scaling 机制为概念级讲解,本课不实现训练侧 FP8 kernel。

fp16 ​

  • 英文:half precision float
  • 章节:第10章
  • 定义:16 位浮点,训练与推理常用的精度档位。
  • 公式:—
  • 前端类比:像 CSS 里的 color: #abc——三位简写。
  • 代码定位:python/llm_core/blocks.py

GPTQ ​

  • 英文:GPTQ quantization
  • 章节:第10章
  • 定义:按层最小化重构误差的训练后量化方法。
  • 公式:—
  • 前端类比:像 PostCSS 的 autoprefixer——按规则自动加补丁。
  • 代码定位:—(本课只做概念对照,不实现)

AWQ ​

  • 英文:activation-aware weight quantization
  • 章节:第10章
  • 定义:保护激活敏感权重的低比特量化策略。
  • 公式:—
  • 前端类比:像 React 的 React.memo——按重要性差别对待。
  • 代码定位:—(本课只做概念对照,不实现)

上下文窗口 ​

  • 英文:context window
  • 章节:第10章
  • 定义:模型一次能处理的最大 token 数,受位置编码与显存限制。
  • 公式:—
  • 前端类比:像 URL_MAX_LENGTH——超过会截断。
  • 代码定位:python/llm_core/transformer.py

prefill 与 decode ​

  • 英文:prefill / decode
  • 章节:第10章
  • 定义:prefill 并行处理整段 prompt,decode 自回归逐 token 生成。
  • 公式:—
  • 前端类比:像 SSR(prefill)与 CSR 渲染(decode)的差别。
  • 代码定位:python/llm_core/kv_cache.py

算术强度 ​

  • 英文:arithmetic intensity
  • 章节:第10章
  • 定义:一次计算从主存取回的每个字节上完成的浮点运算次数。decode 在只计权重时,每个权重做一次乘加,同一份权重被 batch 条序列复用。
  • 公式:(2×B)/b,其中 B 是 batch,b 是每个权重的字节数。
  • 前端类比:像一次请求取回的 JSON 被多少次渲染复用——复用次数高,等带宽的时间就被摊薄。
  • 代码定位:python/llm_core/roofline.py

roofline ​

  • 英文:roofline model
  • 章节:第10章
  • 定义:峰值算力除以峰值带宽得到脊点(ops/byte)。算术强度低于脊点时,时间由带宽决定;高于脊点时,时间由算力决定。两条上限都离得远时,时间由启动开销决定。
  • 公式:脊点 = 峰值 FLOP/s / 带宽(B/s)。
  • 前端类比:像页面同时有计算预算和网络预算两条天花板,先碰到哪一条,优化就打哪一条。
  • 代码定位:python/llm_core/roofline.py

采样 ​

  • 英文:sampling
  • 章节:第10章
  • 定义:从概率分布中抽 token,决定生成多样性。
  • 公式:—
  • 前端类比:像 Math.random() 抽样。
  • 代码定位:python/llm_core/mlp_lm.py

temperature ​

  • 英文:temperature
  • 章节:第10章
  • 定义:缩放 logits 分布的「温度」,高则多样低则确定。
  • 公式:pi∝exp⁡(zi/T)
  • 前端类比:像 border-radius——越大越圆润。
  • 代码定位:python/llm_core/mlp_lm.py

greedy 解码 ​

  • 英文:greedy decoding
  • 章节:第10章
  • 定义:每步选概率最大的 token,确定性最强但易重复。
  • 公式:y^t=arg⁡maxp
  • 前端类比:像 ESLint --fix——自动挑最保守的修复。
  • 代码定位:python/llm_core/mlp_lm.py

top-k ​

  • 英文:top-k sampling
  • 章节:第10章
  • 定义:只在概率最高的 k 个 token 里采样,砍掉长尾。
  • 公式:—
  • 前端类比:像 Array.slice(0, k).sort()——只看头部候选。
  • 代码定位:python/llm_core/mlp_lm.py

top-p ​

  • 英文:nucleus sampling
  • 章节:第10章
  • 定义:按累计概率选一个最小集合,使和 ≥ p,从中采样。
  • 公式:—
  • 前端类比:像 Promise.race——先达标的入选。
  • 代码定位:python/llm_core/mlp_lm.py

连续批处理 ​

  • 英文:continuous batching / iteration-level batching
  • 章节:第10章 延伸(L1 概念级)
  • 定义:把服务端批处理的调度粒度降到每次 decode 迭代:先完成的请求立刻出队并释放 KV 物理块,新请求随时入场;静态批则要等最长的请求生成完毕,期间已完成请求白占显存。vLLM 将其与 PagedKV 组合大幅提升吞吐。
  • 公式:—
  • 前端类比:像事件循环的任务队列——每个 tick 重新收集就绪任务,而不是攒满一批再统一执行。
  • 代码定位:—(本课边界:L1 概念级,未实现调度器;概念讲解见 第10章)

在线 Softmax ​

  • 英文:Online Softmax
  • 章节:第10章
  • 定义:维护动态最大值 mnew 与动态分母和 ℓnew 的单趟流式数值稳定归一化算法,无需一次性将整个长序列的中间激活写回显存。
  • 公式:ℓnew=ℓprevemprev−mnew+∑iexi−mnew
  • 前端类比:像前端流式下载计算进度条百分比,按分块动态累加分子分母,无需等待全部二进制 buffer 下载完毕再算总长。
  • 代码定位:docs/chapters/10-inference-cache.md

FlashAttention ​

  • 英文:FlashAttention (IO-Aware Exact Attention)
  • 章节:第10章
  • 定义:考虑 GPU SRAM(~19 TB/s)与 HBM 显存(~1.5 TB/s)的访存速度断层,通过分块(Tiling)与在线 Softmax 在片上高速 SRAM 完成全部计算,消除在 HBM 显存中物化 O(N2) 注意力矩阵的 IO 感知精确注意力算子。
  • 公式:避免在 HBM 显存物化写入中间矩阵 S=QKTd 与 P=softmax(S)
  • 前端类比:像前端虚拟列表——不在 DOM 树中一次性挂载 10 万个真实 DOM 节点,而是在视口高度内复用少量节点并直接在内存中算好展示内容。
  • 代码定位:docs/chapters/10-inference-cache.md

投机解码拒绝采样 ​

  • 英文:Speculative Decoding Rejection Sampling
  • 章节:第10章
  • 定义:由小模型预先草拟 K 个 token,大模型并行单次前向验证,通过 Metropolis-Hastings 拒绝采样无损还原大模型真实采样分布的推断加速机制。
  • 公式:接受率 α=min(1,p(x)q(x));若拒绝,按残差分布采样:Presample(x)=max(0,p(x)−q(x))∑x′max(0,p(x′)−q(x′))
  • 前端类比:像客户端的乐观 UI 更新(Optimistic UI Update)——弱网下先在本地无等待渲染预期状态,等服务端接口返回时严格无损核对或局部回滚重算。
  • 代码定位:docs/chapters/10-inference-cache.md

八、后训练与对齐(第11章) ​

SFT ​

  • 英文:supervised fine-tuning
  • 章节:第11章
  • 定义:用人工标注的 (prompt, answer) 对继续训练,让模型对齐指令。
  • 公式:—
  • 前端类比:像在脚手架上按指南重写组件。
  • 代码定位:python/llm_core/post_training.py

指令微调 ​

  • 英文:instruction tuning
  • 章节:第11章
  • 定义:用多样化任务指令训练,提升 zero-shot 泛化能力。
  • 公式:—
  • 前端类比:像 Storybook 文档驱动组件开发。
  • 代码定位:python/llm_core/post_training.py

loss mask ​

  • 英文:loss masking
  • 章节:第11章
  • 定义:在 SFT 中只对回答部分算损失,把 prompt 部分 mask 掉。
  • 公式:—
  • 前端类比:像 <input readonly>——某些字段不参与提交。
  • 代码定位:python/llm_core/post_training.py

LoRA ​

  • 英文:low-rank adaptation
  • 章节:第11章
  • 定义:冻结原权重,只训练低秩增量 ΔW=AB,省显存省成本。
  • 公式:W′=W+AB
  • 前端类比:像打 patch——只改变动部分,原文件不动。
  • 代码定位:python/llm_core/post_training.py

adapter ​

  • 英文:adapter
  • 章节:第11章
  • 定义:插在 Transformer 层间的小网络,是早期参数高效微调手段。
  • 公式:—
  • 前端类比:像 Webpack 的中间件插件。
  • 代码定位:python/llm_core/post_training.py

QLoRA ​

  • 英文:quantized low-rank adaptation
  • 章节:第11章 延伸(L1 概念级)
  • 定义:把被冻结的主权重以 4-bit 量化存放、只训练高精度 LoRA 参数的显存优化组合,使单张消费级显卡可微调数 B 参数模型;量化误差混入前向计算,merge 前需反量化回高精度并对拍。
  • 公式:结构同 LoRA(W′=W+AB),区别是 W 以 4-bit 存储、A/B 保持高精度。
  • 前端类比:像把不常修改的主资源打成压缩产物只读分发,热更新只走一个小补丁包。
  • 代码定位:—(本课边界:L1 概念级,未实现;讲解见 第11章)

DPO ​

  • 英文:direct preference optimization
  • 章节:第11章
  • 定义:用偏好对直接优化策略,省去 reward model 和 RL 流程。
  • 公式:—
  • 前端类比:像 Git rebase——直接重写历史。
  • 代码定位:python/llm_core/post_training.py

RLHF ​

  • 英文:reinforcement learning from human feedback
  • 章节:第11章
  • 定义:用人类偏好训练 reward 模型,最后用 PPO 微调 LLM。
  • 公式:—
  • 前端类比:像 Code Review 反馈——多轮迭代到符合规范。
  • 代码定位:—(本课只做概念对照,不实现)

reward model ​

  • 英文:reward model
  • 章节:第11章
  • 定义:用人类偏好数据训练的评分模型,给回答打分。
  • 公式:—
  • 前端类比:像 ESLint 规则集——给代码打分。
  • 代码定位:python/llm_core/post_training.py

preference pair ​

  • 英文:preference pair
  • 章节:第11章
  • 定义:同一个 prompt 的 (chosen, rejected) 回答对,用于 RLHF/DPO。
  • 公式:—
  • 前端类比:像 PR 里的 + 与 - 行——成对存在。
  • 代码定位:python/llm_core/post_training.py

过程奖励模型 PRM ​

  • 英文:process reward model
  • 章节:第11章, 第12章
  • 定义:对大模型推理链(CoT)中的每一步单独给出稠密打分,精确定位逻辑错误分岔点。
  • 公式:R=∑tr(st)
  • 前端类比:像端到端测试中每一步都有断言(Step Assertion),而不是只在最后断言页面。
  • 代码定位:python/llm_core/post_training.py

可验证奖励 RLVR ​

  • 英文:reinforcement learning with verifiable reward
  • 章节:第11章, 第12章
  • 定义:利用编译器通过性、单元测试结果或数学相等性等确定性规则自动判定的强化学习奖励机制。
  • 公式:R∈{0,1}(Deterministic Rule)
  • 前端类比:像 GitHub Actions CI 的自动化检查(lint + test)给出二元 exit code。
  • 代码定位:python/llm_core/post_training.py

KTO ​

  • 英文:Kahneman-Tversky optimization
  • 章节:第11章
  • 定义:基于行为经济学前景理论与损失厌恶效应的非成对偏好对齐算法,直接利用单点正/负反馈数据优化策略。
  • 公式:LKTO(θ)=E(x,y)[w(y)(1−v(βlog⁡ππref−zref))]
  • 前端类比:像直接统计用户单个“点赞”与“点踩”按钮行为,而不需要强求 A/B 组配对。
  • 代码定位:docs/chapters/11-post-training.md

知识蒸馏 knowledge distillation ​

  • 英文:knowledge distillation
  • 章节:第11章, 第12章
  • 定义:利用大模型(Teacher)输出的平滑概率分布(软标签)训练较小模型(Student),传递暗知识。
  • 公式:LKD=(1−α)LCE+αT2LKL(softmax(zs/T),softmax(zt/T))
  • 前端类比:像经验丰富的资深前端工程师对新人进行 Code Review,给出细致的行级审查指引。
  • 代码定位:docs/chapters/11-post-training.md

在线策略蒸馏 on-policy distillation ​

  • 英文:on-policy distillation (OPD)
  • 章节:第11章
  • 定义:学生自己采样轨迹、教师进入这条轨迹在每个 token 位给出分布级稠密监督的蒸馏形态;固定数据集上的 logit/response 蒸馏与 SFT 同为 off-policy(训练数据来自别的策略)。可读作「用教师替代 verifier 的 RLVR」:采样照旧来自学生,把终答可验证判定换成教师逐步信号,credit assignment 从序列级稠密化到 token 级;GKD 是它与学生采样比例可插值的一般化框架。
  • 公式:LOPD=Ex∼D,y∼πθ[∑tDKL(πθ(⋅∣x,y<t)∥pT(⋅∣x,y<t))]
  • 前端类比:像结对编程里资深工程师盯着你实际敲出的每一行即时点评,而不是只批改别人留下的历史提交。
  • 代码定位:第11章 #opd 小节(本课边界:机制级理解,不实现——教师需逐步 forward 预算)

似然比技巧 Likelihood Ratio Trick ​

  • 英文:Likelihood Ratio Trick / REINFORCE
  • 章节:第11章
  • 定义:将不可导的环境奖励期望梯度,通过恒等变换 ∇θπθ=πθ∇θlog⁡πθ 转化为可由模型自回归生成样本通过蒙特卡洛采样的策略梯度形式。
  • 公式:∇θEy∼πθ[R(y)]=Ey∼πθ[∇θlog⁡πθ(y)⋅R(y)]
  • 前端类比:像在第三方闭包 SDK 外部包一层代理拦截器,利用触发事件的参数来反推内部状态机的影响。
  • 代码定位:docs/chapters/11-post-training.md;表格版单步更新 reinforce_step 在 clean_room/tabular_rl.py(clean-room 第 9 模块,参考实现 python/llm_core/tabular_rl_ref.py)

SimPO 简单偏好优化 ​

  • 英文:Simple Preference Optimization
  • 章节:第11章
  • 定义:消除对独立参考模型 πref 显存占用的轻量对齐算法;将平均序列对数似然直接作为隐式奖励,并引入显式目标间隔 γ 防止退化。
  • 公式:LSimPO=−log⁡σ(β|yw|log⁡πθ(yw∣x)−β|yl|log⁡πθ(yl∣x)−γ)
  • 前端类比:像数组排序比较函数直接取 (scoreA - scoreB - margin),不再为了比对而长期在内存中镜像一份全量历史 DOM树。
  • 代码定位:docs/chapters/11-post-training.md

知识编辑 Knowledge Editing ​

  • 英文:Knowledge Editing / Model Editing (ROME / MEMIT)
  • 章节:第11章
  • 定义:针对特定事实记忆进行外科手术式定向参数修改,同时严格保证模型在所有无关领域输出不受扰动的微调替代范式。核心依赖 FFN 键值联想记忆假说,通过因果追踪定位后计算解析秩一增量。
  • 公式:ΔW=(v∗−Wk∗)k∗TC−1k∗TC−1k∗,C=E[kkT]
  • 前端类比:像在 Redux 状态树中精确 patch 某一个深层嵌套键值,而不是把整个根 Store 推倒重置并重新分发所有 action。
  • 代码定位:docs/chapters/11-post-training.md

九、检索与知识(第13章, 第14章) ​

RAG ​

  • 英文:retrieval-augmented generation
  • 章节:第13章
  • 定义:先从外部知识库检索,再让 LLM 基于检索内容生成回答。
  • 公式:—
  • 前端类比:像 <Suspense>——等待异步数据再渲染。
  • 代码定位:python/agent_core/rag.py

retrieval ​

  • 英文:retrieval
  • 章节:第13章
  • 定义:给定 query 在语料中找最相关的若干文档。
  • 公式:—
  • 前端类比:像搜索引擎的全文索引。
  • 代码定位:python/agent_core/rag.py

reranking ​

  • 英文:reranking
  • 章节:第13章
  • 定义:对初检结果用更强模型二次排序,提升 top 结果质量。
  • 公式:—
  • 前端类比:像 ESLint --fix --quiet 先排序再处理。
  • 代码定位:python/agent_core/rag.py

chunk 切分 ​

  • 英文:chunking
  • 章节:第13章
  • 定义:把长文档切成适合嵌入的小块,是 RAG 的关键预处理。
  • 公式:—
  • 前端类比:像虚拟列表 react-window 的窗口切片。
  • 代码定位:python/agent_core/rag.py

向量检索 ​

  • 英文:vector search
  • 章节:第13章
  • 定义:用 embedding 向量在 ANN 索引里找最近邻。
  • 公式:—
  • 前端类比:像 CDN 的就近节点调度。
  • 代码定位:python/agent_core/embedding.py

余弦相似度 ​

  • 英文:cosine similarity
  • 章节:第13章
  • 定义:用向量夹角衡量相似度,对长度不敏感。
  • 公式:cos⁡θ=a⋅b∥a∥∥b∥
  • 前端类比:像 GitHub 协作关系图的角度度量。
  • 代码定位:python/agent_core/embedding.py

recall@k ​

  • 英文:recall@k
  • 章节:第13章
  • 定义:top-k 检索中真实相关文档被召回的比例。
  • 公式:Recall@k=|relevant∩top-k||relevant|
  • 前端类比:像 CI 中的 code coverage 报告。
  • 代码定位:python/agent_core/eval.py

引用回链 ​

  • 英文:citation back-link
  • 章节:第13章
  • 定义:让模型在回答中标注引用的来源,便于核验。
  • 公式:—
  • 前端类比:像 <a target="_blank">——可点回原页面。
  • 代码定位:python/agent_core/rag.py

拒答 ​

  • 英文:abstention
  • 章节:第13章
  • 定义:检索结果不足或不确定时,模型主动回答「不知道」。
  • 公式:—
  • 前端类比:像 404 页面——给个明确兜底。
  • 代码定位:python/agent_core/rag.py

RRF 混合检索 ​

  • 英文:reciprocal rank fusion
  • 章节:第14章
  • 定义:多路召回按排名倒数打分融合,不看原始分数量纲,向量路与 BM25 路可直接合并。
  • 公式:score(d)=∑r1k+rankr(d)(本课取 k=60)
  • 前端类比:像多个排行榜按名次赋分再汇总,而不是直接加原始分数。
  • 代码定位:python/agent_core/rag_live.py

RAG 三元组评估 RAG Triad ​

  • 英文:RAG triad (faithfulness, answer relevance, context relevance)
  • 章节:第13章, 第21章
  • 定义:衡量 RAG 系统的三大核心评估支柱:忠实度(防幻觉,回答必须来自上下文)、回答相关性(切题度)与上下文相关性(检索纯度)。
  • 公式:—
  • 前端类比:像前端核心 Web 指标(LCP、FID、CLS)——从三个正交维度综合判定页面健康度。
  • 代码定位:python/agent_core/rag.py

十、Agent 与工具(第15章) ​

Agent ​

  • 英文:agent
  • 章节:第15章
  • 定义:能感知环境、做决策、调工具完成多步任务的 LLM 应用形态。
  • 公式:—
  • 前端类比:像 Service Worker——自动监听事件并执行任务。
  • 代码定位:python/agent_core/engine.py

harness ​

  • 英文:harness
  • 章节:第15章
  • 定义:包裹 LLM 的运行时框架,负责循环、工具调用、状态管理。
  • 公式:—
  • 前端类比:像 webpack-dev-server——包住引擎做对外接口。
  • 代码定位:python/agent_core/engine.py

tool ​

  • 英文:tool
  • 章节:第15章
  • 定义:Agent 可调用的外部能力(搜索、计算、HTTP、文件 IO)。
  • 公式:—
  • 前端类比:像 Web API(fetch、localStorage)。
  • 代码定位:python/agent_core/tools.py

schema ​

  • 英文:schema
  • 章节:第15章
  • 定义:用 JSON Schema 描述工具输入输出,约束调用合法性。
  • 公式:—
  • 前端类比:像 TypeScript interface——定义结构契约。
  • 代码定位:python/agent_core/schemas.py

function calling ​

  • 英文:function calling
  • 章节:第15章
  • 定义:让 LLM 输出结构化参数以触发外部函数的标准接口。
  • 公式:—
  • 前端类比:像 dispatchEvent(new CustomEvent(...))——触发已注册回调。
  • 代码定位:python/agent_core/tools.py

policy ​

  • 英文:policy
  • 章节:第15章
  • 定义:决定 Agent 下一步该选哪个工具/动作的策略函数。
  • 公式:π(a|s)
  • 前端类比:像路由守卫 beforeEach——根据状态决定下一步。
  • 代码定位:python/agent_core/policy.py

HITL 人在回路 ​

  • 英文:human-in-the-loop
  • 章节:第15章
  • 定义:关键动作前需要人工确认,降低自动化风险。
  • 公式:—
  • 前端类比:像 <button> 的二次确认弹窗。
  • 代码定位:python/agent_core/policy.py

幂等 ​

  • 英文:idempotency
  • 章节:第15章
  • 定义:同一操作执行多次结果相同,避免重复副作用。
  • 公式:f(f(x))=f(x)
  • 前端类比:像 REST 的 PUT——重复请求幂等。
  • 代码定位:python/agent_core/tools.py

状态机 ​

  • 英文:state machine
  • 章节:第15章
  • 定义:把 Agent 行为建模成离散状态与转移,便于测试和回放。
  • 公式:—
  • 前端类比:像 XState——把 UI 流程写成 FSM。
  • 代码定位:python/agent_core/state.py

MCP ​

  • 英文:Model Context Protocol
  • 章节:第15章
  • 定义:让 LLM 通过统一协议接入外部工具与数据源。
  • 公式:—
  • 前端类比:像 WebUSB / Web Bluetooth——统一抽象。
  • 代码定位:python/agent_core/mcp_adapter.py

ACL ​

  • 英文:access control list
  • 章节:第15章
  • 定义:工具/资源的访问控制清单,决定谁能调用什么。
  • 公式:—
  • 前端类比:像 npm scopes——谁能 publish/install。
  • 代码定位:python/agent_core/tools.py

提示注入 prompt injection ​

  • 英文:prompt injection
  • 章节:第15章
  • 定义:在用户输入或工具返回中塞入恶意指令,劫持 Agent。
  • 公式:—
  • 前端类比:像 XSS——把脚本塞进 DOM 里。
  • 代码定位:python/agent_core/policy.py

Plan-and-Solve 范式 ​

  • 英文:plan-and-solve paradigm
  • 章节:第15章
  • 定义:先将复杂任务分解为完整的步骤图(DAG),再由执行器逐项求解的 Agent 规划范式,适合高确定性长流程。
  • 公式:—
  • 前端类比:像项目管理中的甘特图与里程碑拆解,先定排期再分派任务。
  • 代码定位:docs/chapters/15-agent-tools.md

语法约束解码 constrained decoding ​

  • 英文:grammar-constrained decoding / grammar-based sampling
  • 章节:第15章
  • 定义:基于文法状态机在每个生成步对非法 Token 施加 Logits 掩码,在数学上保证模型输出 100% 满足 JSON Schema。
  • 公式:logits[v]=−∞(∀v∉AllowedTokens(s))
  • 前端类比:像带有严格 TypeScript 类型检查和格式掩码的表单受控输入组件(Input Mask)。
  • 代码定位:docs/chapters/15-agent-tools.md

沙箱执行隔离 sandbox execution ​

  • 英文:sandboxed execution environment
  • 章节:第15章
  • 定义:为具备代码执行能力的 Agent 提供进程、容器或微虚拟机级别的硬性安全隔离,配合配额与网络出站白名单防越权。
  • 公式:—
  • 前端类比:像 iframe sandbox 属性或 Web Worker 沙盒环境——隔离脚本执行上下文与宿主 DOM。
  • 代码定位:docs/chapters/15-agent-tools.md

Reflexion 反思架构 ​

  • 英文:Reflexion (Verbal Reinforcement Learning)
  • 章节:第15章
  • 定义:当 Agent 遇到工具调用或环境执行失败时,不盲目重试或在上下文中堆积冗长错误栈,而是由模型对失败轨迹进行自我复盘,提炼一条浓缩的自然语言经验(Verbal Lesson)持久化到情景记忆,并回滚状态开始新一轮尝试。
  • 公式:情景记忆增量:Mt=Mt−1∪{SelfReflection(x,a1:t,o1:t)}
  • 前端类比:像自动化测试的重试策略——发生断言失败后,不把 10MB 的堆栈日志直接塞进后续请求,而是提炼一句话关键错误并清理 DOM 状态重跑。
  • 代码定位:docs/chapters/15-agent-tools.md

十一、评估、安全与交付(第21章, 第22章) ​

Eval ​

  • 英文:evaluation
  • 章节:第21章
  • 定义:用基准集量化模型能力,对比不同版本。
  • 公式:—
  • 前端类比:像 Lighthouse 跑分——给页面打分。
  • 代码定位:python/agent_core/eval.py

Judge ​

  • 英文:LLM-as-judge
  • 章节:第21章
  • 定义:用更强的 LLM 给回答打分,代替昂贵的人类评估。
  • 公式:—
  • 前端类比:像 ESLint plugin——按规则打分。
  • 代码定位:python/agent_core/judge.py

trace ​

  • 英文:trace
  • 章节:第21章
  • 定义:记录一次推理的输入、工具调用、中间状态,方便回放。
  • 公式:—
  • 前端类比:像 Chrome DevTools 的 Performance trace。
  • 代码定位:python/agent_core/eval_harness.py

manifest ​

  • 英文:manifest
  • 章节:第21章, 第22章
  • 定义:描述模型制品(权重、配置、hash、依赖)的元数据文件。
  • 公式:—
  • 前端类比:像 package.json 或 manifest.webmanifest。
  • 代码定位:python/cloud_adapter/artifacts.py

artifact chain ​

  • 英文:artifact chain
  • 章节:第21章, 第22章
  • 定义:制品之间的依赖链(数据 → 模型 → 评测 → 部署)。
  • 公式:—
  • 前端类比:像 Webpack 的 chunk graph。
  • 代码定位:python/cloud_adapter/artifacts.py

冻结分母 ​

  • 英文:frozen denominator
  • 章节:第21章
  • 定义:评测时固定评估集与 judge 模型,保证分数可比。
  • 公式:—
  • 前端类比:像 package-lock.json 锁住依赖版本。
  • 代码定位:python/agent_core/eval_harness.py

混淆矩阵 confusion matrix ​

  • 英文:confusion matrix
  • 章节:第21章
  • 定义:把一批二值判定与人工真值逐条对齐得到的四格计数(TP/FP/FN/TN,以「要抓的对象」为正类)。LLM 评估里的 Judge 合格判定、红队有害判定、RLVR 通过判定都是它的实例;accuracy 与一致率都是四格的混合体,类别不平衡时严重误导(有害内容占 1% 时「全部放行」的判官 accuracy 高达 0.99、recall 为 0)。
  • 公式:—
  • 前端类比:像错误监控先把告警拆成「报了真错 / 报了没错 / 没报真错 / 没报没错」四格,再谈告警质量。
  • 代码定位:第21章 #judge-metrics 小节

精确率、召回率与 F1(判官指标族) ​

  • 英文:precision / recall / F1
  • 章节:第21章
  • 定义:混淆矩阵四格导出的三个互补指标:precision 是「判官说有问题里多少真有问题」(指认可信度,红队视角对应误杀),recall 是「真有问题里抓到多少」(漏判代价,对应漏放),F1 取调和平均、两者严重失衡时重罚。LaaJ 位置偏置可读成判官的条件召回率漂移;0/1 判定的 LLM 判官以 P/R/F1 为主,ROC/AUC 只对输出连续分数、阈值可扫的判官有意义。与 McNemar 检验分层:先点估计、再显著性。
  • 公式:precision=TPTP+FP,recall=TPTP+FN,F1=2TP2TP+FP+FN
  • 前端类比:像告警系统的查准与查全——只报真警零误报但漏事故,全量报警零漏报但没人看;F1 就是逼你在两端都不塌方的平衡点。
  • 代码定位:第21章 #judge-metrics 小节

帕累托前沿 / 帕累托最优 ​

  • 英文:Pareto frontier / Pareto optimality
  • 章节:第21章(主),第10章、第11章 延伸
  • 定义:在多个相互冲突的目标(如准确率 vs 调用成本/延迟、安全性 vs 有用性、量化压缩比 vs 困惑度)中,不存在任何其他方案能在不恶化至少一个维度的前提下使其余维度更优的非支配解(non-dominated solutions)构成的边界集合。落入前沿内侧的方案属于被严格支配的次优解,应在工程选型中直接剔除。
  • 公式:P∗={m∈M∣∄m′∈M s.t. m′≻m}
  • 前端类比:像 Web 前端性能调优的黄金三角权衡:代码包体积(Bundle Size)vs 首屏可交互耗时(TTI)vs 功能完整度——没有绝对无损的免费优化,工程的本质是在业务约束(如首屏小于 1.5s)下选取帕累托前沿上的最佳拐点。
  • 代码定位:eval/、python/agent_core/eval.py、python/agent_core/eval_harness.py

OWASP LLM Top 10 ​

  • 英文:OWASP LLM Top 10
  • 章节:第21章
  • 定义:LLM 应用常见安全风险清单(注入、数据泄露等)。
  • 公式:—
  • 前端类比:像 OWASP Top 10 Web——给前端安全画清单。
  • 代码定位:python/agent_core/policy.py

Cloud Run ​

  • 英文:Cloud Run
  • 章节:第21章
  • 定义:Google Cloud 上的无服务器容器托管,按请求计费。
  • 公式:—
  • 前端类比:像 Vercel 的 Serverless Function。
  • 代码定位:python/cloud_adapter/planner.py

Vertex AI ​

  • 英文:Vertex AI
  • 章节:第21章
  • 定义:Google Cloud 的托管 ML 平台,统一训练/部署。
  • 公式:—
  • 前端类比:像 Vercel + GitHub Actions 的一站式套件。
  • 代码定位:python/cloud_adapter/planner.py

quota ​

  • 英文:quota
  • 章节:第21章
  • 定义:云端对调用频率/数量的限制,需要做好退避。
  • 公式:—
  • 前端类比:像 GitHub API rate limit——超出要等。
  • 代码定位:python/cloud_adapter/planner.py

cost cap ​

  • 英文:cost cap
  • 章节:第21章
  • 定义:对单次或单日云端花费的硬上限,防止失控。
  • 公式:—
  • 前端类比:像 CI 流水线超时设置。
  • 代码定位:python/cloud_adapter/planner.py

dry-run ​

  • 英文:dry-run
  • 章节:第21章
  • 定义:预演部署/调用流程,不实际消耗资源。
  • 公式:—
  • 前端类比:像 terraform plan——只看不执行。
  • 代码定位:python/cloud_adapter/planner.py

Coding Agent ​

  • 英文:coding agent
  • 章节:第22章(延伸 · 工程画像)
  • 定义:在真实仓库里读代码、改代码、跑测试、提交修复的代理。工程画像四切片:工具面收敛到 shell 执行 / 文件编辑 / 搜索三类原语;repo map 先行建立结构认知(RAG 的「先召回再精读」搬到代码仓库);测试驱动循环——失败的测试就是它的 verifier(与 RLVR 判卷器同源,用途从训练信号换成推理期循环控制);评估口径回链 SWE-bench 治理(pass@k vs pass@1、Verified 子集)。
  • 公式:—
  • 前端类比:像接手陌生代码库的资深工程师——先看目录结构与测试,再动手最小修改,用 CI 红绿当反馈循环。
  • 代码定位:—(本课不实现 coding agent;capstone 通用 harness 的 typed tools、policy/HITL、checkpoint/trace 即其骨架,见 第22章 #coding-agents)

模型水印 Model Watermarking ​

  • 英文:Model Watermarking (KGW)
  • 章节:第21章
  • 定义:在自回归解码采样阶段嵌入不可察觉统计偏置的技术。通过前序 token 哈希将词表划分为红绿列表并对绿色列表施加 logit 偏置,检测端通过统计绿色词频次执行无须原始模型的 Z-score 假设检验。
  • 公式:z=|T|G−γ|T||T|γ(1−γ)
  • 前端类比:像在前端 Canvas 图片中嵌入隐式频域盲水印,肉眼无感知但算法提取时特征明显。
  • 代码定位:docs/chapters/21-eval-safety-cloud.md

R-Judge ​

  • 英文:R-Judge
  • 章节:第21章 / 第15章
  • 定义:评估开放环境下大模型智能体安全风险意识的基准,采用四元组记录 (Profile, User, Agent, Environment) 评估系统对误杀系统守护进程、私钥外发与过度放权等真实物理风险的识别与研判能力。
  • 公式:—
  • 前端类比:像 E2E 安全集成测试套件,专门注入各种带破坏性副作用的操作来验证运行时权限沙箱能否拦截。
  • 代码定位:docs/chapters/21-eval-safety-cloud.md

十二、DeepSeek 模型专题(第12章) ​

本组词条只做动机级解释(为什么省 KV / 省算力 / 省 value model);正文专题与 toy 记账实现见 第12章 DeepSeek 模型专题。

MLA ​

  • 英文:multi-head latent attention
  • 章节:第12章(动机见 第10章 MQA/GQA 延伸)
  • 定义:DeepSeek-V2 的注意力变体:把 K/V 压成低秩 latent 向量缓存、推理时再展开,KV Cache 体积比 GQA 再降一档。
  • 公式:ct=WDKVht(缓存低秩 ct 而非完整 K/V)
  • 前端类比:像把 source map 压成索引文件——存压缩表示,用时再还原。
  • 代码定位:python/llm_core/deepseek_toys.py(KV 字节数记账 toy;专题见 第12章)

MoE ​

  • 英文:mixture of experts
  • 章节:第12章
  • 定义:把 FFN 换成多份专家副本,router 对每个 token 只激活 top-k 个,总参数很大但单次前向算力近似不变。
  • 公式:y=∑i∈top-kgi(x)Ei(x)
  • 前端类比:像微前端按路由懒加载——全量代码很大,单次渲染只挂载命中的子应用。
  • 代码定位:python/llm_core/deepseek_toys.py(router bias 纠偏 toy;专题见 第12章)

GRPO ​

  • 英文:group relative policy optimization
  • 章节:第12章
  • 定义:DeepSeek 系后训练用的策略优化:同一 prompt 采一组回答,用组内均值/方差归一化优势,省掉 PPO 的 value model。第12章给出完整公式、KL 项推导、vs PPO-clip 对照表与 toy 更新实现。
  • 公式:Ai=ri−mean({r})std({r});目标含 −βKL(π∥πref)
  • 前端类比:像按小组内排名给分而不是绝对分数线——不需要额外训练一个评分模型。
  • 代码定位:python/llm_core/post_training.py(group normalized advantage fixture 是其雏形)、python/llm_core/deepseek_toys.py(GRPO toy 更新;公式与 KL 对照见 第12章)

MTP ​

  • 英文:multi-token prediction
  • 章节:第12章
  • 定义:DeepSeek-V3 的训练目标:同时预测未来多个 token 而非只预测下一个;推理侧可复用该头做投机解码加速。第12章给出完整损失公式与训练/推理双作用讲解。
  • 公式:LMTP=∑d=1DCE(headd(xt+d−1), xt+d)
  • 前端类比:像预取接下来 N 个路由——一次请求备好多步。
  • 代码定位:python/llm_core/deepseek_toys.py(MTP 损失公式 toy;概念讲解见 第12章)

PPO ​

  • 英文:proximal policy optimization
  • 章节:第11章 / 第12章
  • 定义:经典 on-policy RL 优化器,用 clipped surrogate 目标限制每次策略更新幅度,是 RLHF 管线的传统基座(GRPO 的对照组)。概率比是旧策略样本上的逐步重要性采样权重;value head 拟合的 V 是剩余回报,GAE 是一步 TD 残差的指数加权。生成过程的 MDP 见 第11章。
  • 公式:LCLIP=E[min(rtAt, clip(rt,1−ϵ,1+ϵ)At)]
  • 前端类比:像带 maxDiff 上限的自动重写——每次只许小步改,防止一次改崩。
  • 代码定位:—(本课边界:L1 动机级,不实现;与 GRPO 的对照见 第12章)

DualPipe ​

  • 英文:DualPipe
  • 章节:第12章(系统层机制)
  • 定义:DeepSeek-V3 配套的双向流水线并行算法:同时启动两个对称方向的流水线(正向计算 batch A,反向计算 batch B),把 all-to-all 通信藏在另一路的密集 GEMM 背后,使万卡集群通信开销几乎被 100% 掩盖。
  • 公式:—
  • 前端类比:像 GPU 双缓冲——渲染帧 N 时预加载帧 N+1 的几何数据,VSync 间隙被精确利用。边界:双缓冲处理独立帧;DualPipe 调度同一 batch 的细粒度微块,要求双向对称。
  • 代码定位:—(本课概念讲解见 第12章;开源实现:DualPipe GitHub)

3FS ​

  • 英文:Fire-Flyer File System
  • 章节:第12章(系统层基础设施)
  • 定义:DeepSeek 自研的高性能分布式文件系统,基于 RDMA 网络提供 TB/s 级并行吞吐,是万卡训练集群的 I/O 底座,与 DualPipe 配合消除 IO 瓶颈。
  • 公式:—
  • 前端类比:像为 GPU 集群定制的 CDN 边缘缓存——数据就近驻留,避免跨节点读延迟。
  • 代码定位:—(本课概念讲解见 第12章;开源实现:3FS GitHub;论文见 Fire-Flyer AI-HPC arXiv:2408.14158)

KV Cache 量化 ​

  • 英文:KV-cache quantization
  • 章节:第12章(推理效率延伸)
  • 定义:把推理时缓存的 K/V 张量从 bf16/fp16 压到 INT8/FP8,直接降低 decode 阶段从显存读取 KV 的带宽需求,与 weight 量化正交。
  • 公式:Kq=round(K/sK)+zK,per-tensor 或 per-head 粒度
  • 前端类比:像把频繁读取的缓存资源打成 gzip——读时解压,带宽换显存。
  • 代码定位:—(本课概念级讲解见 第12章;vLLM 有工程实现)

MoE 推理 / Expert offloading ​

  • 英文:MoE inference / expert offloading
  • 章节:第12章(MoE 延伸)
  • 定义:推理时 routed expert 可能分布在多台设备上,需要 all-to-all 通信;expert parallelism 分片专家到多卡;expert offloading 把冷专家放在 CPU 内存,激活时通过 PCIe 传输,以延迟换显存。
  • 公式:—
  • 前端类比:像微服务的按需加载——服务实例分布在不同机器,调用时有网络 RTT,冷实例还要额外冷启动。
  • 代码定位:—(本课概念级讲解见 第12章;训练 toy 见 deepseek_toys.py)

Expert-choice 路由 ​

  • 英文:expert-choice routing
  • 章节:第12章(MoE 路由变体)
  • 定义:与标准 token-choice(token 挑 top-k 专家)相反,每个专家自己挑 top-k token;负载均衡是构造性的(每专家恰好 k 个 token),但被忽略 token 的 fallback 和可变序列长度组织更复杂。
  • 公式:—
  • 前端类比:像面试官主动挑候选人,而不是候选人投简历——分配均衡但"没被挑中的候选人"需要兜底机制。
  • 代码定位:—(本课概念级讲解见 第12章)

稀疏注意力 ​

  • 英文:sparse attention
  • 章节:第10章, 第12章
  • 定义:不是对所有历史位置做完整 softmax,而是用轻量 scoring 函数筛选 top-k 相关位置,只对这些位置计算 attention,把复杂度从 O(L2) 降到 O(L⋅k)。与 MLA 正交:MLA 压缩缓存,稀疏 attention 减少 attend 位置数,两者可叠加。
  • 公式:—
  • 前端类比:像搜索时先用 title 过滤再 fulltext——先用 cheap filter 缩小候选集。
  • 代码定位:clean_room/swa.py(选学练习场;讲解见 第12章)

滑动窗口注意力 ​

  • 英文:sliding-window attention / sliding-window attention (SWA)
  • 章节:第10章, 第12章
  • 定义:每个 token 只 attend 到固定大小的最近窗口(如 4096 个历史 token),超出窗口的内容不参与 attention;与 full attention 互补,适合超长序列。Mistral 是典型使用 SWA 的模型。
  • 公式:—
  • 前端类比:像虚拟列表的窗口渲染——只渲染视口附近的内容,其余保持占位。
  • 代码定位:clean_room/swa.py(选学练习场;讲解见 第12章)

Self-verification(推理语境) ​

  • 英文:self-verification
  • 章节:第12章(推理训练延伸)
  • 定义:模型在生成答案后,用同一模型或独立 verifier 对自己的输出做一致性检查(如重新推导、代码执行回测)。在 R1-Zero 中作为涌现行为出现("aha moment"),也可作为训练时的额外 reward 信号。
  • 公式:—
  • 前端类比:像写完代码后跑一遍 npm test——自己检查自己,不依赖外部评审。
  • 代码定位:—(本课概念级讲解见 第12章;本课不实现 verifier)

苦涩的教训 The Bitter Lesson ​

  • 英文:The Bitter Lesson (Richard Sutton, 2019)
  • 章节:第12章
  • 定义:强化学习之父 Richard Sutton 总结的 70 年 AI 发展核心规律:在长期视角下,唯一最具普适性与威力的手段是利用通用算力驱动的“学习”(Learning)与“搜索”(Search);一切试图将人类先验认知、特化启发式规则硬编码进系统的精巧设计,最终都会被通用算力的大规模扩展所彻底超越。
  • 公式:通用智能标度律:Intelligence∝Computetrain×Computetest
  • 前端类比:像针对各家浏览器的私有 CSS hack 与手写布局特判,最终都被现代浏览器标准的统一渲染引擎与 Flexbox/Grid 通用算法降维打击淘汰。
  • 代码定位:docs/chapters/12-deepseek.md

十三、应用实战与高阶架构(第13章–第20章) ​

Context Engineering ​

  • 英文:context engineering
  • 章节:第17章
  • 定义:系统性管理喂给模型的上下文:预算分配、压缩、检索回注与多轮状态,目标是在有限窗口内最大化有效信息。
  • 公式:—
  • 前端类比:像虚拟列表的窗口管理——视口有限,渲染什么由策略决定。
  • 代码定位:python/agent_core/memory.py

Harness Engineering ​

  • 英文:harness engineering
  • 章节:第15章–第22章
  • 定义:围绕模型构建可恢复、可评估、可观测运行时的工程学科:循环、工具边界、checkpoint、eval 与成本门禁。
  • 公式:—
  • 前端类比:像给引擎搭测试台架——引擎不变,台架决定能否安全测出极限。
  • 代码定位:python/agent_core/engine.py、python/agent_core/eval_harness.py

结构化输出 ​

  • 英文:structured outputs
  • 章节:第15章, 第17章
  • 定义:让模型输出符合 JSON Schema 的三档做法:自由文本求 JSON(无保证)、JSON mode(只保证合法 JSON)、strict json_schema(解码时约束,schema 级保证)。
  • 公式:—
  • 前端类比:像表单校验三档:文案提示 / pattern 属性 / JSON Schema validator。
  • 代码定位:python/agent_core/prompts.py

记忆模式(截断/摘要/记忆 RAG/画像) ​

  • 英文:memory patterns (truncation / summarization / memory-RAG / profile)
  • 章节:第17章
  • 定义:多轮对话超窗时的四种工程模式:滑动窗口截断(注意 tool call 配对)、摘要记忆(错误会累积放大)、记忆 RAG(事实抽取 + 检索回注)、画像记忆(重写 vs collection)。
  • 公式:—
  • 前端类比:像状态管理的四种持久化策略:LRU 淘汰 / 压缩快照 / 外存索引 / 用户偏好表。
  • 代码定位:python/agent_core/memory.py

SSE / 流式 ​

  • 英文:server-sent events / streaming
  • 章节:第19章
  • 定义:LLM 流式交付协议:data: <payload>\n\n 帧、按行缓冲消费(TCP 不保证消息边界)、流式 TextDecoder 防多字节乱码、AbortController 中断。
  • 公式:—
  • 前端类比:像 chunked transfer 上再加一层消息协议——帧边界必须自己拼。
  • 代码定位:python/labs/streaming_server.py、python/agent_core/gemini_roundtrip.py

程序辅助思维链 PoT ​

  • 英文:Program-aided Language Models (PoT)
  • 章节:第17章
  • 定义:将复杂逻辑推理与数值运算解耦,指令引导模型书写 Python 代码解题器并移交确定性编译器执行,根除大模型自回归算术进位幻觉。
  • 公式:—
  • 前端类比:像前端不再用字符串正则手动拼接数学公式,而是直接调用成熟的 BigInt / math.js 引擎运算。
  • 代码定位:docs/chapters/17-prompt-memory.md

自洽性解码 Self-Consistency ​

  • 英文:Self-Consistency Decoding
  • 章节:第17章
  • 定义:推理期通过非零温度(T>0)独立采样多条思考链,并对所有路径的最终答案执行多数票决以消除单点局部贪婪偏差的解码策略。
  • 公式:y^=arg⁡maxa∑i=1KI(ExtractAnswer(y(i))=a)
  • 前端类比:像分布式系统中的 Raft 多数派投票,单节点抖动不影响集群最终决议一致性。
  • 代码定位:docs/chapters/17-prompt-memory.md

十四、推理时扩展与多模态(L1 动机级词条) ​

本组词条覆盖书单对照中确认的外围主题:本课范围限定为 decoder-only 文本链路,未为它们设置教学章,这里只做动机级名词对照。

推理时扩展 ​

  • 英文:test-time / inference-time scaling
  • 章节:第12章(maj@64 即其一例)
  • 定义:不改权重、用调用时算力换正确率的路线:同一问题重复采样后多数投票(self-consistency 自洽性采样)、更长的思维链、搜索式解码都属于此类。与训练时 RL(GRPO)正交——前者按调用计费,后者把"多想几步"固化进权重。
  • 公式:y^=mode{y(1),…,y(k)}(self-consistency 多数投票)
  • 前端类比:像用多次重试加多数表决替代单次请求——不加服务器规格,只多花调用次数。
  • 代码定位:—(本课边界:L1 动机级;概念框定见 第12章)

VLM / 多模态 ​

  • 英文:vision-language model / multimodal LLM
  • 章节:—(本课未设专题)
  • 定义:把图像等模态经编码器映射为与文本 token 同层的输入表示,在同一 Transformer 主干上继续自回归建模。本课范围限定为 decoder-only 文本链路,多模态只在此做名词级对照。
  • 公式:—
  • 前端类比:像把非 JSON 载荷先过一层适配器转成统一 schema,再进同一套状态机。
  • 代码定位:—

十五、强化学习基础(第11章, 第12章 与 RL 基础参考页) ​

本组词条配合第11/12章新增的 RL 理论小节与 RL 基础参考页:正文推导见对应锚点,表格实现在 python/llm_core/rl_basics.py。

k 臂老虎机 k-armed bandit ​

  • 英文:k-armed bandit
  • 章节:RL 基础参考页(阶段 0),第11章(terminal-only 奖励记账的 bandit 视角)
  • 定义:MDP 的单状态退化情形——只有一个状态、k 个动作、每个动作吐出一个奖励样本,没有「下一步到了哪」。估计、探索、利用这些核心难题在这里以最裸形态出现,还不背转移概率的包袱;给每个状态配上它自己的一组老虎机就回到完整 MDP。状态由 prompt 给出的变体是 contextual bandit(上下文老虎机)——第11章「中间步奖励为 0、序列结束记一个标量」的生成设定正是它的对号入座。
  • 公式:q∗(a)=E[Rt∣At=a]
  • 前端类比:像 k 个候选方案各挂一个未知转化率的 A/B 测试——每次流量分配就是拉一次杆;contextual 版是按用户特征换一组候选。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

探索-利用困境 exploration-exploitation tradeoff ​

  • 英文:exploration-exploitation tradeoff
  • 章节:RL 基础参考页(阶段 0)
  • 定义:只按当前估计选最优(利用)可能永远锁死在「看起来最好、实际次优」的动作上;转去试其他动作(探索)又把预算撒进当前估计偏弱的选项。这个两难没有根治、只有定价——ε-greedy、乐观初值、UCB 是三种给探索定价的方式;第11章 RLVR 辩论里「采样多样性被压缩」是它在 LLM 语境下的回声。
  • 公式:—
  • 前端类比:像首页推荐在「推已知高点击内容」与「留位试探新内容」之间做预算分配——全给前者会困在信息茧房,全给后者浪费流量。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

ε-greedy ​

  • 英文:epsilon-greedy
  • 章节:RL 基础参考页(阶段 0)
  • 定义:最便宜的探索定价:以概率 1−ε 贪心选 arg⁡maxaQt(a),以概率 ε 在全部 k 个动作里等概率随机选。ε 是探索量旋钮——调小平均回报趋稳但可能困在次优,调大找好动作更快但持续付学费。只要 ε>0,每个动作终将被无限次尝试,估计随之收敛——探索不只碰运气,它在把估计本身修对。
  • 公式:At=arg⁡maxaQt(a) w.p. 1−ε;均匀随机 w.p. ε
  • 前端类比:像灰度发布永远留一小部分流量随机试新版本——大部分流量给当前最优,小部分持续喂给「还没试过的」。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

置信上界 upper confidence bound (UCB) ​

  • 英文:upper confidence bound
  • 章节:RL 基础参考页(阶段 0)
  • 定义:按不确定性下注的探索:给「被试得少、还没把握」的动作发加成,估计分加加成分,谁高选谁;被选次数 Nt(a) 待在分母上,加成随尝试衰减,ln⁡t 的慢增长保证长期看每个动作终将被尝试。对比 ε-greedy 的盲目随机,UCB 的探索有明确方向——「还欠了解」的地方。
  • 公式:At=arg⁡maxa[Qt(a)+cln⁡tNt(a)]
  • 前端类比:像给新上线、数据少的方案保底权重——置信不足的先多分流量,数据攒够后自然回落到真实表现。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

乐观初值 optimistic initial values ​

  • 英文:optimistic initial values
  • 章节:RL 基础参考页(阶段 0)
  • 定义:用初值垫出探索:把 Q1 设成显著高于一切真实均值的数,贪心规则自动变成探索机器——被试过的机器第一次真实奖励几乎必然低于初值、估计随之下跌,未试过的还挂在高位,贪心总会先去「还没让我失望过」的那台。局限是只解决「开头」:探索量由初值一次性预付、不随反馈调节,非平稳世界里很快耗尽。
  • 公式:Q1(a)≫maxaq∗(a)
  • 前端类比:像新组件默认排在推荐位顶部——「还没让人失望过」的先得到曝光,试过之后按真实表现排位。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

非平稳问题 nonstationary problem ​

  • 英文:nonstationary problem
  • 章节:RL 基础参考页(阶段 0)
  • 定义:真实均值会漂移的世界(机器被人调过)。样本均值的 1/n 步长隐含「q∗ 不变」假设——新奖励权重越来越小,估计停在旧平均上不肯更新。修法是常量步长 α:指数加权的滑动平均,越近的样本权重越大;代价是估计不再收敛到定值、永远带一点抖动。TD 更新继承的正是常量 α 这一支。
  • 公式:Qn+1=Qn+α(Rn−Qn)
  • 前端类比:像监控指标用滑动窗口而非全历史均值——最近的样本权重更大,世界变了估计跟着变,代价是读数永远轻微抖动。
  • 代码定位:—(本课边界:概念级,不实现;见 RL 基础参考页 阶段 0)

价值迭代 value iteration ​

  • 英文:value iteration
  • 章节:第11章(延伸),RL 基础参考页
  • 定义:对最优 Bellman 算子做不动点迭代 Vk+1=B⋆Vk;γ∈(0,1) 时算子是压缩映射,收敛有几何速率保证,γ=1 时压缩性消失(正奖励环下发散)。与策略迭代(精确评估 + 贪心改进)互为两个"概念框架",分别孕育 Q-learning/DQN 与 TRPO/PPO 两族。
  • 公式:Vk+1(s)=maxa E[r+γVk(s′)∣s,a]
  • 前端类比:像动态规划表自底向上填表——每格只依赖下一轮已填好的值并取最优动作,相邻两轮不再变化即收敛。
  • 代码定位:python/llm_core/rl_basics.py(value_iteration,与线性代数精确解 policy_evaluation_exact 对拍);clean-room 第 9 模块 clean_room/tabular_rl.py(空接口,参考实现 python/llm_core/tabular_rl_ref.py);推导见 RL 基础参考页

Bellman 最优性算子 ​

  • 英文:Bellman optimality operator
  • 章节:第11章(延伸),RL 基础参考页
  • 定义:把 Bellman 期望算子里"对策略取期望"换成"对动作取 max"得到的 B⋆。证明分两段:压缩映射给出不动点存在唯一(此时还不知道它是不是最优),单调保序再夹逼出 Vπ≤V⋆——"存在唯一"与"恰为最优"分开证明,不倒果为因。
  • 公式:(B⋆V)(s)=maxa E[r+γV(s′)∣s,a]
  • 前端类比:像每轮对全表做一次 reduce 取 max 的折叠——输入是上一轮所有状态值,输出是每格在最优动作下的期望。
  • 代码定位:python/llm_core/rl_basics.py(value_iteration 内的同步算子应用);完整推导见 RL 基础参考页

半梯度 semi-gradient ​

  • 英文:semi-gradient methods
  • 章节:第11章(actor-critic 谱系)
  • 定义:TD + 近似 SGD 的组合:对 TD 目标里的 Vϕ(s′) 做 stop-gradient(PyTorch .detach())当常数,只对当前状态价值求梯度。可证明不是任何目标函数的梯度下降,实证上却常优于"理论纯洁"的梯度 TD(GTD)——理论标签与工程选边分开保留。
  • 公式:ℓ(ϕ)=12(r+γsg[Vϕ(s′)]−Vϕ(s))2
  • 前端类比:像把输入状态打成只读快照再更新——防止派生计算反向污染它自己引用的源数据。
  • 代码定位:第11章诚实注脚;谱系背景见 RL 基础参考页

策略优势 policy advantage ​

  • 英文:policy advantage
  • 章节:第11章(第二视角:策略优势与近似策略迭代)
  • 定义:策略 π 相对基准 πk 的优势:沿 πk 的状态分布、对 π 提案的动作取 πk 优势的平均。最大化它等价于策略迭代的改进步;直接跳到最优做不到(重要性采样权重方差失控),于是把搜索限制在 πk 附近——信任域的第二条推导路径。
  • 公式:J(π)−J(πk)=11−γAπk(π)
  • 前端类比:像灰度发布前只评估"候选版本相对当前版本的增量收益"——不打绝对分,只问换成它会好多少。
  • 代码定位:第11章 #policy-advantage 小节(本课边界:不实现 TRPO/PPO)

expert iteration 专家迭代 ​

  • 英文:expert iteration
  • 章节:第11章(STaR 与 expert iteration),第12章
  • 定义:Mn→搜索增强Mn+→模仿 Mn+Mn+1 的循环:用"网络 + 搜索"构造更强教师、再让下一代模仿增强后的自己;可视为模仿学习与策略迭代的双重推广。R1 阶段三(拒绝采样 + SFT)是其工业版实例。
  • 公式:Mn→Mn+→Mn+1
  • 前端类比:像每轮把"lint 自动修复后的代码"当作下一轮评审基线——工具增强人,下一代以增强结果为师。
  • 代码定位:第11章 #star-expert-iteration;AlphaGo 侧叙事见 RL 基础参考页

STaR ​

  • 英文:Self-Taught Reasoner
  • 章节:第11章(STaR 与 expert iteration)
  • 定义:不用策略梯度学出 CoT 推理的三步循环:rationale generation(只保留终答正确的轨迹)、rationalization(给答错的题喂正确答案提示补出解释、再去提示当作自己想出来的数据)、迭代。RLVR 与 expert iteration 两条线在 R1 流程中合流。
  • 公式:—
  • 前端类比:像只回放跑通 e2e 的提交记录来学习;跑不通的用例先看答案提示补一版,再脱敏入库。
  • 代码定位:—(本课边界:L1 动机级,不实现;见 第11章)

Best-of-N ​

  • 英文:Best-of-N sampling
  • 章节:第11章
  • 定义:reward model 的第零种用法:同一 prompt 独立采样 N 个回答、RM 逐个打分取最高,不动任何权重。它是所有"用 RM 做 RL"方案应先报告的免训练 baseline——若训练后的策略打不过"采 N 次挑最好",训练环节就没有净收益;本身也是 test-time scaling 的一种。
  • 公式:y⋆=arg⁡maxi∈1..N rψ(yi)
  • 前端类比:像 N 个候补实现各跑一遍基准测试取最快的一个——不改代码,只多花运行时间。
  • 代码定位:—(本课边界:概念级,不实现;见 第11章 Best-of-N 小节)

budget forcing ​

  • 英文:budget forcing
  • 章节:第12章
  • 定义:s1 系模型展示的推理时旋钮:调低——生成中途强行插入 "Final Answer:" 前缀逼模型立刻收尾;调高——删掉已写答案、在答案前插入 "Wait" 诱导继续推敲。把"思考长度"从权重里的隐式行为变成推理引擎的显式接口,测试时算力成为连续可调参数。
  • 公式:—
  • 前端类比:像可双向调节的 timeout——既能提前掐断长任务,也能撤销完成态让它继续跑。
  • 代码定位:—(本课边界:L1 动机级,不实现;见 第12章 TTC 小节)

over-optimization(过度优化) ​

  • 英文:over-optimization / reward hacking
  • 章节:第11章
  • 定义:奖励信号(RM 分数)被策略过度利用后与真实目标脱钩(Goodhart 定律):堆砌讨好话术换高分、输出分布坍缩到窄模式。KL 惩罚的辩护之一是把策略锁在 RM 训练分布的可信域内;PPO-PTX 预训练损失混训是同一退化方向上的另一道保险。
  • 公式:—
  • 前端类比:像只面向 Lighthouse 分数做优化——指标涨了,真实体验反而劣化。
  • 代码定位:第11章(KL 惩罚与蛇赏金案例;DPO 陷阱小节)

长度偏置 length bias ​

  • 英文:length bias
  • 章节:第11章,第12章(GRPO 的偏置与修正)
  • 定义:偏好/推理优化里反复出现的偏置源,两处机理相反:DPO 用未归一化对数似然求和,chosen 越长 margin 越易累积("越长越好");GRPO 逐 token 损失除以回答长度,答错时惩罚被摊薄("答错时越长越安全")。方向相反、殊途同归地奖励冗长;Dr. GRPO 的修正入口。
  • 公式:—
  • 前端类比:像两套各有缺陷的计分板:一套总分随行数累加、一套人均分随人数稀释——都让"写得长"占便宜。
  • 代码定位:第11章(DPO 长度偏置小节)、第12章 #grpo-bias

十六、序列建模前史(前史参考页) ​

本组词条配合序列建模前史参考页——22 章主线「跳过 RNN 前置」声明所指向的补全页;正文推导见对应锚点,实验为页内 numpy 三级阶梯(不入 clean_room/ 合同)。

Elman RNN ​

  • 英文:Elman recurrent neural network / simple RNN
  • 章节:前史参考页(承接 第5章 固定窗口 MLP 的断点)
  • 定义:权重跨时间共享的循环单元:隐藏状态是全部历史输入的有损压缩摘要。三步构造(零填充 → 逐层处理 → 权重共享)的终点;参数量与序列长度解耦的代价是计算沿时间串行、梯度沿时间连乘——BPTT 两种病根的来源。
  • 公式:a⟨t⟩=g1(Waaa⟨t−1⟩+Waxx⟨t⟩+ba)
  • 前端类比:像用一帧固定 buffer 滚动渲染长列表——内存不涨,但要看第 1 项必须等前面全部滚完。
  • 代码定位:前史参考页 · 循环结构的构造路径

LSTM ​

  • 英文:long short-term memory
  • 章节:前史参考页
  • 定义:门控细胞(input/forget/output 三门)把朴素 RNN「几个 token 就忘」的短期记忆拉长到几百步。名字的正确读法是「更长的短期记忆」(long short-term memory),不是长期 + 短期两套存储;真正的长期记忆是外部存储,循环网络内部没有这个部件。cell 更新是门控加法,权重矩阵从梯度路径上消失——与残差连接是同一设计思想的两代实现。
  • 公式:c⟨t⟩=Γu⊙c~⟨t⟩+Γf⊙c⟨t−1⟩
  • 前端类比:像带阀门的水箱——写入多少新水、保留多少旧水各有开关,水位(cell 状态)可长期线性累积以计数、计时。
  • 代码定位:前史参考页 · LSTM 与 GRU

GRU ​

  • 英文:gated recurrent unit
  • 章节:前史参考页
  • 定义:LSTM 的轻量对照版:一个状态、两扇门(update/relevance),记住新信息的比例与遗忘旧信息的比例强制互补。砍掉一个状态和一扇门仍然工作得差不多好,反证 LSTM 的部分组件是冗余的。
  • 公式:c⟨t⟩=Γu⊙c~⟨t⟩+(1−Γu)⊙c⟨t−1⟩
  • 前端类比:像只有一根总开关的双向滑块——开多少新的就同步关多少旧的,一个控件管两件事。
  • 代码定位:前史参考页 · LSTM 与 GRU

word2vec ​

  • 英文:word2vec (CBOW / Skip-gram)
  • 章节:前史参考页(词向量节),第5章 / 第8章(embedding 查表的血缘)
  • 定义:静态分布语义的奠基方法:用无标注语料与极简目标(CBOW 用上下文预测中心词、Skip-gram 用中心词预测窗口内上下文)学出带语义几何的静态词向量——one-hot 没有语义几何(任意两向量正交),分布假设「一个词的语义由它出现的上下文刻画」让上下文分布相近的词向量也相近。一词一向量意味着多义无解,修补谱系是 ELMo(双向 LSTM 现场计算)到 Transformer 自注意力的「从查表到计算」。
  • 公式:P(o∣c)=exp⁡(uo⊤vc)∑w∈Vexp⁡(uw⊤vc)(窗口 ≈5--10,d≈300)
  • 前端类比:像把 i18n 字典从「ID 对照表」升级为「语义坐标系」——king − man + woman ≈ queen 的类比算术说明语义关系被编码成空间平移方向。
  • 代码定位:—(本课不训练 word2vec;第5章 embedding 表跟着语言模型目标顺带学出,讲解见 前史参考页 · 词向量)

负采样 negative sampling ​

  • 英文:negative sampling
  • 章节:前史参考页(词向量节)
  • 定义:全词表 softmax 的逃逸:把多分类退化成 k+1 个二分类——真实对 (c,o) 是正样本,从噪声分布(unigram 词频的 0.75 次幂)采 k 个负词各配成负样本对;目标第一项把正对的内积拉近、第二项把负对推远。「正对拉近、负对推远」的目标形状是对比学习的原型,理论近亲是 NCE。
  • 公式:maxθlog⁡σ(uo⊤vc)+∑i=1kEwi∼Pn[log⁡σ(−uwi⊤vc)],k≈5--20
  • 前端类比:像推荐系统正负样本配对训练——不必对全量物品做 softmax,只拿几个负例学会「区分」。
  • 代码定位:—(本课不训练 word2vec;讲解见 前史参考页 · 词向量)

seq2seq ​

  • 英文:sequence-to-sequence / encoder-decoder
  • 章节:前史参考页
  • 定义:编码器 RNN 读完源句、把末状态交给解码器自回归生成的两段式架构;无论源句多长,全部语义必须流经一个定长向量——固定向量信息瓶颈正是注意力机制的诞生动机,这个形状也一路演化成第8章的 encoder-decoder Transformer。
  • 公式:y=arg⁡maxyP(y∣x)
  • 前端类比:像把整份需求文档只靠口头转述交给另一位工程师——转述者的记忆容量固定,文档一长必然丢信息。
  • 代码定位:前史参考页 · seq2seq 与固定向量瓶颈
  • 英文:beam search
  • 章节:前史参考页
  • 定义:搜索侧的确定性解码:每步保留累计得分最高的 B 个部分候选继续扩展(B=1 退化为贪心);累加得分须做长度归一化,否则对数概率每项为负、系统性偏爱短输出。与 temperature/top-k/top-p 互补——那是采样侧的随机化,这是搜索侧的确定性解码,同一自回归分布的两种取用方式。
  • 公式:Objective=1Tyα∑tlog⁡p(y⟨t⟩∣x,y<t)
  • 前端类比:像路由规划同步扩展 k 条候选路径——每步只留 top-k,最后取总分最高的一条。
  • 代码定位:前史参考页 · seq2seq 与固定向量瓶颈

BLEU ​

  • 英文:BLEU (bilingual evaluation understudy)
  • 章节:前史参考页
  • 定义:机器翻译质量的外部度量:候选译文对参考译文的 clipped n-gram 精确率(匹配数封顶在参考中出现次数,防重复词刷分)取几何平均,短译文另加 brevity penalty。它只数表面 n-gram 重合、看不见同义改写;与困惑度分工——后者评估语言模型本身赋概率的能力。本课不做机器翻译,认识这一定位即可。
  • 公式:BLEU=exp⁡(1n∑k=1npk)
  • 前端类比:像按关键词重合度给两篇摘要打分——换成同义说法表达同样的意思会被判低分。
  • 代码定位:前史参考页 · seq2seq 与固定向量瓶颈

Bahdanau attention ​

  • 英文:additive attention / Bahdanau attention
  • 章节:前史参考页(第8章 缩放点积的前身)
  • 定义:拆除 seq2seq 固定向量瓶颈的补丁:解码器每步对编码器全部时间步的状态做 softmax 软选择,得到该步专属的上下文向量。打分函数是加性的,第8章的缩放点积是它的矩阵化替身;计算量对源句长二次——第10章 KV Cache 工程摊销的正是这笔账。
  • 公式:c⟨t⟩=∑t′α⟨t,t′⟩ht′,权重 α 由加性打分经 softmax 归一
  • 前端类比:像翻译时给原句每个词挂一盏可调亮度的聚光灯——译到哪里灯光就聚焦到哪里,不再依赖一句「全文摘要」。
  • 代码定位:前史参考页 · seq2seq 与固定向量瓶颈

Radix Cache / 基数前缀树 ​

  • 英文:Radix Cache
  • 章节:第10章
  • 定义:基于紧凑前缀树(Radix Trie)管理大模型 KV Cache 显存块的数据结构,支持跨请求最长前缀匹配(LPM)、边分裂(Split)与基于引用计数的树形 LRU 淘汰。
  • 公式:Match(tokens)=LPM(RadixTree)
  • 前端类比:像路由框架中的前缀匹配路由树(Trie Router),共享公共根路径。
  • 代码定位:python/llm_core/radix_cache.py

多级缓存收益不等式 / Tiered Cache Inequality ​

  • 英文:Tiered Cache Inequality
  • 章节:第10章
  • 定义:从次级存储介质(如 Host RAM / SSD / RDMA 存储)加载 KV Cache 比当前 GPU 重新 Prefill 更快的充要条件,表明收益临界点与匹配长度无关。
  • 公式:Tprefill×Skv<Btransfer⟺Tprefill<BtransferSkv
  • 前端类比:像从 ServiceWorker 缓存读静态资源 vs 走网络 CDN 重新请求的延迟临界判定。
  • 代码定位:python/llm_core/tiered_cache_model.py

滑动窗口注意力 SWA ​

  • 英文:Sliding Window Attention (SWA)
  • 章节:第8章, 第10章
  • 定义:每个 Token 仅与最近的 W 个 Token 计算注意力的局部稀疏机制。多层堆叠后顶层理论感受野以 L×W 线性扩展,同时将单请求 KV 显存与跨机传输硬性锁死在 O(W)。
  • 公式:Receptive Field=L×W,KV Memory Cap=O(W)
  • 前端类比:像前端虚拟列表仅在可视窗口内渲染 DOM 节点,无论数据总量多大,内存开销恒定。
  • 代码定位:docs/chapters/08-attention.md

专家并行 EP ​

  • 英文:Expert Parallelism (EP)
  • 章节:第12章
  • 定义:在 MoE 架构中将不同的专家网络切分分布到集群多张 GPU 上,Token 经 Router 打分后通过两次 All-to-All 集合通信分别进行 Dispatch 分发与 Combine 结果收集。
  • 公式:EP=DP×TP,Communication=2×All-to-All
  • 前端类比:像微服务集群中网关将不同业务事件 RPC 路由到专门的微服务节点处理再聚合响应。
  • 代码定位:docs/chapters/12-deepseek.md

PD 分离 / Prefill-Decode Disaggregation ​

  • 英文:Prefill-Decode Disaggregation
  • 章节:第10章
  • 定义:将大模型推理集群按硬件特性解耦为算力专精的 P-Worker 池(跑 Compute-bound 的 Prefill)与显存带宽专精的 D-Worker 池(跑 Memory-bound 的 Decode),两者间通过高速 RDMA 传输 KV Cache。
  • 公式:Pipeline:P-Worker→RDMA KV TransitD-Worker
  • 前端类比:像将高算力耗时的图像编译打包任务交给服务端 Worker,而轻量渲染与交互留在浏览器端。
  • 代码定位:python/labs/pd_disaggregation_sim.py

CodeAct 范式 / Code as Action ​

  • 英文:CodeAct (Code as Action)
  • 章节:第15章
  • 定义:智能体(如 Manus、Devin)直接编写与执行可执行 Python 代码与环境交互的范式,彻底替代传统刚性 JSON Tool Call,提供原生动态控制流(循环/分支)并避免中间海量数据直接冲垮上下文。
  • 公式:Action=ExecuteCode(PythonSnippet,Sandbox)
  • 前端类比:像前端不再为每个按钮配置一个死板的声明式表单,而是提供一个轻量 JS 脚本沙盒直接调用 SDK 执行流转。
  • 代码定位:python/agent_core/codeact_sandbox_runner.py

长程上下文修剪 / Long-Horizon Context Pruning ​

  • 英文:Long-Horizon Context Pruning & Compaction
  • 章节:第15章
  • 定义:在 50+ 步长程多步工程任务中,保留全局规划拓扑与文件树状态,但对远期历史执行步骤的冗长 raw stdout 进行结构化折叠,确保 Prompt 稳定在固定上下文预算内。
  • 公式:Prune(History)=ActiveRecentSteps∪Fold(ArchivedSteps)
  • 前端类比:像前端虚拟滚动的 DOM 回收机制或长日志控制台的“折叠已完成历史输出”。
  • 代码定位:python/agent_core/codeact_sandbox_runner.py

投机采样解码 / Speculative Decoding ​

  • 英文:Speculative Decoding
  • 章节:第10章
  • 定义:利用小 Draft 模型快速自回归采样 K 个草稿 Token,再由大 Target 模型通过一次计算密集型(Compute-bound)矩阵乘并行验证,依据拒绝采样准则无损输出,大幅突破逐 Token 解码的显存带宽瓶颈。
  • 公式:Paccept=min(1,Ptarget(x)Pdraft(x)),E[Speedup]=1−αK+1(1−α)(1+K⋅c)
  • 前端类比:像浏览器的预测性预渲染(Speculative Pre-rendering)与资源预取,提前准备候选资源,主线程一次性命中直接使用。
  • 代码定位:python/llm_core/speculative_decoding.py

分块预填充 / Chunked Prefill ​

  • 英文:Chunked Prefill
  • 章节:第10章
  • 定义:将超长 Prompt 切割为固定大小的 Chunk,并在推理引擎调度器中与 Decode 请求混编在同一 Batch 内并行执行(Piggybacking),平抑首字延迟(TTFT)与每字耗时(TPOT)抖动。
  • 公式:Batch={PrefillChunki}∪{DecodeRequestj}
  • 前端类比:像操作系统基于时间片的时间轮调度,防止长任务独占 CPU 导致交互任务假死。
  • 代码定位:python/llm_core/kv_cache.py

测试时计算扩展 / Test-Time Compute (TTC) ​

  • 英文:Test-Time Compute Scaling (TTC)
  • 章节:第12章
  • 定义:以 OpenAI o1/o3 与 DeepSeek R1 为代表的推理 Scaling 范式:在模型参数固定的前提下,通过赋予模型更多的测试时思考 Token(Thinking Tokens)与推理空间搜索,换取对复杂问题更强的准确率与逻辑自校正。
  • 公式:Accuracy∝f(Nthinking tokens,SearchBudget)
  • 前端类比:像离线复杂计算中,通过将算法从单次贪心搜索改为多路并行 Web Worker 搜索与启发式评估。
  • 代码定位:python/llm_core/test_time_compute.py

过程奖励模型 / Process Reward Model (PRM) ​

  • 英文:Process Reward Model (PRM)
  • 章节:第12章
  • 定义:对多步思维链中的每一个中间推理步骤给出正确性置信度打分的验证网络,突破结果奖励模型(ORM)因奖励稀疏导致信用分配(Credit Assignment)困难的瓶颈,驱动搜索树早期剪枝。
  • 公式:rstep=PRM(stept∣context)
  • 前端类比:像表单多步骤校验(Step-by-step Validation),每一步实时校验,而非等用户填完全部页面提交后才报第一个字段有错。
  • 代码定位:python/llm_core/test_time_compute.py

相关页面 ​

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥