Appearance
必读论文索引 — 58 条 + 4 条课程级引用 + 选读
这一页只把论文当作「问题定义、接口与设计背景」的对照表。所有结论都必须由本仓库的测试、fixture 和交互来证明,论文本身不能充当 evidence。论文正文、图片、表格与权重一律不在本仓库内复制;本课对每篇论文只用一段话讲清「动机 / 接口 / 取舍」,并在指定章节落地最小实验。任何对外复制行为都需要新增 source record 并走人工发布决定。
阅读口径:
- 动机:作者用一两句话把什么问题换成可优化的形式。
- 接口:本课在哪一章只复用了哪一个函数签名或公式形态。
- 取舍:作者主动放弃了什么,本课相应地不覆盖什么。
- 未解决:作者明确留给后人继续做、但本课也尚未完成的部分。
每篇论文条目结构固定,包含作者、年份、arXiv 链接、对应章节、本课使用方式、本地绑定锚点。
第4章 自动微分与计算图
Learning representations by back-propagating errors
- 作者:Rumelhart、Hinton、Williams
- 年份:1986
- arXiv:无(原刊于 Nature 323,本课改用 Karpathy 的 backprop 导读 作为可公开访问的等价讲解)
- 章节:第4章
- 本课使用方式:把反向传播理解为「局部导数 + 链式法则 + 逆拓扑序累加」,作为
clean_room/autograd.py中Value.backward()的唯一实现契约。我们不复现论文原始的多层感知机基准实验,正确性由python/tests/test_autograd.py的有限差分对拍与共享子表达式梯度累加测试提供。 - 本地绑定:
evidence/source-readback-official-v1.json
第5章–第8章 语言模型、分词与 Transformer
A Neural Probabilistic Language Model
- 作者:Bengio 等
- 年份:2003
- 链接:JMLR 原文
- 章节:第5章
- 本课使用方式:用连续稠密低维词嵌入(Embedding)替代离散 Bigram 计数表,解决上下文增长时的
维度灾难,并实现语义相近词汇(如“猫”与“狗”)的自动泛化。 - 本地绑定:
evidence/source-readback-official-v1.json
Attention Is All You Need
- 作者:Vaswani 等
- 年份:2017
- arXiv:1706.03762
- 章节:第8章
- 本课使用方式:把 Transformer 的「Q/K/V 多头缩放点积 + 残差 + 前馈」当成本课 attention 与 MLP 块的接口约定。我们只复现数学形态与张量形状,不复现论文中的并行训练栈、label smoothing 调参和原始 WMT 基准;训练证据由
python/tests/test_attention_gpt.py与本地小语料提供。 - 本地绑定:
evidence/source-readback-official-v1.json记录只读锚点与许可事实
Layer Normalization
- 作者:Ba、Kiros、Hinton
- 年份:2016
- arXiv:1607.06450
- 章节:第7章
- 本课使用方式:在 LayerNorm 实现里沿用论文的「按特征维度归一 + 可学 γ/β」接口,作为 第7章 训练稳定性的最小工程基线。我们不引入 batch 维度的统计量(不实现 BatchNorm),也不讨论 reparameterization 技巧,所有验证通过本地 toy batch 上的均值为 0、方差为 1 检查完成。
- 本地绑定:
evidence/source-readback-official-v1.json
Root Mean Square Layer Normalization / RMSNorm
- 作者:Zhang、Sennrich
- 年份:2019
- arXiv:1910.07467
- 章节:第7章 / 第10章
- 本课使用方式:第7章 作为 LayerNorm 的「去均值 + 只用 RMS 缩放」对照实现,给出参数更少、形状一致的等价层;第10章 把它当作现代推理栈里常见的默认归一化形式之一,与 RoPE、GQA 并列说明。我们不复刻论文里跨模型族的迁移实验,也不替代 第7章 的 LayerNorm 作为唯一选择。
- 本地绑定:
evidence/source-readback-official-v1.json
Neural Machine Translation of Rare Words with Subword Units / BPE
- 作者:Sennrich、Haddow、Birch
- 年份:2016
- arXiv:1508.07909
- 章节:第6章
- 本课使用方式:第6章 tokenizer 实现沿用论文的「字节对合并 + 频次驱动」基本步骤,把 tokenization 抽象成
encode/decode两条主路径,并保证训练集与模型词表不依赖外部模型权重。我们不实现 backoff 规则与单语/双语扩展实验,验证由python/tests/test_bpe.py完成。 - 本地绑定:
evidence/source-readback-official-v1.json
Language Models are Few-Shot Learners / GPT-3
- 作者:Brown 等
- 年份:2020
- arXiv:2005.14165
- 章节:第5章 / 第9章
- 本课使用方式:第5章 用一句话讲清「in-context learning 是规模效应而非新结构」,避免把上下文示例当成训练样本;第9章 在缩放法则讨论中把 GPT-3 视为「规模化收益被 Chinchilla 修正」的基线参考。我们不下载、不引用具体权重,所有数字只用作论文比较。
- 本地绑定:
evidence/source-readback-official-v1.json
第7章–第9章 优化器与预训练
Decoupled Weight Decay Regularization / AdamW
- 作者:Loshchilov、Hutter
- 年份:2019
- arXiv:1711.05101
- 章节:第7章
- 本课使用方式:在 第7章 优化器实验里把权重衰减从梯度项剥离到参数项,作为与 Adam 等价的 baseline。我们不复刻原论文的 CIFAR/ImageNet 实验,仅比较损失下降轨迹与 lr/λ 网格,验证由本地曲线完成。
- 本地绑定:
evidence/source-readback-official-v1.json
Scaling Laws for Neural Language Models
- 作者:Kaplan 等
- 年份:2020
- arXiv:2001.08361
- 章节:第9章
- 本课使用方式:第9章 用论文的幂律形式说明「参数 / 数据 / 算力」三者之间的可换算关系,提醒读者「只放大参数」不会免费带来收益。我们不拟合真实模型的缩放曲线,所有数字只用于讲清动机。
- 本地绑定:
evidence/source-readback-official-v1.json
Training Compute-Optimal Large Language Models / Chinchilla
- 作者:Hoffmann 等
- 年份:2022
- arXiv:2203.15556
- 章节:第9章
- 本课使用方式:作为对 Kaplan 缩放法则的修正引入,强调在给定算力预算下「模型大小与训练 token 数应同步缩放」。本课不进行实际的算力分配决策,只把 Chinchilla 比例当作训练清单中一个需要人工校准的约束。
- 本地绑定:
evidence/source-readback-official-v1.json
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- 作者:Shoeybi 等
- 年份:2019
- arXiv:1909.08053
- 章节:第9章 / 分布式训练收拢地图
- 本课使用方式:张量并行(把单个矩阵乘按行/列切到多卡、机内 NVLink 上极高频 All-Reduce)的代表实现;收拢地图第二节以它为参照解释「通信频率决定物理位置」——TP 只能待在机内、PP 可跨机的取舍。本课不实现模型并行,边界见 生态边界页。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models
- 作者:Rajbhandari、Rasley、Ruwase、He
- 年份:2019
- arXiv:1910.02054
- 章节:第9章 / 分布式训练收拢地图
- 本课使用方式:三阶段状态分片(ZeRO-1 切优化器状态、ZeRO-2 再切梯度、ZeRO-3 全切即 FSDP)与「通信换内存」取舍的原始出处;收拢地图第三节据此对每卡静态显存做
的记账。本课不实现 ZeRO/DeepSpeed。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
第10章 推理与效率
RoFormer: Enhanced Transformer with Rotary Position Embedding
- 作者:Su 等
- 年份:2021
- arXiv:2104.09864
- 章节:第10章
- 本课使用方式:把 RoPE 当作相对位置编码的一种工程选择,用「在 Q/K 上做复数旋转」来解释远程依赖的衰减。我们不在长上下文上验证外推性能,所有边界以本仓库窗口长度为准。
- 本地绑定:
evidence/source-readback-official-v1.json
GQA: Training Generalized Multi-Query Transformer Layers
- 作者:Ainslie 等
- 年份:2023
- arXiv:2305.13245
- 章节:第10章
- 本课使用方式:把 MQA/MHA/GQA 当作「KV 头数与推理显存」之间的可调档位,仅在结构层提供占位接口。我们不训练 GQA checkpoint,也不复刻论文中 grouped-query 的蒸馏流程。
- 本地绑定:
evidence/source-readback-official-v1.json
FlashAttention
- 作者:Dao 等
- 年份:2022
- arXiv:2205.14135
- 章节:第10章
- 本课使用方式:用「按块计算 + 不物化完整注意力矩阵」的思路解释 IO-aware attention 的动机,作为本课 attention 复杂度讨论的对照。我们不接入 CUDA 核,所有讨论停留在算法层。
- 本地绑定:
evidence/source-readback-official-v1.json
GLU Variants Improve Transformer / SwiGLU
- 作者:Shazeer
- 年份:2020
- arXiv:2002.05202
- 章节:第10章
- 本课使用方式:把 SwiGLU 当作「门控线性单元替换 FFN 激活」的接口形态,第10章 手写
并做 shape 对拍。论文的多变体消融(GEGLU/SwiGLU 等)不复刻,只取「门控提升表达力」的动机与隐藏维 换算的取舍说明。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Efficient Memory Management for LLM Serving with PagedAttention / vLLM
- 作者:Kwon 等
- 年份:2023
- arXiv:2309.06180
- 章节:第10章
- 本课使用方式:把 vLLM 的「按页管理 KV 缓存 + 逻辑/物理块分离」作为推理显存设计模式的样例,提醒在分配器设计中避免 O(n²) 碎片。本课不部署 vLLM,所有结论只来自论文本身。
- 本地绑定:
evidence/source-readback-official-v1.json
第11章 后训练与偏好对齐
LoRA: Low-Rank Adaptation of Large Language Models
- 作者:Hu 等
- 年份:2021
- arXiv:2106.09685
- 章节:第11章
- 本课使用方式:第11章 把 LoRA 当成「冻结主权重 + 注入低秩 ΔW」的最小工程范式,解释适配成本与可合并性。本课只跑
LoRAAdapter/LoRABigramPolicy的 toy 更新与 merge 对拍,不训练工业规模适配器,也不复刻论文中多任务合并实验。 - 本地绑定:
evidence/source-readback-official-v1.json
Direct Preference Optimization / DPO
- 作者:Rafailov 等
- 年份:2023
- arXiv:2305.18290
- 章节:第11章
- 本课使用方式:把 DPO 当作「跳过显式奖励模型、直接用偏好对优化」的工程替代方案。本课只跑极小 preference fixture 上的
dpo_batch_loss与 chosen/rejected 符号对拍,不训练工业 DPO,也不用口述代替那条 toy 命令。 - 本地绑定:
evidence/source-readback-official-v1.json
Training language models to follow instructions with human feedback / InstructGPT
- 作者:Ouyang 等
- 年份:2022
- arXiv:2203.02155
- 章节:第11章
- 本课使用方式:作为三阶段流程(SFT → RM → RLHF)的工程模板,解释「为什么需要人在回路」以及「为什么奖励模型只是近似」。本课不跑 InstructGPT 的真实训练,所有步骤只复述接口。
- 本地绑定:
evidence/source-readback-official-v1.json
Proximal Policy Optimization Algorithms / PPO
- 作者:Schulman 等
- 年份:2017
- arXiv:1707.06347
- 章节:第11章
- 本课使用方式:作为 RLHF 管线的经典优化器与 GRPO 的对照基座,只取 clipped surrogate 限制每次策略更新幅度的动机。第11章在公式前说明生成过程的 MDP:状态是已生成前缀,动作是下一个 token,中间步环境奖励为 0,标量分数记在序列结束;整段 REINFORCE 是 γ = 1 的终止回报特例。一步 TD 残差说明 value head 的 V 与 GAE;概率比是旧策略样本上的重要性采样权重。本课仍不实现 value model,也不训练 GAE。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Locating and Editing Factual Associations in GPT / ROME
- 作者:Meng 等
- 年份:2022
- arXiv:2202.05262
- 章节:第11章
- 本课使用方式:第11章 将 ROME 作为知识编辑(Knowledge Editing)与模型定向事实修正的经典算法引入。解释 FFN 作为键值联想记忆库的因果追踪机理,以及保持历史知识协方差最小扰动下的解析秩一更新。本课说明其可靠性、通用性、局部性与可移植性四维评估契约,不复刻大型知识库全量刷库。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Mass-Editing Memory in a Transformer / MEMIT
- 作者:Meng 等
- 年份:2023
- arXiv:2210.07229
- 章节:第11章
- 本课使用方式:作为 ROME 的多层批量扩展引入,说明如何将数千条新事实残差平摊分布到 Transformer 多个中间层,实现大规模知识快速编辑并维持局部性守恒。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Trust Region Policy Optimization / TRPO
- 作者:Schulman 等
- 年份:2015
- arXiv:1502.05477
- 章节:第11章(PPO 演进链与策略优势第二条推导路径的汇合点)
- 本课使用方式:信任域的第一次显式实现——把概率比的可靠范围写成 KL 约束、用近似二阶方法求解;第11章 PPO 演进链第 4 步与"近似策略迭代"路径在此汇合。本课不实现 TRPO,推导入口见 RL 基础参考页。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Asynchronous Methods for Deep Reinforcement Learning / A3C
- 作者:Mnih 等
- 年份:2016
- arXiv:1602.01783
- 章节:第11章(actor-critic 谱系)
- 本课使用方式:actor-critic 家族的异步免锁版(多 worker 并行交互、异步推共享参数);第11章 用它标出"A2C 是同步批式回归主流"的谱系位置。本课不实现深度 actor-critic,表格 baseline 版的思想骨架在 Cliff Walk 实验。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Policy Gradient Algorithms(Lilian Weng 博文)
- 作者:Lilian Weng
- 年份:2018(多次增补至 2020-10,含 SAC/TD3/SVPG/PPG/IMPALA 条目)
- arXiv:无(技术博客,lilianweng.github.io/posts/2018-04-08-policy-gradient;URL 在线 readback 2026-10-05)
- 章节:第11章 #pg-general
- 本课使用方式:策略梯度族(REINFORCE → actor-critic → off-policy 修正 → TRPO/PPO)的综述式图谱出处,作 #pg-general 小节推导之外的延伸阅读总入口。本课不复现其算法清单,表格实现以本仓
python/llm_core/rl_basics.py为准。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
The 37 Implementation Details of Proximal Policy Optimization(ICLR Blog Track 2022)
- 作者:Huang、Dossa、Raffin、Kanervisto、Wang
- 年份:2022
- arXiv:无(ICLR Blog Track 论文式博文,iclr-blog-track.github.io/2022/03/25/ppo-implementation-details;URL 在线 readback 2026-10-05)
- 章节:第11章(看懂技术报告需要的 PPO 目标小节)
- 本课使用方式:PPO 论文不写、实现里却决定成败的代码级细节(advantage 归一化、reward scaling、value 裁剪等)的系统盘点;第11章 PPO 小节读目标函数时的"论文 vs 工程"对照阅读。本课不实现 PPO 训练,细节清单只作对照索引。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
The N Implementation Details of RLHF with PPO(ICLR Blogposts 2024)
- 作者:Huang 等
- 年份:2024
- arXiv:无(ICLR 2024 Blog Track 博文,iclr-blogposts.github.io/2024/blog/the-n-implementation-details-of-rlhf-with-ppo;URL 在线 readback 2026-10-05)
- 章节:第11章(InstructGPT 三阶段管线与 PPO 机制块)
- 本课使用方式:对 OpenAI 2019 年 RLHF 工作的学习曲线级复现,盘点 reward model 与策略训练两侧的实现细节(KL 惩罚位置、优化器数值差等);第11章 讲 RLHF 管线时的工程现实对照。本课不跑 RLHF 管线。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Deep Reinforcement Learning: Pong from Pixels(Karpathy 博文)
- 作者:Andrej Karpathy
- 年份:2016
- arXiv:无(技术博客,karpathy.github.io/2016/05/31/rl;URL 在线 readback 2026-10-05)
- 章节:RL 基础参考页(策略梯度节的延伸阅读)
- 本课使用方式:深度 RL 代码入门的经典单文件 walkthrough——policy gradient 从像素原始分直接下降、约百行代码跑通 Pong;RL 基础参考页读完策略梯度推导后的推荐上手读物。本课的表格版 REINFORCE 在
python/llm_core/rl_basics.py,不迁移到像素输入。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Scaling Instruction-Finetuned Language Models / Flan-PaLM
- 作者:Chung 等
- 年份:2023
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第11章(SFT 数据配比) / 第12章(Bitter Lesson II)
- 本课使用方式:任务多样性的反直觉收益出处——在 A、B、C 多任务上训练比只训 A 对 A 更好;第12章 把 Flan 系列称为 Bitter Lesson II。本课只用该结论解释"为什么一定要混合",不复现 1836 任务的指令微调。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
STaR: Bootstrapping Reasoning With Reasoning(Self-Taught Reasoner)
- 作者:Zelikman 等
- 年份:2022(NeurIPS)
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第11章
- 本课使用方式:不用策略梯度学出 CoT 推理的三步循环(rationale generation / rationalization / 迭代);R1 阶段三"拒绝采样约 800k 数据再做 SFT"被读作它的工业版实例。本课不实现 STaR,只做概念对照。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Cognitive behaviors that enable self-improving reasoners
- 作者:Gandhi 等
- 年份:2025
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第11章
- 本课使用方式:"RLVR 为何突然奏效"的可检验答案:Qwen/DeepSeek 基座天然携带 verification / backtracking / subgoal setting / backward chaining 四类认知行为,RLVR 是放大器而非发生器;Llama 基座需先 prime。本课按批判视角转述,不搬其实验。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Yue 等(2025)pass@k 研究
- 作者:Yue 等
- 年份:2025
- arXiv:—(论文名与编号未 readback,以课程讲义为准)
- 章节:第11章(未收敛辩论·回合一)
- 本课使用方式:"RLVR 学到新推理了吗"辩论的 No 方证据:RLVR 后小 k 采样更高效、大 k 的 pass@k 反而变差——概率质量向已会模式集中、探索被压缩。本课按未收敛领域口径转述,不选边。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
ProRL
- 作者:—(作者与团队名未 readback)
- 年份:2025
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第11章(未收敛辩论·回合二)
- 本课使用方式:辩论的 Yes 方证据:用 DAPO 损失组件加周期性重置 KL 惩罚防住 entropy collapse 后,长时间 RL 能学到基座模型不可及的新策略。本课按未收敛领域口径转述,不选边。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Wang 等(2025)单样本 RLVR 研究
- 作者:Wang 等
- 年份:2025
- arXiv:—(论文名与编号未 readback,以课程讲义为准)
- 章节:第11章(未收敛辩论·回合三)
- 本课使用方式:又 No 方证据:只在一道帆船受风压物理单题上做 RLVR,模型在 MATH500 上拿到约 70% 正确率——支持"强化预训练已知的正确推理模式"。第11章 把这个单题实验摆成讨论题,本课不复现。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
GKD: Generalized Knowledge Distillation / Agarwal 等(2023)
- 作者:Agarwal 等
- 年份:2023
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第11章
- 本课使用方式:on-policy distillation 的一般化框架:用一个混合比例在「学生自采样」与「固定数据集」之间插值,散度选择也纳入设计空间;OPD 相当于混合比例取满学生采样端的特例。本课不实现 OPD/GKD(教师需逐步 forward 预算),机制级对照即可。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
RL of LLMs (Spring 2025)(课程级引用)
- 作者:Ernest K. Ryu
- 年份:2025
- arXiv:无(研究生课程,课程页)
- 章节:第11章 / 第12章 / RL 基础参考页
- 本课使用方式:讲法与教学装置来源——策略梯度定理与四步方差缩减的讲法顺序、actor-critic 谱系、PPO/TRPO 双推导路径、RLVR 未收敛辩论、GRPO 偏置分析、Cliff Walk 教学装置(
python/llm_core/rl_basics.py为本仓独立重写)。本仓只保留链接与归属,正文用自己的话重述并在各处标注"讲法源自"。 - 本地绑定:
docs/audit/rl-llm-snu-gap-audit-2026-10-05.md(link-only 审计);source manifest 记录ernest-ryu-rl-of-llms-course-2026-10-05
Reinforcement Learning from scratch #1(课程级引用)
- 作者:Pramod Goyal
- 年份:2026(X 长文,2026-10-03 发布)
- arXiv:无(X 平台长文,链接帖;访问 2026-10-05)
- 章节:RL 基础参考页(阶段 0 bandit 与追遗补遗)、第11章 / 第12章(PPO/GRPO/OPD 的发明独白开场)
- 本课使用方式:叙事装置与 bandit 知识框架来源——先发明后命名的引入节奏、Loose Ends 严格性后置、符号急救包、涟漪点睛;bandit 知识点对应 Sutton & Barto 第 2–4 章,正文全部用本课自己的话重述,不复制原文文本、图或代码。
- 本地绑定:
docs/audit/goyal-rl-narrative-absorption-2026-10-05.md(link-only 审计);source manifest 记录pramod-goyal-rl-from-scratch-1-2026-10-05
第13章–第21章 检索、Agent 与评估
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- 作者:Lewis 等
- 年份:2020
- arXiv:2005.11401
- 章节:第13章
- 本课使用方式:把 RAG 框架拆成「retriever + generator」两段,介绍何时引入检索、为什么生成端仍然需要 ground。我们不在本课复刻端到端 RAG 训练,所有讨论停留在接口契约层面。RAG 评估三元组(faithfulness / answer relevance / context relevance)的提出者见 Es et al. 2023 的 RAGAS(arXiv:2309.15217)。
- 本地绑定:
evidence/source-readback-official-v1.json
RAGAS: Retrieval-Augmented Generation Assessment
- 作者:Es 等
- 年份:2023
- arXiv:2309.15217
- 章节:第13章 / 第14章(RAG 三元组出处)
- 本课使用方式:faithfulness / answer relevance / context relevance 三个 RAG 评估维度的原始出处;第13章 在 RAG 评估一节引用该三元组,第14章 在实战评估中作为选做对照。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
ReAct: Synergizing Reasoning and Acting
- 作者:Yao 等
- 年份:2023
- arXiv:2210.03629
- 章节:第15章
- 本课使用方式:把 ReAct 当作「Thought / Action / Observation 交替循环」的工程模板,强调动作必须经过 schema 与 policy 验证。本课不复刻论文里 HotPotQA 的实验轨迹,只保留循环结构与终止条件。
- 本地绑定:
evidence/source-readback-official-v1.json
Toolformer: Language Models Can Teach Themselves to Use Tools
- 作者:Schick 等
- 年份:2023
- arXiv:2302.04761
- 章节:第15章
- 本课使用方式:把「模型学习何时插入工具调用」当作 ReAct 的对照:Toolformer 关心的是何时调用,本课关心的是调用必须先过 schema / policy。不复刻其自监督标注管线。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- 作者:Zheng 等
- 年份:2023
- arXiv:2306.05685
- 章节:第21章
- 本课使用方式:把「LLM-as-a-Judge」当作评估信号之一,明确它不能单独决定毕业或安全通过。我们不引用 MT-Bench 的具体评分,评估口径以本仓库固定的人工标签为准。
- 本地绑定:
evidence/source-readback-official-v1.json
A Watermark for Large Language Models
- 作者:Kirchenbauer 等
- 年份:2023
- arXiv:2301.10226
- 章节:第21章
- 本课使用方式:作为生成内容版权溯源与安全合规的经典算法(KGW)引入。解释自回归采样时基于哈希划分红绿词表与 Logits 扰动的原理,以及无须原模型参与的 Z-score 假设检验检测器。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
R-Judge: Benchmarking Safety Risk Awareness for Language Model Agents
- 作者:Zhang 等(上海交通大学团队)
- 年份:2024
- arXiv:2401.10019
- 章节:第21章 / 第15章
- 本课使用方式:作为开放环境下智能体行为安全风险评估的权威基准引入。用于规范多轮交互记录
(Profile, User, Agent, Environment)、风险识别与安全研判,指导高危系统命令拦截与最小特权沙箱设计。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
第15章–第20章 应用实战
Program-aided Language Models / PoT
- 作者:Chen 等
- 年份:2023
- arXiv:2211.10435
- 章节:第17章
- 本课使用方式:作为复杂推理任务中程序辅助思维链的经典范式引入。将符号推理与数值计算解耦,由模型编写 Python 求解器,利用确定性运行时彻底消除大模型自回归算术进位幻觉。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Self-Consistency Improves Chain of Thought Reasoning in Language Models
- 作者:Wang 等
- 年份:2023
- arXiv:2203.11171
- 章节:第17章
- 本课使用方式:作为推理期多路径边缘采样与多数票决的标准范式引入。解释非零采样温度下多样性思考链的聚合消除局部贪婪偏差的统计原理。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Building effective agents(Anthropic 工程博客)
- 作者:Anthropic(Schluntz、Zhang)
- 年份:2024
- arXiv:无(工程博客,anthropic.com/engineering/building-effective-agents)
- 章节:第18章与第20章
- 本课使用方式:五种 workflow 模式(prompt chaining / routing / parallelization / orchestrator-workers / evaluator-optimizer)与「workflow(预定义代码路径)vs agent(模型自主循环)」决策边界的原始出处;第18章 把手写 loop 改造成 evaluator-optimizer 模式做对照。本课不引入 Anthropic SDK,只复用模式分类。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
MemGPT: Towards LLMs as Operating Systems
- 作者:Packer 等
- 年份:2023
- arXiv:2310.08560
- 章节:第17章
- 本课使用方式:作为「记忆 RAG / 画像记忆」一节的概念对照:OS 虚拟内存类比、模型通过 function call 自主分页(paging)。本课只实现穷人版事实记忆(dict + 关键词检索回注),不复刻 MemGPT 的分层内存管理器。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
CoALA: Cognitive Architectures for Language Agents
- 作者:Sumers 等
- 年份:2023
- arXiv:2309.02427
- 章节:第17章
- 本课使用方式:借其 semantic / episodic / procedural 记忆分类给 第17章 的四模式表提供术语框架(截断 / 摘要 / 记忆 RAG / 画像)。本课不实现完整认知架构,只做分类对照。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
第12章 DeepSeek 专题阅读
以下篇目是 第12章 DeepSeek 模型专题 的绑定论文;术语表 另有 MLA / MoE / GRPO / MTP 的 L1 动机级词条。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2405.04434
- 章节:第12章(动机见 第10章 MQA/GQA 延伸)
- 本课使用方式:MLA(低秩压缩 KV 缓存)与 DeepSeekMoE(细粒度专家)的原始出处;术语表保留「省 KV / 省算力」的 L1 动机词条,KV 缓存字节数定量对比在 第12章 展开。本课不复现其训练与基准。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DeepSeek-V3 Technical Report
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2412.19437
- 章节:第12章
- 本课使用方式:V3 架构三件套(MLA + MoE + MTP)与 aux-loss-free 负载均衡、FP8 混合精度训练的原始出处;DualPipe 双向流水线并行算法(沟通与计算重叠)亦出自本篇;术语表保留名词级动机词条,架构定量分析在 第12章 展开。本课不复现其训练管线。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- 作者:DeepSeek-AI
- 年份:2025
- arXiv:2501.12948
- 章节:第12章(GRPO 雏形见 第11章 group normalized advantage fixture)
- 本课使用方式:R1-Zero → 冷启动 → 多阶段 RL 的流程与语言一致性奖励的原始出处;GRPO 的 L1 动机级对照(vs PPO 省 value model)见术语表,toy 更新实现见 第12章。本课不跑 RL-for-reasoning 训练。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2401.06066
- 章节:第12章
- 本课使用方式:细粒度专家划分(专家切更细)与共享专家的设计出处;本课在第12章给出 top-k 确定性截断与路由权重计算。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- 作者:Shao 等
- 年份:2024
- arXiv:2402.03300
- 章节:第12章
- 本课使用方式:GRPO(Group Relative Policy Optimization)组内相对优势计算的原始出处;无需 Critic/Value 模型,依赖组内打分均值与标准差归一化。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
YaRN: Efficient Context Window Extension of Large Language Models
- 作者:Peng 等
- 年份:2023
- arXiv:2309.00071
- 章节:第12章
- 本课使用方式:长上下文扩展中的高低频分治 RoPE 策略出处;高频外推保微观语法、低频插值拓宽宏观窗口。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep Learning
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2408.14158
- 章节:第12章
- 本课使用方式:3FS 分布式文件系统与万卡集群软硬件协同、计算与通信重叠架构背景;3FS 本身的开源实现见 deepseek-ai/3FS。DualPipe 双向流水线算法见同项目 V3 技术报告(arXiv:2412.19437),本条目只覆盖集群与文件系统层。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
Dr. GRPO(Liu 等,2025)
- 作者:Liu 等
- 年份:2025
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第12章
- 本课使用方式:GRPO 修正族:去掉长度归一化与 std 归一化,其更新是按 (N−1)/N 缩放的无偏策略梯度(组内减均值与 RLOO 中心化项同构);顺带纠正"组内中心化奖励并非 advantage 估计"的命名争议。本课不实现 Dr. GRPO,只在偏置分析小节转述其结论。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DAPO(2025)
- 作者:—(作者与团队名未 readback)
- 年份:2025
- arXiv:—(编号未 readback,以课程讲义为准)
- 章节:第12章(与第11章 ProRL 行交叉)
- 本课使用方式:同属"GRPO 发布后的修正族",同样针对长度归一化偏置修改机制;ProRL 以其损失组件支撑远长于常规的训练时长。本课只在 GRPO 偏置与 RLVR 辩论两处点名,不展开。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
序列建模前史(参考页绑定论文)
以下篇目是 序列建模前史参考页 的绑定论文——22 章主线「跳过 RNN 前置」声明所指向的前史谱系;Vaswani 2017 收束一篇见上方 第5章–第8章 分组的 Attention Is All You Need。
Finding Structure in Time / Elman RNN
- 作者:Elman
- 年份:1990
- arXiv:无(原刊于 Cognitive Science 14(2),早于 arXiv 时代)
- 章节:序列建模前史
- 本课使用方式:隐藏状态与权重跨时间共享的起点——「零填充 → 逐层处理 → 权重共享」三步构造的终点。本课不复现 Elman 网络实验,页内 numpy 三级阶梯以它的方程为直译对象。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Long Short-Term Memory / LSTM
- 作者:Hochreiter、Schmidhuber
- 年份:1997
- arXiv:无(原刊于 Neural Computation 9(8),早于 arXiv 时代)
- 章节:序列建模前史
- 本课使用方式:门控细胞与常数误差传送带的原始论文;前史页只取「门控加法让权重矩阵从梯度路径消失」的机理与门职责分工,公式按标准文献记法(含对 2018 版 CS230 cheatsheet 记法勘误的对照)。forget 门的补全见 Gers 等, Learning to Forget, Neural Computation 12(10), 2000(无 arXiv,未单独 readback)。本课不实现 LSTM。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
On the difficulty of training recurrent neural networks / Pascanu 等(2013)
- 作者:Pascanu、Mikolov、Bengio
- 年份:2013
- arXiv:1211.5063
- 章节:序列建模前史
- 本课使用方式:梯度爆炸/消失的系统分析与梯度裁剪的出处;前史页把它接在第7章梯度诊断表之下,作为「爆炸可修、消失裁不动」不对称结论的文献源头。裁剪实现已在 第7/9章 覆盖,此处只做机理对照。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Efficient Estimation of Word Representations in Vector Space / word2vec(Mikolov 等, 2013)
- 作者:Mikolov 等
- 年份:2013
- arXiv:1301.3781
- 章节:序列建模前史
- 本课使用方式:静态分布语义的奠基论文:Skip-gram 用中心词预测上下文、负采样把全词表 softmax 退化成
个二分类;前史页词向量节取「语义即几何」的世界观起点——embedding 查表是第8章 Transformer 第一层的历史祖先,「正对拉近、负对推远」的对比学习原型延续到第13/14章的 embedding 检索。本课不训练 word2vec;同期计数路线 GloVe(Pennington 等, EMNLP 2014,未 readback)只提名对照。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Learning Phrase Representations using RNN Encoder–Decoder / GRU 与 seq2seq(Cho 等, 2014)
- 作者:Cho 等
- 年份:2014
- arXiv:1406.1078
- 章节:序列建模前史
- 本课使用方式:GRU 门控方程与编码器-解码器结构在同一篇出场;前史页取 GRU 与 LSTM 的并排对照(互补门 vs 解耦门),不复现其翻译基准。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Sequence to Sequence Learning with Neural Networks / Sutskever 等(2014)
- 作者:Sutskever 等
- 年份:2014
- arXiv:1409.3215
- 章节:序列建模前史
- 本课使用方式:编码器-解码器 seq2seq 的另一原始出处;前史页只取「全部语义压进一个定长向量」的信息瓶颈叙事——它是注意力机制的诞生动机。本课不做机器翻译。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Neural Machine Translation by Jointly Learning to Align and Translate / Bahdanau attention(2014/2015)
- 作者:Bahdanau、Cho、Bengio
- 年份:2014(ICLR 2015)
- arXiv:1409.0473
- 章节:序列建模前史
- 本课使用方式:固定向量瓶颈的第一个解:解码器对编码器全部时间步做 softmax 软选择,加性打分;第8章 的缩放点积是它的矩阵化替身。本课只在血缘对照里使用,不复现对齐实验。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
课程级引用(速查表与前史参考页)
Stanford CS229/CS230 VIP Cheatsheets(课程级引用)
- 作者:Afshine Amidi、Shervine Amidi
- 年份:2018–2019(CS229 / CS230 快照版)
- arXiv:无(课程速查表,CS229 仓库 与 CS230 仓库,MIT License)
- 章节:第3章(无偏估计 / 方差协方差 / 分布速查小节)、第7章(优化器与正则化谱系表)、第21章(判官指标族)、序列建模前史(RNN/LSTM/seq2seq/attention 谱系知识框架)
- 本课使用方式:数学 refresher 与 DL 谱系的知识框架来源——2018–2019 快照按现代实践校准后吸收(优化器数值惯例、dropout 现代定位),全部用本课自己的语言与公式排版重述;CS230 的 LSTM 记法与标准文献不一致处,以前史页的勘误框为准换算。
- 本地绑定:
docs/audit/stanford-sources-gap-audit-2026-10-05.md(link-only 审计);source manifest 记录stanford-vip-cheatsheets-cme295-2026-10-05
Stanford CME295 Transformers & LLMs Cheatsheet(课程级引用)
- 作者:Afshine Amidi、Shervine Amidi
- 年份:2026(Fall 2026 版,2026-09-13 快照)
- arXiv:无(课程速查表,仓库链接,MIT License;课程大纲见 cme295.stanford.edu/syllabus)
- 章节:第11章(OPD 主题对照)、课程速查表(设计形态参照)
- 本课使用方式:检索层设计参照——❒ 术语卡 + Remark 双通道、判断支持型对照表、结论式公式就地定义的排版形态;内容零复制,本站速查表的所有条目与数值收割自课程自有正文。on-policy distillation 的主题指针亦来自其 cheatsheet §4.4。
- 本地绑定:
docs/audit/stanford-sources-gap-audit-2026-10-05.md(link-only 审计);source manifest 记录stanford-vip-cheatsheets-cme295-2026-10-05
选读
Chain-of-Thought Prompting
- 作者:Wei 等
- 年份:2022
- arXiv:2201.11903
- 章节:第15章与第17章(选读)
- 本课使用方式:作为「推理能力来自思维链而非新结构」的对照,提醒学员把 CoT 当作 prompt 工程而不是模型新能力。本课不在真实模型上跑 CoT benchmark。
- 本地绑定:
evidence/source-readback-official-v1.json
GPTQ 与 AWQ(量化条目)
- 作者:Frantar(GPTQ)/ Lin(AWQ) 等
- 年份:2022 / 2023
- arXiv:2210.17323(GPTQ)、2306.00978(AWQ)
- 章节:第10章(选读,可合并成一条量化条目)
- 本课使用方式:第10章以独立 NumPy 代码实现真实 packed group-wise INT4 与 GPTQ-style 校准 Hessian、阻尼、逐列误差传播;AWQ 仍作为 activation-aware 对照。本课不加载压缩权重,也不复现任一上游 CUDA kernel、模型适配或真实 LLM benchmark。
- 本地绑定:
evidence/source-readback-official-v1.json
HAL 与大模型性价比帕累托前沿分析
- 作者:Haluptzok 等
- 年份:2025
- arXiv:2510.11977
- 章节:第21章(选读)
- 本课使用方式:作为「多指标基准评测与帕累托前沿模型选型」的方法论对照,阐明为什么行业选型必须摆脱单一绝对分数的 Leaderboard 崇拜,转向准确率-成本-延迟(Accuracy vs Cost/Latency)双轴或多轴帕累托非支配分析。本课不复刻其第三方全量自动化排行榜,仅吸收其非支配解过滤与拐点选型思维。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
SGLang 与 RadixAttention 前缀树缓存
- 作者:Lian 等
- 年份:2023 / 2024
- arXiv:2312.07104
- 章节:第10章(选读)
- 本课使用方式:SGLang 基数树(Radix Trie)前缀缓存与最长前缀匹配(LPM)机制的原始出处;第10章以此为蓝本手写白盒
RadixCache,解析树形分叉分裂、引用计数锁定与树形 LRU 回收机制。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接)
DistServe 与 Mooncake:PD 分离架构
- 作者:Zhong 等(DistServe, OSDI 2024)/ Qin 等(Mooncake, 2024)
- 年份:2024
- arXiv:2401.09670(DistServe)、2407.00079(Mooncake)
- 章节:第10章(选读)
- 本课使用方式:大模型推理集群 Prefill-Decode 分离部署与长文本 RDMA 分布式缓存传输的方法论出处;第10章以单进程离散事件仿真器(
PDSimulator)对比 Cache-Aware 路由与常规轮询的 TTFT 收益。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接)
Mistral 7B 与滑动窗口注意力(SWA)
- 作者:Jiang 等
- 年份:2023
- arXiv:2310.06825
- 章节:第8章, 第10章(选读)
- 本课使用方式:带状局部因果注意力与多层理论感受野
线性叠加的原始出处;第8章与第10章以此剖析其在长文本推理中将单会话 KV 显存与跨机 RDMA 传输量由 锁死为 的 Infra 核心价值。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接)
CodeAct:可执行代码智能体范式
- 作者:Wang 等
- 年份:2024
- arXiv:2402.01030
- 章节:第15章(选读)
- 本课使用方式:通用自主智能体(如 Manus / Devin)以可执行 Python 代码替代受限 JSON Tool Calling 的理论与架构出处;第15章以此剖析复杂控制流与长程上下文修剪(Context Pruning)机制。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
投机采样解码(Speculative Decoding)
- 作者:Leviathan 等
- 年份:2023
- arXiv:2211.17192
- 章节:第10章(选读)
- 本课使用方式:大模型自回归解码显存带宽墙突破方案的理论奠基;第10章手写拒绝采样无损对齐判定准则,并给出平均接受率
下加速比的闭式解。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接)
测试时计算扩展(Scaling LLM Test-Time Compute)
- 作者:Snell 等
- 年份:2024
- arXiv:2408.03314
- 章节:第12章(选读)
- 本课使用方式:推理 Scaling Laws 的核心理论奠基论文,阐明根据问题难度自适应分配测试时算力(Thinking Tokens / 树搜索搜索步数)在复杂逻辑任务上能够以极高的效费比战胜盲目扩大模型参数。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接)
阅读方法
- 先读论文 abstract + 结论表,再翻到本课对应章节:先确认论文解决了什么、本课用了哪一段。
- 关掉论文,用自己的话复述动机 + 接口 + 取舍;不要复述实验表格,也不要把作者的消融当作本课结论。
- 在本仓库对应章节找到对应实验,跑一遍本地测试,把现象写进自己的 evidence,而不是把论文数字当 evidence。
- 主动记下「论文没解决什么」:例如 Chinchilla 没解决推理成本、FlashAttention 没覆盖稀疏 attention、InstructGPT 没覆盖工具调用失败、DPO 没覆盖多轮偏好。任何一篇论文的「未解决」都会在本课其他章节里被再次提出。
- 复制行为前必须新增 source record、保留版权/许可证 notice,并取得人工发布决定;详见 参考资料读回。
许可与边界
- 本索引只做概念对照,不复制任何论文的正文、图表、公式图或权重。
- 所有外部锚点与许可事实由只读 evidence 记录,不在站点内镜像论文资源。
- 论文之外的资源(视频、课程、教材)见 资源总览。
- 详细许可证读回、source manifest、publication gate 状态见 参考资料读回。