Appearance
必读论文索引 — 27 篇 + 选读
这一页只把论文当作「问题定义、接口与设计背景」的对照表。所有结论都必须由本仓库的测试、fixture 和交互来证明,论文本身不能充当 evidence。论文正文、图片、表格与权重一律不在本仓库内复制;本课对每篇论文只用一段话讲清「动机 / 接口 / 取舍」,并在指定章节落地最小实验。任何对外复制行为都需要新增 source record 并走人工发布决定。
阅读口径:
- 动机:作者用一两句话把什么问题换成可优化的形式。
- 接口:本课在哪一章只复用了哪一个函数签名或公式形态。
- 取舍:作者主动放弃了什么,本课相应地不覆盖什么。
- 未解决:作者明确留给后人继续做、但本课也尚未完成的部分。
每篇论文条目结构固定,包含作者、年份、arXiv 链接、对应章节、本课使用方式、本地绑定锚点。
第3章 基础
Learning representations by back-propagating errors
- 作者:Rumelhart、Hinton、Williams
- 年份:1986
- arXiv:无(原刊于 Nature 323,本课改用 Karpathy 的 backprop 导读 作为可公开访问的等价讲解)
- 章节:第3章
- 本课使用方式:把反向传播理解为「局部导数 + 链式法则 + 逆拓扑序累加」,作为
clean_room/autograd.py中Value.backward()的唯一实现契约。我们不复现论文原始的多层感知机基准实验,正确性由python/tests/test_autograd.py的有限差分对拍与共享子表达式梯度累加测试提供。 - 本地绑定:
evidence/source-readback-official-v1.json
第4章–第5章 基础
Attention Is All You Need
- 作者:Vaswani 等
- 年份:2017
- arXiv:1706.03762
- 章节:第7章
- 本课使用方式:把 Transformer 的「Q/K/V 多头缩放点积 + 残差 + 前馈」当成本课 attention 与 MLP 块的接口约定。我们只复现数学形态与张量形状,不复现论文中的并行训练栈、label smoothing 调参和原始 WMT 基准;训练证据由
python/tests/test_attention_gpt.py与本地小语料提供。 - 本地绑定:
evidence/source-readback-official-v1.json记录只读锚点与许可事实
Layer Normalization
- 作者:Ba、Kiros、Hinton
- 年份:2016
- arXiv:1607.06450
- 章节:第6章
- 本课使用方式:在 LayerNorm 实现里沿用论文的「按特征维度归一 + 可学 γ/β」接口,作为 第6章 训练稳定性的最小工程基线。我们不引入 batch 维度的统计量(不实现 BatchNorm),也不讨论 reparameterization 技巧,所有验证通过本地 toy batch 上的均值为 0、方差为 1 检查完成。
- 本地绑定:
evidence/source-readback-official-v1.json
Root Mean Square Layer Normalization / RMSNorm
- 作者:Zhang、Sennrich
- 年份:2019
- arXiv:1910.07467
- 章节:第6章 / 第9章
- 本课使用方式:第6章 作为 LayerNorm 的「去均值 + 只用 RMS 缩放」对照实现,给出参数更少、形状一致的等价层;第9章 把它当作现代推理栈里常见的默认归一化形式之一,与 RoPE、GQA 并列说明。我们不复刻论文里跨模型族的迁移实验,也不替代 第6章 的 LayerNorm 作为唯一选择。
- 本地绑定:
evidence/source-readback-official-v1.json
Neural Machine Translation of Rare Words with Subword Units / BPE
- 作者:Sennrich、Haddow、Birch
- 年份:2016
- arXiv:1508.07909
- 章节:第5章
- 本课使用方式:第5章 tokenizer 实现沿用论文的「字节对合并 + 频次驱动」基本步骤,把 tokenization 抽象成
encode/decode两条主路径,并保证训练集与模型词表不依赖外部模型权重。我们不实现 backoff 规则与单语/双语扩展实验,验证由python/tests/test_bpe.py完成。 - 本地绑定:
evidence/source-readback-official-v1.json
Language Models are Few-Shot Learners / GPT-3
- 作者:Brown 等
- 年份:2020
- arXiv:2005.14165
- 章节:第4章 / 第8章
- 本课使用方式:第4章 用一句话讲清「in-context learning 是规模效应而非新结构」,避免把上下文示例当成训练样本;第8章 在缩放法则讨论中把 GPT-3 视为「规模化收益被 Chinchilla 修正」的基线参考。我们不下载、不引用具体权重,所有数字只用作论文比较。
- 本地绑定:
evidence/source-readback-official-v1.json
第6章–第8章 训练
Decoupled Weight Decay Regularization / AdamW
- 作者:Loshchilov、Hutter
- 年份:2019
- arXiv:1711.05101
- 章节:第6章
- 本课使用方式:在 第6章 优化器实验里把权重衰减从梯度项剥离到参数项,作为与 Adam 等价的 baseline。我们不复刻原论文的 CIFAR/ImageNet 实验,仅比较损失下降轨迹与 lr/λ 网格,验证由本地曲线完成。
- 本地绑定:
evidence/source-readback-official-v1.json
Scaling Laws for Neural Language Models
- 作者:Kaplan 等
- 年份:2020
- arXiv:2001.08361
- 章节:第8章
- 本课使用方式:第8章 用论文的幂律形式说明「参数 / 数据 / 算力」三者之间的可换算关系,提醒读者「只放大参数」不会免费带来收益。我们不拟合真实模型的缩放曲线,所有数字只用于讲清动机。
- 本地绑定:
evidence/source-readback-official-v1.json
Training Compute-Optimal Large Language Models / Chinchilla
- 作者:Hoffmann 等
- 年份:2022
- arXiv:2203.15556
- 章节:第8章
- 本课使用方式:作为对 Kaplan 缩放法则的修正引入,强调在给定算力预算下「模型大小与训练 token 数应同步缩放」。本课不进行实际的算力分配决策,只把 Chinchilla 比例当作训练清单中一个需要人工校准的约束。
- 本地绑定:
evidence/source-readback-official-v1.json
第9章 推理与效率
RoFormer: Enhanced Transformer with Rotary Position Embedding
- 作者:Su 等
- 年份:2021
- arXiv:2104.09864
- 章节:第9章
- 本课使用方式:把 RoPE 当作相对位置编码的一种工程选择,用「在 Q/K 上做复数旋转」来解释远程依赖的衰减。我们不在长上下文上验证外推性能,所有边界以本仓库窗口长度为准。
- 本地绑定:
evidence/source-readback-official-v1.json
GQA: Training Generalized Multi-Query Transformer Layers
- 作者:Ainslie 等
- 年份:2023
- arXiv:2305.13245
- 章节:第9章
- 本课使用方式:把 MQA/MHA/GQA 当作「KV 头数与推理显存」之间的可调档位,仅在结构层提供占位接口。我们不训练 GQA checkpoint,也不复刻论文中 grouped-query 的蒸馏流程。
- 本地绑定:
evidence/source-readback-official-v1.json
FlashAttention
- 作者:Dao 等
- 年份:2022
- arXiv:2205.14135
- 章节:第9章
- 本课使用方式:用「按块计算 + 不物化完整注意力矩阵」的思路解释 IO-aware attention 的动机,作为本课 attention 复杂度讨论的对照。我们不接入 CUDA 核,所有讨论停留在算法层。
- 本地绑定:
evidence/source-readback-official-v1.json
GLU Variants Improve Transformer / SwiGLU
- 作者:Shazeer
- 年份:2020
- arXiv:2002.05202
- 章节:第9章
- 本课使用方式:把 SwiGLU 当作「门控线性单元替换 FFN 激活」的接口形态,第9章 手写
并做 shape 对拍。论文的多变体消融(GEGLU/SwiGLU 等)不复刻,只取「门控提升表达力」的动机与隐藏维 换算的取舍说明。 - 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
Efficient Memory Management for LLM Serving with PagedAttention / vLLM
- 作者:Kwon 等
- 年份:2023
- arXiv:2309.06180
- 章节:第9章
- 本课使用方式:把 vLLM 的「按页管理 KV 缓存 + 逻辑/物理块分离」作为推理显存设计模式的样例,提醒在分配器设计中避免 O(n²) 碎片。本课不部署 vLLM,所有结论只来自论文本身。
- 本地绑定:
evidence/source-readback-official-v1.json
第10章 对齐
LoRA: Low-Rank Adaptation of Large Language Models
- 作者:Hu 等
- 年份:2021
- arXiv:2106.09685
- 章节:第10章
- 本课使用方式:第10章 把 LoRA 当成「冻结主权重 + 注入低秩 ΔW」的最小工程范式,解释适配成本与可合并性。我们不训练 LoRA 适配器,也不复刻论文中多任务合并实验。
- 本地绑定:
evidence/source-readback-official-v1.json
Direct Preference Optimization / DPO
- 作者:Rafailov 等
- 年份:2023
- arXiv:2305.18290
- 章节:第10章
- 本课使用方式:把 DPO 当作「跳过显式奖励模型、直接用偏好对优化」的工程替代方案。本课不进行实际 DPO 训练,只用一段口述说明 reward、reference policy 与隐式奖励之间的关系。
- 本地绑定:
evidence/source-readback-official-v1.json
Training language models to follow instructions with human feedback / InstructGPT
- 作者:Ouyang 等
- 年份:2022
- arXiv:2203.02155
- 章节:第10章
- 本课使用方式:作为三阶段流程(SFT → RM → RLHF)的工程模板,解释「为什么需要人在回路」以及「为什么奖励模型只是近似」。本课不跑 InstructGPT 的真实训练,所有步骤只复述接口。
- 本地绑定:
evidence/source-readback-official-v1.json
Proximal Policy Optimization Algorithms / PPO
- 作者:Schulman 等
- 年份:2017
- arXiv:1707.06347
- 章节:第10章
- 本课使用方式:作为 RLHF 管线的经典优化器与 GRPO 的对照基座,只取「clipped surrogate 限制每次策略更新幅度」的动机,讲清为什么需要信任区域。本课不跑 RL 训练,不实现 value model 与 GAE。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
第11章–第18章 检索、Agent 与评估
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- 作者:Lewis 等
- 年份:2020
- arXiv:2005.11401
- 章节:第11章
- 本课使用方式:把 RAG 框架拆成「retriever + generator」两段,介绍何时引入检索、为什么生成端仍然需要 ground。我们不在本课复刻端到端 RAG 训练,所有讨论停留在接口契约层面。
- 本地绑定:
evidence/source-readback-official-v1.json
ReAct: Synergizing Reasoning and Acting
- 作者:Yao 等
- 年份:2023
- arXiv:2210.03629
- 章节:第13章
- 本课使用方式:把 ReAct 当作「Thought / Action / Observation 交替循环」的工程模板,强调动作必须经过 schema 与 policy 验证。本课不复刻论文里 HotPotQA 的实验轨迹,只保留循环结构与终止条件。
- 本地绑定:
evidence/source-readback-official-v1.json
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- 作者:Zheng 等
- 年份:2023
- arXiv:2306.05685
- 章节:第18章
- 本课使用方式:把「LLM-as-a-Judge」当作评估信号之一,明确它不能单独决定毕业或安全通过。我们不引用 MT-Bench 的具体评分,评估口径以本仓库固定的人工标签为准。
- 本地绑定:
evidence/source-readback-official-v1.json
第12章–第17章 应用实战
Building effective agents(Anthropic 工程博客)
- 作者:Anthropic(Schluntz、Zhang)
- 年份:2024
- arXiv:无(工程博客,anthropic.com/engineering/building-effective-agents)
- 章节:第16章
- 本课使用方式:五种 workflow 模式(prompt chaining / routing / parallelization / orchestrator-workers / evaluator-optimizer)与「workflow(预定义代码路径)vs agent(模型自主循环)」决策边界的原始出处;第16章 把手写 loop 改造成 evaluator-optimizer 模式做对照。本课不引入 Anthropic SDK,只复用模式分类。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
MemGPT: Towards LLMs as Operating Systems
- 作者:Packer 等
- 年份:2023
- arXiv:2310.08560
- 章节:第15章
- 本课使用方式:作为「记忆 RAG / 画像记忆」一节的概念对照:OS 虚拟内存类比、模型通过 function call 自主分页(paging)。本课只实现穷人版事实记忆(dict + 关键词检索回注),不复刻 MemGPT 的分层内存管理器。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
CoALA: Cognitive Architectures for Language Agents
- 作者:Sumers 等
- 年份:2023
- arXiv:2309.02427
- 章节:第15章
- 本课使用方式:借其 semantic / episodic / procedural 记忆分类给 第15章 的四模式表提供术语框架(截断 / 摘要 / 记忆 RAG / 画像)。本课不实现完整认知架构,只做分类对照。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
第20章 专题阅读(第二梯队)
以下三篇是 第20章 DeepSeek 模型专题 的绑定论文;术语表 另有 MLA / MoE / GRPO / MTP 的 L1 动机级词条。
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2405.04434
- 章节:第20章(动机见 第9章 MQA/GQA 延伸)
- 本课使用方式:MLA(低秩压缩 KV 缓存)与 DeepSeekMoE(细粒度专家)的原始出处;术语表保留「省 KV / 省算力」的 L1 动机词条,KV 缓存字节数定量对比在 第20章 展开。本课不复现其训练与基准。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DeepSeek-V3 Technical Report
- 作者:DeepSeek-AI
- 年份:2024
- arXiv:2412.19437
- 章节:第20章
- 本课使用方式:V3 架构三件套(MLA + MoE + MTP)与 aux-loss-free 负载均衡、FP8 训练的原始出处;术语表保留名词级动机词条,架构定量分析在 第20章 展开。本课不复现其训练管线。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- 作者:DeepSeek-AI
- 年份:2025
- arXiv:2501.12948
- 章节:第20章(GRPO 雏形见 第10章 group normalized advantage fixture)
- 本课使用方式:R1-Zero → 冷启动 → 多阶段 RL 的流程与语言一致性奖励的原始出处;GRPO 的 L1 动机级对照(vs PPO 省 value model)见术语表,toy 更新实现见 第20章。本课不跑 RL-for-reasoning 训练。
- 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)
选读
Chain-of-Thought Prompting
- 作者:Wei 等
- 年份:2022
- arXiv:2201.11903
- 章节:第13章(选读)
- 本课使用方式:作为「推理能力来自思维链而非新结构」的对照,提醒学员把 CoT 当作 prompt 工程而不是模型新能力。本课不在真实模型上跑 CoT benchmark。
- 本地绑定:
evidence/source-readback-official-v1.json
GPTQ 与 AWQ(量化条目)
- 作者:Frantar(GPTQ)/ Lin(AWQ) 等
- 年份:2022 / 2023
- arXiv:2210.17323(GPTQ)、2306.00978(AWQ)
- 章节:第9章(选读,可合并成一条量化条目)
- 本课使用方式:把 GPTQ / AWQ 当作「训练后量化 + 权重重排序」的代表,说明精度 / 显存 / 推理吞吐之间的工程取舍。本课不加载任何压缩权重,仅在 第9章 把它们作为推理栈的术语参考。
- 本地绑定:
evidence/source-readback-official-v1.json
阅读方法
- 先读论文 abstract + 结论表,再翻到本课对应章节:先确认论文解决了什么、本课用了哪一段。
- 关掉论文,用自己的话复述动机 + 接口 + 取舍;不要复述实验表格,也不要把作者的消融当作本课结论。
- 在本仓库对应章节找到对应实验,跑一遍本地测试,把现象写进自己的 evidence,而不是把论文数字当 evidence。
- 主动记下「论文没解决什么」:例如 Chinchilla 没解决推理成本、FlashAttention 没覆盖稀疏 attention、InstructGPT 没覆盖工具调用失败、DPO 没覆盖多轮偏好。任何一篇论文的「未解决」都会在本课其他章节里被再次提出。
- 复制行为前必须新增 source record、保留版权/许可证 notice,并取得人工发布决定;详见 参考资料读回。
许可与边界
- 本索引只做概念对照,不复制任何论文的正文、图表、公式图或权重。
- 所有外部锚点与许可事实由只读 evidence 记录,不在站点内镜像论文资源。
- 论文之外的资源(视频、课程、教材)见 资源总览。
- 详细许可证读回、source manifest、publication gate 状态见 参考资料读回。