Skip to content

必读论文索引 — 27 篇 + 选读

这一页只把论文当作「问题定义、接口与设计背景」的对照表。所有结论都必须由本仓库的测试、fixture 和交互来证明,论文本身不能充当 evidence。论文正文、图片、表格与权重一律不在本仓库内复制;本课对每篇论文只用一段话讲清「动机 / 接口 / 取舍」,并在指定章节落地最小实验。任何对外复制行为都需要新增 source record 并走人工发布决定。

阅读口径:

  • 动机:作者用一两句话把什么问题换成可优化的形式。
  • 接口:本课在哪一章只复用了哪一个函数签名或公式形态。
  • 取舍:作者主动放弃了什么,本课相应地不覆盖什么。
  • 未解决:作者明确留给后人继续做、但本课也尚未完成的部分。

每篇论文条目结构固定,包含作者、年份、arXiv 链接、对应章节、本课使用方式、本地绑定锚点。


第3章 基础

Learning representations by back-propagating errors

  • 作者:Rumelhart、Hinton、Williams
  • 年份:1986
  • arXiv:无(原刊于 Nature 323,本课改用 Karpathy 的 backprop 导读 作为可公开访问的等价讲解)
  • 章节:第3章
  • 本课使用方式:把反向传播理解为「局部导数 + 链式法则 + 逆拓扑序累加」,作为 clean_room/autograd.pyValue.backward() 的唯一实现契约。我们不复现论文原始的多层感知机基准实验,正确性由 python/tests/test_autograd.py 的有限差分对拍与共享子表达式梯度累加测试提供。
  • 本地绑定evidence/source-readback-official-v1.json

第4章–第5章 基础

Attention Is All You Need

  • 作者:Vaswani 等
  • 年份:2017
  • arXiv1706.03762
  • 章节:第7章
  • 本课使用方式:把 Transformer 的「Q/K/V 多头缩放点积 + 残差 + 前馈」当成本课 attention 与 MLP 块的接口约定。我们只复现数学形态与张量形状,不复现论文中的并行训练栈、label smoothing 调参和原始 WMT 基准;训练证据由 python/tests/test_attention_gpt.py 与本地小语料提供。
  • 本地绑定evidence/source-readback-official-v1.json 记录只读锚点与许可事实

Layer Normalization

  • 作者:Ba、Kiros、Hinton
  • 年份:2016
  • arXiv1607.06450
  • 章节:第6章
  • 本课使用方式:在 LayerNorm 实现里沿用论文的「按特征维度归一 + 可学 γ/β」接口,作为 第6章 训练稳定性的最小工程基线。我们不引入 batch 维度的统计量(不实现 BatchNorm),也不讨论 reparameterization 技巧,所有验证通过本地 toy batch 上的均值为 0、方差为 1 检查完成。
  • 本地绑定evidence/source-readback-official-v1.json

Root Mean Square Layer Normalization / RMSNorm

  • 作者:Zhang、Sennrich
  • 年份:2019
  • arXiv1910.07467
  • 章节:第6章 / 第9章
  • 本课使用方式:第6章 作为 LayerNorm 的「去均值 + 只用 RMS 缩放」对照实现,给出参数更少、形状一致的等价层;第9章 把它当作现代推理栈里常见的默认归一化形式之一,与 RoPE、GQA 并列说明。我们不复刻论文里跨模型族的迁移实验,也不替代 第6章 的 LayerNorm 作为唯一选择。
  • 本地绑定evidence/source-readback-official-v1.json

Neural Machine Translation of Rare Words with Subword Units / BPE

  • 作者:Sennrich、Haddow、Birch
  • 年份:2016
  • arXiv1508.07909
  • 章节:第5章
  • 本课使用方式:第5章 tokenizer 实现沿用论文的「字节对合并 + 频次驱动」基本步骤,把 tokenization 抽象成 encode/decode 两条主路径,并保证训练集与模型词表不依赖外部模型权重。我们不实现 backoff 规则与单语/双语扩展实验,验证由 python/tests/test_bpe.py 完成。
  • 本地绑定evidence/source-readback-official-v1.json

Language Models are Few-Shot Learners / GPT-3

  • 作者:Brown 等
  • 年份:2020
  • arXiv2005.14165
  • 章节:第4章 / 第8章
  • 本课使用方式:第4章 用一句话讲清「in-context learning 是规模效应而非新结构」,避免把上下文示例当成训练样本;第8章 在缩放法则讨论中把 GPT-3 视为「规模化收益被 Chinchilla 修正」的基线参考。我们不下载、不引用具体权重,所有数字只用作论文比较。
  • 本地绑定evidence/source-readback-official-v1.json

第6章–第8章 训练

Decoupled Weight Decay Regularization / AdamW

  • 作者:Loshchilov、Hutter
  • 年份:2019
  • arXiv1711.05101
  • 章节:第6章
  • 本课使用方式:在 第6章 优化器实验里把权重衰减从梯度项剥离到参数项,作为与 Adam 等价的 baseline。我们不复刻原论文的 CIFAR/ImageNet 实验,仅比较损失下降轨迹与 lr/λ 网格,验证由本地曲线完成。
  • 本地绑定evidence/source-readback-official-v1.json

Scaling Laws for Neural Language Models

  • 作者:Kaplan 等
  • 年份:2020
  • arXiv2001.08361
  • 章节:第8章
  • 本课使用方式:第8章 用论文的幂律形式说明「参数 / 数据 / 算力」三者之间的可换算关系,提醒读者「只放大参数」不会免费带来收益。我们不拟合真实模型的缩放曲线,所有数字只用于讲清动机。
  • 本地绑定evidence/source-readback-official-v1.json

Training Compute-Optimal Large Language Models / Chinchilla

  • 作者:Hoffmann 等
  • 年份:2022
  • arXiv2203.15556
  • 章节:第8章
  • 本课使用方式:作为对 Kaplan 缩放法则的修正引入,强调在给定算力预算下「模型大小与训练 token 数应同步缩放」。本课不进行实际的算力分配决策,只把 Chinchilla 比例当作训练清单中一个需要人工校准的约束。
  • 本地绑定evidence/source-readback-official-v1.json

第9章 推理与效率

RoFormer: Enhanced Transformer with Rotary Position Embedding

  • 作者:Su 等
  • 年份:2021
  • arXiv2104.09864
  • 章节:第9章
  • 本课使用方式:把 RoPE 当作相对位置编码的一种工程选择,用「在 Q/K 上做复数旋转」来解释远程依赖的衰减。我们不在长上下文上验证外推性能,所有边界以本仓库窗口长度为准。
  • 本地绑定evidence/source-readback-official-v1.json

GQA: Training Generalized Multi-Query Transformer Layers

  • 作者:Ainslie 等
  • 年份:2023
  • arXiv2305.13245
  • 章节:第9章
  • 本课使用方式:把 MQA/MHA/GQA 当作「KV 头数与推理显存」之间的可调档位,仅在结构层提供占位接口。我们不训练 GQA checkpoint,也不复刻论文中 grouped-query 的蒸馏流程。
  • 本地绑定evidence/source-readback-official-v1.json

FlashAttention

  • 作者:Dao 等
  • 年份:2022
  • arXiv2205.14135
  • 章节:第9章
  • 本课使用方式:用「按块计算 + 不物化完整注意力矩阵」的思路解释 IO-aware attention 的动机,作为本课 attention 复杂度讨论的对照。我们不接入 CUDA 核,所有讨论停留在算法层。
  • 本地绑定evidence/source-readback-official-v1.json

GLU Variants Improve Transformer / SwiGLU

  • 作者:Shazeer
  • 年份:2020
  • arXiv2002.05202
  • 章节:第9章
  • 本课使用方式:把 SwiGLU 当作「门控线性单元替换 FFN 激活」的接口形态,第9章 手写 SwiGLU(x)=SiLU(W1x)(W2x) 并做 shape 对拍。论文的多变体消融(GEGLU/SwiGLU 等)不复刻,只取「门控提升表达力」的动机与隐藏维 8/3 换算的取舍说明。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

Efficient Memory Management for LLM Serving with PagedAttention / vLLM

  • 作者:Kwon 等
  • 年份:2023
  • arXiv2309.06180
  • 章节:第9章
  • 本课使用方式:把 vLLM 的「按页管理 KV 缓存 + 逻辑/物理块分离」作为推理显存设计模式的样例,提醒在分配器设计中避免 O(n²) 碎片。本课不部署 vLLM,所有结论只来自论文本身。
  • 本地绑定evidence/source-readback-official-v1.json

第10章 对齐

LoRA: Low-Rank Adaptation of Large Language Models

  • 作者:Hu 等
  • 年份:2021
  • arXiv2106.09685
  • 章节:第10章
  • 本课使用方式:第10章 把 LoRA 当成「冻结主权重 + 注入低秩 ΔW」的最小工程范式,解释适配成本与可合并性。我们不训练 LoRA 适配器,也不复刻论文中多任务合并实验。
  • 本地绑定evidence/source-readback-official-v1.json

Direct Preference Optimization / DPO

  • 作者:Rafailov 等
  • 年份:2023
  • arXiv2305.18290
  • 章节:第10章
  • 本课使用方式:把 DPO 当作「跳过显式奖励模型、直接用偏好对优化」的工程替代方案。本课不进行实际 DPO 训练,只用一段口述说明 reward、reference policy 与隐式奖励之间的关系。
  • 本地绑定evidence/source-readback-official-v1.json

Training language models to follow instructions with human feedback / InstructGPT

  • 作者:Ouyang 等
  • 年份:2022
  • arXiv2203.02155
  • 章节:第10章
  • 本课使用方式:作为三阶段流程(SFT → RM → RLHF)的工程模板,解释「为什么需要人在回路」以及「为什么奖励模型只是近似」。本课不跑 InstructGPT 的真实训练,所有步骤只复述接口。
  • 本地绑定evidence/source-readback-official-v1.json

Proximal Policy Optimization Algorithms / PPO

  • 作者:Schulman 等
  • 年份:2017
  • arXiv1707.06347
  • 章节:第10章
  • 本课使用方式:作为 RLHF 管线的经典优化器与 GRPO 的对照基座,只取「clipped surrogate 限制每次策略更新幅度」的动机,讲清为什么需要信任区域。本课不跑 RL 训练,不实现 value model 与 GAE。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

第11章–第18章 检索、Agent 与评估

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

  • 作者:Lewis 等
  • 年份:2020
  • arXiv2005.11401
  • 章节:第11章
  • 本课使用方式:把 RAG 框架拆成「retriever + generator」两段,介绍何时引入检索、为什么生成端仍然需要 ground。我们不在本课复刻端到端 RAG 训练,所有讨论停留在接口契约层面。
  • 本地绑定evidence/source-readback-official-v1.json

ReAct: Synergizing Reasoning and Acting

  • 作者:Yao 等
  • 年份:2023
  • arXiv2210.03629
  • 章节:第13章
  • 本课使用方式:把 ReAct 当作「Thought / Action / Observation 交替循环」的工程模板,强调动作必须经过 schema 与 policy 验证。本课不复刻论文里 HotPotQA 的实验轨迹,只保留循环结构与终止条件。
  • 本地绑定evidence/source-readback-official-v1.json

Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

  • 作者:Zheng 等
  • 年份:2023
  • arXiv2306.05685
  • 章节:第18章
  • 本课使用方式:把「LLM-as-a-Judge」当作评估信号之一,明确它不能单独决定毕业或安全通过。我们不引用 MT-Bench 的具体评分,评估口径以本仓库固定的人工标签为准。
  • 本地绑定evidence/source-readback-official-v1.json

第12章–第17章 应用实战

Building effective agents(Anthropic 工程博客)

  • 作者:Anthropic(Schluntz、Zhang)
  • 年份:2024
  • arXiv:无(工程博客,anthropic.com/engineering/building-effective-agents
  • 章节:第16章
  • 本课使用方式:五种 workflow 模式(prompt chaining / routing / parallelization / orchestrator-workers / evaluator-optimizer)与「workflow(预定义代码路径)vs agent(模型自主循环)」决策边界的原始出处;第16章 把手写 loop 改造成 evaluator-optimizer 模式做对照。本课不引入 Anthropic SDK,只复用模式分类。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

MemGPT: Towards LLMs as Operating Systems

  • 作者:Packer 等
  • 年份:2023
  • arXiv2310.08560
  • 章节:第15章
  • 本课使用方式:作为「记忆 RAG / 画像记忆」一节的概念对照:OS 虚拟内存类比、模型通过 function call 自主分页(paging)。本课只实现穷人版事实记忆(dict + 关键词检索回注),不复刻 MemGPT 的分层内存管理器。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

CoALA: Cognitive Architectures for Language Agents

  • 作者:Sumers 等
  • 年份:2023
  • arXiv2309.02427
  • 章节:第15章
  • 本课使用方式:借其 semantic / episodic / procedural 记忆分类给 第15章 的四模式表提供术语框架(截断 / 摘要 / 记忆 RAG / 画像)。本课不实现完整认知架构,只做分类对照。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

第20章 专题阅读(第二梯队)

以下三篇是 第20章 DeepSeek 模型专题 的绑定论文;术语表 另有 MLA / MoE / GRPO / MTP 的 L1 动机级词条。

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

  • 作者:DeepSeek-AI
  • 年份:2024
  • arXiv2405.04434
  • 章节第20章(动机见 第9章 MQA/GQA 延伸)
  • 本课使用方式:MLA(低秩压缩 KV 缓存)与 DeepSeekMoE(细粒度专家)的原始出处;术语表保留「省 KV / 省算力」的 L1 动机词条,KV 缓存字节数定量对比在 第20章 展开。本课不复现其训练与基准。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

DeepSeek-V3 Technical Report

  • 作者:DeepSeek-AI
  • 年份:2024
  • arXiv2412.19437
  • 章节第20章
  • 本课使用方式:V3 架构三件套(MLA + MoE + MTP)与 aux-loss-free 负载均衡、FP8 训练的原始出处;术语表保留名词级动机词条,架构定量分析在 第20章 展开。本课不复现其训练管线。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

  • 作者:DeepSeek-AI
  • 年份:2025
  • arXiv2501.12948
  • 章节第20章(GRPO 雏形见 第10章 group normalized advantage fixture)
  • 本课使用方式:R1-Zero → 冷启动 → 多阶段 RL 的流程与语言一致性奖励的原始出处;GRPO 的 L1 动机级对照(vs PPO 省 value model)见术语表,toy 更新实现见 第20章。本课不跑 RL-for-reasoning 训练。
  • 本地绑定:—(未进 source readback 记录,仅保留公开链接;任何复制前需新增 source record)

选读

Chain-of-Thought Prompting

  • 作者:Wei 等
  • 年份:2022
  • arXiv2201.11903
  • 章节:第13章(选读)
  • 本课使用方式:作为「推理能力来自思维链而非新结构」的对照,提醒学员把 CoT 当作 prompt 工程而不是模型新能力。本课不在真实模型上跑 CoT benchmark。
  • 本地绑定evidence/source-readback-official-v1.json

GPTQ 与 AWQ(量化条目)

  • 作者:Frantar(GPTQ)/ Lin(AWQ) 等
  • 年份:2022 / 2023
  • arXiv2210.17323(GPTQ)、2306.00978(AWQ)
  • 章节:第9章(选读,可合并成一条量化条目)
  • 本课使用方式:把 GPTQ / AWQ 当作「训练后量化 + 权重重排序」的代表,说明精度 / 显存 / 推理吞吐之间的工程取舍。本课不加载任何压缩权重,仅在 第9章 把它们作为推理栈的术语参考。
  • 本地绑定evidence/source-readback-official-v1.json

阅读方法

  1. 先读论文 abstract + 结论表,再翻到本课对应章节:先确认论文解决了什么、本课用了哪一段。
  2. 关掉论文,用自己的话复述动机 + 接口 + 取舍;不要复述实验表格,也不要把作者的消融当作本课结论。
  3. 在本仓库对应章节找到对应实验,跑一遍本地测试,把现象写进自己的 evidence,而不是把论文数字当 evidence。
  4. 主动记下「论文没解决什么」:例如 Chinchilla 没解决推理成本、FlashAttention 没覆盖稀疏 attention、InstructGPT 没覆盖工具调用失败、DPO 没覆盖多轮偏好。任何一篇论文的「未解决」都会在本课其他章节里被再次提出。
  5. 复制行为前必须新增 source record、保留版权/许可证 notice,并取得人工发布决定;详见 参考资料读回

许可与边界

  • 本索引只做概念对照,不复制任何论文的正文、图表、公式图或权重。
  • 所有外部锚点与许可事实由只读 evidence 记录,不在站点内镜像论文资源。
  • 论文之外的资源(视频、课程、教材)见 资源总览
  • 详细许可证读回、source manifest、publication gate 状态见 参考资料读回

相关页面

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥