Skip to content

核心知识地图:学完你应掌握什么 ​

目标不是「背名词」,而是:能用自己的话讲清、能用代码写出、能迁移到工程决策。
本页定义 Learn LLM 的核心知识合同——主线覆盖的「所有关键细节」以这里为准;工业全景(集群、CUDA kernel、完整 RLHF 管线)刻意划为边界外。

一句话心智模型 ​

text
文本
 → 分词成 token ids(BPE)
 → 变成向量(embedding + 位置信息)
 → 多层 Transformer 用因果 Attention 混合上下文
 → 每个位置输出词表上的 logits → softmax → 下一 token 分布
 → 预训练用交叉熵逼近「真实下一 token」
 → 指令微调 / 偏好对齐改写「想要的行为」
 → 推理时用采样 + KV Cache 高效逐 token 生成
 → Harness 把模型嵌进工具循环(Agent)

你若能把这条链路手画一遍并指出每一步的张量形状与职责,就达到了本课的 0→1。

核心概念清单(必须掌握) ​

#概念你必须能做到主线关卡代码/实验
1计算图与反向传播手写标量 autograd;数值梯度校验第4章autograd.py / gradcheck.py
2下一 token 预测说明 LM 的本质是条件分布 P(xt|x<t)第5章bigram / MLP
3Softmax / Logits分数→概率;temperature 对尖峰的影响第5章, 第8章SoftmaxDemo
4交叉熵 Lossone-hot 下 = −log⁡pcorrect;训练方向第5章, 第9章CE 实现
5Embeddingtoken id → 向量;是可学习的查表第5章, 第8章blocks.embedding_lookup
6位置信息为何要位置编码;sinusoidal / 学习式 PE 直觉第7章, 第8章blocks / transformer.py
7BPE 分词merge 循环;encode/decode 往返;token≠词第6章bpe.py
8Scaled Dot-Product AttentionQK⊤/d + mask + 加权 V第8章attention.py / transformer.py
9因果 Mask位置 i 不能看未来;下三角第8章AttentionDemo
10多头 / GQA Attention多组 QKV 子空间再拼回;KV head 可分组第8章, 第10章transformer.py
11残差 + LayerNorm/RMSNormx+F(x) 与归一化稳定深度第7章, 第8章, 第10章blocks.py / transformer.py
12GPT 前向结构emb → N×(Attn+MLP) → lm_head → logits第8章, 第9章gpt.py / llm_train/model.py
13预训练循环teacher forcing;被监督位置与分母;文档拼接的三处开关;来源配比;梯度累积与被监督 token 计数;loss 下降;参数更新第9章llm_train/train.py
14优化器直觉SGD vs AdamW(动量、自适应、weight decay)第7章, 第9章optimizer.py
15采样greedy / temperature / top-k第5章, 第9章, 第10章train_sample.py
16SFT / assistant-only mask指令数据形态;只在 assistant token 监督;分母只数这些位置第11章post_training.py
17偏好对齐 DPOchosen vs rejected;相对 ref 的优势第11章post_training.py
18RoPE / KV Cache / 量化增量 decode 与 full 等价;质量/体积取舍第10章transformer.py / kv_cache.py
19上下文窗口长度限制来自位置/注意力/算力第10章失败策略与证据
20Harness / Agent模型只出分布;系统管工具与停止第15章agent_core/engine.py
21RAG / Embedding / Rerank先 ACL 再召回;引用可回链;未命中拒答第13章agent_core/rag.py
22Typed tools / MCPschema、风险矩阵和协议边界不能旁路第15章agent_core/mcp_adapter.py
23状态、幂等、HITL、恢复副作用前 checkpoint;批准绑定参数/会话/时限第15章agent_core/policy.py / state.py
24Eval / Judge / 帕累托选型固定分母、Judge 校准与准确率-成本-延迟帕累托前沿选型第21章eval/eval-spec-v1.yaml
25云 artifact chaindry-run → job → checkpoint → image → revision → 对拍第21章cloud_adapter/ / docs/cloud/
26真实检索链路真实 embedding;ACL 过滤内嵌 KNN;RRF 融合;阈值触发拒答第14章agent_core/rag_live.py
27真实 LLM API 消费messages 结构;SSE 半行缓冲;function calling 完整往返;退避限流第16章agent_core/gemini_roundtrip.py
28Prompt 工程与记忆四段式 system prompt;结构化输出三档;记忆四模式取舍第17章agent_core/prompts.py / memory.py
29框架映射手写 loop 逐件映射 StateGraph / checkpointer / interrupt第18章labs/langgraph_labs.py
30流式交付SSE 帧协议;行缓冲;流式 TextDecoder;partial JSON 增量渲染第19章labs/streaming_server.py
31DeepSeek 架构MLA 潜在注意力低秩压缩、矩阵吸收、解耦 RoPE;Aux-loss-free MoE(bias 纠偏机制);GRPO 组内优势计算 vs PPO;MTP 多 token 预测与投机解码;FP8 混合精度训练;R1 四阶段流程(Zeroshift → 冷启动 → RL → 蒸馏);MoE 推理 all-to-all 通信与 expert offloading第12章tests/test_deepseek_toys.py
32Multi-Agent 编排Orchestrator-Workers 模式;上下文隔离防污染;委派深度上限截断第20章agent_core/multi_agent.py
33表格 RL 基石(一般 MDP → 价值迭代 → 策略梯度)复述 Bellman 最优性两段式证明与策略梯度定理的方差缩减增强;Cliff Walk 上价值迭代对拍线性代数精确解、关 baseline 复现退化第11章, 第12章(延伸)rl_basics.py / clean_room/tabular_rl.py(第 9 模块,参考实现 tabular_rl_ref.py)/ RL 基础参考页
34分布式训练收拢(DP/TP/PP/ZeRO/专家并行)口述三大并行各自的通信原语与物理约束(通信频率决定位置);说出 ZeRO 三阶段各分片什么、每卡静态显存怎么记账;划清 FP8 训练侧与推理量化的边界(L1 收拢,不实现集群)第9章, 第12章(延伸)分布式训练收拢地图
35Manus 式 CodeAct 沙盒与长程上下文工程动态 Python 代码生成执行;沙盒隔离;错误自愈;历史 raw output 滚动折叠修剪第15章agent_core/codeact_sandbox_runner.py
36投机采样解码与调度加速Draft 模型推测 K 个 token;Target 模型单次前向并行矩阵乘验证;Chunked Prefill 消除 ITL 抖动第10章llm_core/speculative_decoding.py
37测试时计算扩展(TTC)与 PRM 搜索思考 Token 换取准确率;过程奖励模型(PRM)逐步评分与 MCTS 剪枝;RLVR 规则真值第12章llm_core/test_time_compute.py

第2章(Python 快速入门)与第3章(数学与张量思维直觉)是进入第4章反向传播的基础铺垫,属于面向工程背景学习者的平缓坡道,不单独计入上表核心概念清单。

刻意不包含(边界) ​

以下不在本课「核心必掌握」范围(了解名词即可,非考核):

  • 分布式训练 / 3D 并行 / 集群调度(散落第9/12章的概念点位已收拢为统一心智模型,见 分布式训练收拢地图——只讲原理与通信代价;集群工程实现仍在边界外)
  • 手写 CUDA kernel / FlashAttention 实现细节
  • 完整 PPO-RLHF 工业管线与大规模数据工程(读公式所需的 MDP、终止回报、一步 TD 残差与重要性采样在 第11章;组内基线在 第12章 与 术语表;表格 RL 基石——bandit 阶梯(单状态退化与探索-利用四装置)、一般 MDP、Bellman 最优性、价值迭代与策略梯度定理的一般形式——见 RL 基础参考页)
  • MoE 路由训练、MLA 论文级推导(L1 动机级词条见 术语表「DeepSeek 模型专题」,toy 记账实现与定量对比见 第12章;工业级训练管线仍在边界外)
  • 多模态、语音、视觉编码器内部

边界外内容不影响你「从 0 到 1 理解文本大模型如何工作」。

与付费/经典课程对齐 ​

来源本课如何映射
Karpathy Zero to Hero第4章 micrograd;第5–6章 makemore / tokenizer;第8–9章 GPT
Raschka LLMs from Scratch第6–9章 分词/注意力/预训练;第11章 指令微调直觉
Stanford CS224N 2026Transformer / 预训练 / 后训练与本课第8–11章同向;本课跳过其 RNN 前置要求——被跳过的前史在 序列建模前史 补齐
Stanford CS229/CS230 VIP cheatsheets(Amidi & Amidi)数学 refresher 与 DL 谱系按现代实践校准后吸收进 第3/7/21 章新小节与 序列建模前史;知识重述,不复制表格与图
Stanford CME295(Fall 2026)cheatsheet检索层形态参照,落地为本站 课程速查表(23 章检索层入口);on-policy distillation 主题指针见 第11章
Awesome-LLM milestone papers必读论文 按章绑定 Attention / GPT-3 / InstructGPT / DPO 等;BERT/ZeRO 留在 L1
Alammar Hands-On Large Language Models内部机制对应第8章;提示/RAG 对应第13–17章。本课把微调放在 RAG 之前,避免先调 API 再补原理
dive-into-llms第11 / 第10 章对齐与推理侧选修深化
前端工程师路径全程 parser / 依赖图 / 缓存 / 工具循环类比

参考实践绑定(读什么、产出什么) ​

参考资料不是第二套课程正文。学习者每次使用上游资料都应记录访问日、版本/commit、许可证状态和“本课原创产出”;未核验许可时只保留链接,不复制文字、图片、notebook 或代码。

参考本课绑定原创实践产物
Karpathy Zero to Hero:micrograd、makemore、minbpe、build-nanogpt、nanochat第4章–第11章:autograd → 字符 LM → BPE → GPT → conversation/loss mask;第10章/第11章 的性能和后训练只抽取问题,不接受成品移植clean-room 接口实现、故障前后 trace、shape/loss 对拍;第11章 另有固定集的遗忘/污染记录
Raschka · LLMs-from-scratch(Chapter 2–7、Chapter 7、Appendix E)第6章–第11章:文本数据、attention、GPT、预训练、指令微调和 LoRA 的结构对照只读章节/接口后独立实现;提交本课测试与自己的实验表,不复制书籍内容或上游实现
中文参考:LLMs-from-scratch-CN、dive-into-llms第6章–第20章:中文术语、章节导航、对齐/推理/Agent 复习问题;不是本课事实或 evidence 的来源替代将一个阅读问题改写为本课的 shape 草图、故障题或口试题;中文资料的示例结果不得冒充本仓库实测
Agent 框架官方文档:LangChain agents、LangGraph overview第15章与第18章:手写 typed tools/state/policy/recovery 后,再做可选抽象映射同一 fixture 的手写 trace 与隔离框架 trace 对照;框架依赖不进入课程默认基线,不能绕过 policy/HITL/幂等测试

第18章 框架对照的边界 ​

LangChain/LangGraph 是实现选择,不是知识目标或安全证明。课程要求学习者先能解释 state → schema → policy → checkpoint → executor,再回答:高层 agent abstraction 与显式 graph state 分别隐藏了什么;中断、批准、重试、持久化和 MCP transport 在哪里接入;哪些约束仍必须由应用 policy 和 evidence 自己维护。当前仓库曾在隔离 Python 3.11.14 环境固定 LangGraph 0.6.11,对同一确定性 fixture 完成四列语义对拍(evidence/13-framework-comparison-langgraph-v1.json)。那是历史对照快照。第18章动手 lab 的当前基线是 requirements-agent.txt 的 langgraph>=1.2,<2(实测 1.2.10),不要混装。这不把该包加入默认基线,也不替代 provider、性能或学习者证据。没有安装框架或没有外部模型时,仍可完成状态图/伪代码映射并明确标注“未实测”,不影响手写 harness gate。

Google Cloud 真实验证的边界 ​

云小模型不是“可选 demo”或本地 fixture 的别名。真实通过必须有独立的第1章当日资格 UI、一次性 smoke/full/deploy 授权,以及 dataset/config/tokenizer hash → Job execution ID → checkpoint/metrics → image digest → private service revision → authenticated generation → same-day cleanup → 48h billing readback 的完整回链。unverified、授权为 false、缺 execution/revision/IAM/账单任一项时,模型原理和离线 harness 仍可继续,但 cloud_training_passed=false、live_capstone_passed=false;不能用本地 loss、dry-run、模拟 service 或 credit 文案替代。

毕业标准(可自测) ​

正式验收标准(课程产品链 + 学习者掌握链的双链验收)以 毕业口试与总复习 为唯一权威页,本页不复述。这里只保留学习者的快速自测:不看答案能画出「从字符到生成」数据流,并标出至少 5 个关键 shape;能解释改 temperature、改 context、关掉 causal mask 各会怎样。个人经历对齐 只调整学习顺序,不降低任何课程或发布门禁。

→ 下一页:毕业口试 / 总复习

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥