Appearance
教程总览:全书 23 章 + 前沿专题
面向会写前端/TypeScript、数学停留在高中水平的工程师。从环境与 Python/数学底座开始,逐章手写自动微分、分词器、注意力、Transformer、训练循环和推理缓存,再把模型能力接到 RAG、工具调用、评估和可恢复的 Agent 上。每一章都能在本地真实运行、真实验证。
全书借鉴专业技术专著的内容区块与章节展示逻辑,引入金字塔原理(结论先行、以上统下、层层嵌套),组织为 第 0 部分速查 + 六大核心内容区块 + 毕业后前沿研究专题,严格按照能力依赖单向递进,彻底消除任何跨块跳序:
- 第 0 部分 · 核心术语与符号速查:建立数学符号、张量维度与前端概念的速查字典(30+ 条),消除术语黑话恐惧。
- 第一大块 · 数学与工程底座(第 1–4 章):算力下限保障 + 现代 Python 与张量工程底座 + 核心数学符号速查 + 自动微分计算图。手写标量
Value并通过数值差分对拍验证。 - 第二大块 · 模型内核与 nanoGPT 手搓实战(第 5–9 章):Token 离散化 + 矩阵反传心法 + 5步注意力 + nanoGPT 预训练。在普通 CPU 上 1~3 分钟内让 Loss 从 4.17 降至 0.01。
- 第三大块 · 推理加速、后训练与前沿架构(第 10–12 章):RoPE 旋转位置编码 + KV Cache 增量推理 + LoRA/DPO 微调 + DeepSeek 架构专题(MLA/MoE/GRPO)。
- 第四大块 · 检索增强与 Agent 工业级落地(第 13–20 章):向量 RAG + 工业级 RAG 实战 + Typed Tools 工具调用 + 真实 API 调用 + 长短期记忆 + LangGraph 状态机编排 + 全栈流式交付 + Multi-Agent 多智能体协同。
- 第五大块 · 评估、安全、云部署与毕业验收(第 21–22 章):LLM-as-a-Judge 裁判校准 + 红队注入防御 + Cloud Run 部署 + 毕业设计 Capstone 答辩。
- 前沿研究专题 · 形式化验证与神经定理证明:Curry-Howard 同构 + Lean 4 交互证明状态 + AlphaProof 自博弈强化学习 + LeanDojo 引理检索 + 神经符号 Prover Agent。手写极简命题逻辑证明器,建立零逻辑幻觉的绝对真值闭环。
- 前沿研究专题 · 强化学习理论基础:一般 MDP 与 Bellman 最优性两段式证明 + 价值迭代与线性代数精确解对拍 + MC→TD 估计谱系 + 策略梯度定理四步方差缩减 + AlphaGo 与 expert iteration。Cliff Walk 表格 REINFORCE 是全书唯一真实跑通的策略梯度训练循环。
- 前沿研究专题 · 序列建模前史:RNN/LSTM/seq2seq 断点补齐——从固定窗口 MLP 到注意力机制的因果链(BPTT 梯度病根 → 门控修补 → 固定向量瓶颈 → Bahdanau attention),第8章每个设计决定的历史理由。读完第5章后随时可读。
- 第六大块 · 毕业后的读法(第 23 章):把 Transformer 的每处设计还原成一次可推导的取舍——支撑集为什么必须分解、结构与灵活性如何权衡、哪条算子跨位置、多头为什么不是拷贝、因果掩码为什么是删除加重归一化、分词粒度如何变成账单。八条论证全部配可执行断言。
- 检索层 · 课程速查表:23 章检索层——九域术语卡 + Remark + 高频故障速查,每条目以
→链回承载推导与实验的章节锚点;是检索入口,不是正文替代品。
LEARNING PATH · 21 章 · 5 阶段
学习路径:每一章都有可交付的产物
按阶段顺序读;卡片上是本章拿得出手的产物,点开可看验证方式。
第1章 · 基础
环境、隐私与权益准备
本地基线可跑;Google 权益必须由本人在 UI 核验
本章验证命令:pnpm verify云端训练按钮不会在页面内发起请求;要进入 Google Cloud,必须先在第1章核验权益,再由人类分别批准 smoke、full run 和 service deploy。
每章怎么读
每章使用同一份教案结构,读到任何一章都不会迷路:
- 本章目标:学完后你能做到什么——是可验证的行为,不是"了解"。
- 分阶段讲解:内容多的章会拆成若干阶段。每个概念先给直觉(前端类比 + 图示),再给最小数学(只用到高中数学,逐个符号解释),最后落到代码。
- 动手实验:可复制的命令和预期输出,全部在本地 CPU 上运行。
- 故障注入与预期信号:故意制造的错误长什么样、报什么错、怎么修。
- 本章验收:闭卷解释自测题 + 学习者提交模板。能不看资料答上来,才算这章过了。
页面上的勾选只表示"已阅读/已尝试",不代表掌握。掌握靠三件事证明:从空白接口独立写出实现、讲清每个 shape 和公式的含义、修好一个故意注入的故障。
章节总览
| 章 | 核心内容 | 通过信号 | 入口 |
|---|---|---|---|
| 第1章 | 环境、隐私、浏览器、云权益与预算审计 | 脱敏支持矩阵;云资格如实记录,三项云授权默认 false | 第1章 环境审计 |
| 第2章 | 面向大模型的现代 Python 与张量工程底座 | f-string、列表推导式、Dunder 运算符重载、闭包与广播 keepdims | 第2章 现代 Python 底座 |
| 第3章 | 大模型核心数学桥接与符号解码速查 | 15 大数学符号字典、中心差商、点积余弦、SVD、Softmax稳定证明 | 第3章 数学桥接速查 |
| 第4章 | 自动微分、计算图、链式法则、有限差分对拍 | 手写 Value 通过梯度数值对拍;修复梯度覆盖/累加错误 | 第4章 自动微分 |
| 第5章 | Bigram→MLP、NLL/交叉熵、采样 | 参数确实更新;训练/验证 loss 可解释 | 第5章 概率语言模型 |
| 第6章 | UTF-8、byte 级 BPE、特殊 token、可逆性 | 中英/emoji 文本编码解码往返一致 | 第6章 BPE |
| 第7章 | 张量 shape、反向传播、初始化、LayerNorm、训练诊断 | shape contract 对拍;梯度/激活异常能定位原因 | 第7章 训练稳定性 |
| 第8章 | scaled dot-product attention、causal mask、多头注意力、Transformer Block | 未来 token 不可见;head reshape、mask、残差消融有证据 | 第8章 Transformer |
| 第9章 | TinyGPT 预训练、过拟合、checkpoint、恢复、生成 | 真实 backward/update;受控 loss 下降;恢复后 loss 一致 | 第9章 TinyGPT |
| 第10章 | RoPE、RMSNorm、MQA/GQA、prefill/decode、KV Cache、量化 | cache 与全量重算结果等价;性能比较记录环境与重复次数 | 第10章 推理与量化 |
| 第11章 | SFT、assistant-only mask、LoRA、极小 DPO | adapter/权重真实更新;base/SFT/LoRA/DPO 行为差异可复现 | 第11章 后训练 |
| 第12章 | MLA/MoE/GRPO 记账规则 toy 复现、R1 思考链、MoE 推理通信、蒸馏与稀疏注意力 | KV 字节数手算与程序一致;router 坍缩纠偏对照;GRPO advantage 零均值单位方差 | 第12章 DeepSeek 架构专题 |
| 第13章 | embedding、chunking、召回/rerank、引用、访问控制 | recall@k、引用正确率、无依据率;越权和注入被拒绝 | 第13章 向量检索与 RAG 原理 |
| 第14章 | 真实 embedding、混合检索、结构感知 chunking、最小评估集 | 实战版 recall@5、引用正确率、拒答率达标 | 第14章 工业级 RAG 实战 |
| 第15章 | typed tools、MCP、状态持久化、幂等、重试、人工介入 | schema 先验校验;批准前无副作用;中断后从 checkpoint 恢复 | 第15章 Typed Tools 与 Agent |
| 第16章 | 真实 LLM API:messages、SSE 流式、function calling、退避限流 | 离线回放测试全绿;live 路径如实标注未验证 | 第16章 真实 LLM API 实战 |
| 第17章 | system prompt 结构、few-shot 边界、结构化输出、记忆模式 | golden 回归通过;记忆冲突决策序列确定 | 第17章 Prompt 工程与记忆 |
| 第18章 | 手写 loop 逐件映射 LangGraph、checkpointer、interrupt 语义 | 同 fixture 对拍;故障版/修复版副作用次数实证 | 第18章 生产编排 LangGraph 对拍 |
| 第19章 | SSE 帧协议、流式 fetch、TextDecoder、增量渲染 | 帧格式/半行重组/乱码对照/中断测试全绿 | 第19章 全栈流式交付与增量渲染 |
| 第20章 | orchestrator + 隔离 subagent、任务契约、结果合并、A2A 概念 | 隔离断言全通过;委派循环被 depth limit 拦截 | 第20章 Subagent 与 Multi-Agent 架构 |
| 第21章 | 评估与 Judge 校准、trace、安全、容器化与云 smoke | 阈值在见结果前冻结;攻击/故障报告齐全 | 第21章 严谨评估与受控云部署 |
| 第22章 | Capstone、clean-room 抽测、闭卷解释与答辩 | Safe Agent Harness 交付;人类毕业判定 | 第22章 毕业设计 Capstone 与答辩 |
| 第23章 | 支撑集论证、结构—灵活性权衡、逐位置/跨位置算子、多头、因果掩码重归一化、采样手术、分词粒度成本 | 21 条断言全绿;支撑集与参数量差 4600 个数量级以上 | 第23章 取舍的骨架 |
毕业后前沿研究专题推荐
| 专题 | 核心内容 | 检验标志 | 入口 |
|---|---|---|---|
| 前沿专题 | 形式化验证、Lean 4、Curry-Howard 同构、AlphaProof 闭环、LeanDojo、神经符号推理 | 极简命题证明器运行无误;合取交换律与假言推理 Q.E.D.;成功拦截注入的逻辑幻觉 | 形式化验证与神经定理证明 |
| 前沿专题 | 一般 MDP 与 Bellman 最优性、价值迭代与精确解对拍、MC→TD 谱系、策略梯度定理与方差缩减、AlphaGo 与 expert iteration | Cliff Walk 五级实验全绿:V*(start)=-13、迭代解与线性代数精确解对拍一致、关 baseline(同 seed)回报退化可复现 | 强化学习理论基础:从 MDP 到策略梯度 |
| 前沿专题 | RNN/LSTM/GRU/seq2seq/Bahdanau attention 谱系、BPTT 梯度病根与门控修补、束搜索与 BLEU、与 Transformer 的血缘对照 | numpy 三级实验跑通(连乘稳定性 / 谱半径扫描 / BPTT 有限差分对拍);能讲清「为什么 Transformer 长这个样子」;血缘对照表逐行配对 | 序列建模前史:从循环网络到注意力机制 |
| 前沿专题 | 口述「通信频率决定物理位置」的取舍;写出 ZeRO-1/2/3 每卡静态显存;讲清梯度累积是数据并行的单机影子 | 分布式训练收拢地图:三并行、ZeRO 与 MoE 集群 | |
| 检索层 | 23 章检索层:九域术语卡、结论式公式、判断支持型对照表与高频故障速查 | 任一核心术语 30 秒内定位到深度小节;故障按症状找到机制与对应章 | 课程速查表 · 九域检索索引 |
六大内容区块进阶阶梯
- 第一大块(第 1–4 章 · 数学与工程底座):环境可复现、工程底座打通、数学符号消解、Autograd 原理跑通。标志:Python 核心语法熟练对拍,手写
Value通过数值差分对拍。 - 第二大块(第 5–9 章 · 模型内核与 nanoGPT 手搓实战):自回归语言模型内核。标志:能从空白接口手写 BPE、注意力与 Transformer Block,在单机 CPU 上训练出 Loss 断崖式收敛的 TinyGPT,并讲清每一次张量 shape 变化。
- 第三大块(第 10–12 章 · 推理加速、后训练与前沿架构):极致性能与指令对齐。标志:实现 KV Cache 使自回归生成提速 5 倍以上,完成 SFT/LoRA/DPO 参数更新,并透彻理解 DeepSeek MLA/MoE/GRPO 架构。
- 第四大块(第 13–20 章 · 检索增强与 Agent 工业级落地):应用与智能体。标志:能交付带引用和访问控制的 RAG、具备 Checkpoint 恢复与 MCP 协议的 Agent,并实现全栈无乱码流式交付与 Multi-Agent 任务隔离。
- 第五大块(第 21–22 章 · 评估、安全、云部署与毕业验收):工业级工程交付与毕业。标志:掌握 LLM-as-a-Judge 裁判校准与红队注入防御,完成 Capstone,通过 clean-room 抽测和口头答辩。
- 第六大块(第 23 章 · 毕业后的读法):从「论文这么写」回到「不这么写会怎样」。标志:拿到任意架构改动能指出它落在结构—灵活性轴的哪一端、牺牲与换来了什么,并能区分自己能从头推一遍的部分与只记住了名字的部分。
- 前沿研究专题(形式化验证与超人类推理):零幻觉数学与形式化闭环。标志:透彻理解 Lean 4 形式化验证与 AlphaProof 的 RL 编译器闭环,掌握 LeanDojo 与 DSP 神经符号范式,能手写命题逻辑验证器并在代码层面确定性拦截逻辑跳跃与幻觉。