Skip to content

教程总览:全书 23 章 + 前沿专题 ​

面向会写前端/TypeScript、数学停留在高中水平的工程师。从环境与 Python/数学底座开始,逐章手写自动微分、分词器、注意力、Transformer、训练循环和推理缓存,再把模型能力接到 RAG、工具调用、评估和可恢复的 Agent 上。每一章都能在本地真实运行、真实验证。

全书借鉴专业技术专著的内容区块与章节展示逻辑,引入金字塔原理(结论先行、以上统下、层层嵌套),组织为 第 0 部分速查 + 六大核心内容区块 + 毕业后前沿研究专题,严格按照能力依赖单向递进,彻底消除任何跨块跳序:

  • 第 0 部分 · 核心术语与符号速查:建立数学符号、张量维度与前端概念的速查字典(30+ 条),消除术语黑话恐惧。
  • 第一大块 · 数学与工程底座(第 1–4 章):算力下限保障 + 现代 Python 与张量工程底座 + 核心数学符号速查 + 自动微分计算图。手写标量 Value 并通过数值差分对拍验证。
  • 第二大块 · 模型内核与 nanoGPT 手搓实战(第 5–9 章):Token 离散化 + 矩阵反传心法 + 5步注意力 + nanoGPT 预训练。在普通 CPU 上 1~3 分钟内让 Loss 从 4.17 降至 0.01。
  • 第三大块 · 推理加速、后训练与前沿架构(第 10–12 章):RoPE 旋转位置编码 + KV Cache 增量推理 + LoRA/DPO 微调 + DeepSeek 架构专题(MLA/MoE/GRPO)。
  • 第四大块 · 检索增强与 Agent 工业级落地(第 13–20 章):向量 RAG + 工业级 RAG 实战 + Typed Tools 工具调用 + 真实 API 调用 + 长短期记忆 + LangGraph 状态机编排 + 全栈流式交付 + Multi-Agent 多智能体协同。
  • 第五大块 · 评估、安全、云部署与毕业验收(第 21–22 章):LLM-as-a-Judge 裁判校准 + 红队注入防御 + Cloud Run 部署 + 毕业设计 Capstone 答辩。
  • 前沿研究专题 · 形式化验证与神经定理证明:Curry-Howard 同构 + Lean 4 交互证明状态 + AlphaProof 自博弈强化学习 + LeanDojo 引理检索 + 神经符号 Prover Agent。手写极简命题逻辑证明器,建立零逻辑幻觉的绝对真值闭环。
  • 前沿研究专题 · 强化学习理论基础:一般 MDP 与 Bellman 最优性两段式证明 + 价值迭代与线性代数精确解对拍 + MC→TD 估计谱系 + 策略梯度定理四步方差缩减 + AlphaGo 与 expert iteration。Cliff Walk 表格 REINFORCE 是全书唯一真实跑通的策略梯度训练循环。
  • 前沿研究专题 · 序列建模前史:RNN/LSTM/seq2seq 断点补齐——从固定窗口 MLP 到注意力机制的因果链(BPTT 梯度病根 → 门控修补 → 固定向量瓶颈 → Bahdanau attention),第8章每个设计决定的历史理由。读完第5章后随时可读。
  • 第六大块 · 毕业后的读法(第 23 章):把 Transformer 的每处设计还原成一次可推导的取舍——支撑集为什么必须分解、结构与灵活性如何权衡、哪条算子跨位置、多头为什么不是拷贝、因果掩码为什么是删除加重归一化、分词粒度如何变成账单。八条论证全部配可执行断言。
  • 检索层 · 课程速查表:23 章检索层——九域术语卡 + Remark + 高频故障速查,每条目以 → 链回承载推导与实验的章节锚点;是检索入口,不是正文替代品。

LEARNING PATH · 21 章 · 5 阶段

学习路径:每一章都有可交付的产物

按阶段顺序读;卡片上是本章拿得出手的产物,点开可看验证方式。

01

地基

环境、隐私与数学预备——先能跑,再能懂

02

模型原理

从自动微分到 TinyGPT:亲手造出并训练一个模型

03

Agent 系统

RAG、工具与真实 API——把模型接进真实系统

04

评估与毕业

冻结评估、云门禁、Capstone 与人类答辩

05

第二梯队 · 扩展专题

按兴趣选读:DeepSeek 模型专题与 Multi-Agent

第1章 · 基础

环境、隐私与权益准备

本地基线可跑;Google 权益必须由本人在 UI 核验

本章验证命令:pnpm verify

云端训练按钮不会在页面内发起请求;要进入 Google Cloud,必须先在第1章核验权益,再由人类分别批准 smoke、full run 和 service deploy。

每章怎么读 ​

每章使用同一份教案结构,读到任何一章都不会迷路:

  1. 本章目标:学完后你能做到什么——是可验证的行为,不是"了解"。
  2. 分阶段讲解:内容多的章会拆成若干阶段。每个概念先给直觉(前端类比 + 图示),再给最小数学(只用到高中数学,逐个符号解释),最后落到代码。
  3. 动手实验:可复制的命令和预期输出,全部在本地 CPU 上运行。
  4. 故障注入与预期信号:故意制造的错误长什么样、报什么错、怎么修。
  5. 本章验收:闭卷解释自测题 + 学习者提交模板。能不看资料答上来,才算这章过了。

页面上的勾选只表示"已阅读/已尝试",不代表掌握。掌握靠三件事证明:从空白接口独立写出实现、讲清每个 shape 和公式的含义、修好一个故意注入的故障。

章节总览 ​

章核心内容通过信号入口
第1章环境、隐私、浏览器、云权益与预算审计脱敏支持矩阵;云资格如实记录,三项云授权默认 false第1章 环境审计
第2章面向大模型的现代 Python 与张量工程底座f-string、列表推导式、Dunder 运算符重载、闭包与广播 keepdims第2章 现代 Python 底座
第3章大模型核心数学桥接与符号解码速查15 大数学符号字典、中心差商、点积余弦、SVD、Softmax稳定证明第3章 数学桥接速查
第4章自动微分、计算图、链式法则、有限差分对拍手写 Value 通过梯度数值对拍;修复梯度覆盖/累加错误第4章 自动微分
第5章Bigram→MLP、NLL/交叉熵、采样参数确实更新;训练/验证 loss 可解释第5章 概率语言模型
第6章UTF-8、byte 级 BPE、特殊 token、可逆性中英/emoji 文本编码解码往返一致第6章 BPE
第7章张量 shape、反向传播、初始化、LayerNorm、训练诊断shape contract 对拍;梯度/激活异常能定位原因第7章 训练稳定性
第8章scaled dot-product attention、causal mask、多头注意力、Transformer Block未来 token 不可见;head reshape、mask、残差消融有证据第8章 Transformer
第9章TinyGPT 预训练、过拟合、checkpoint、恢复、生成真实 backward/update;受控 loss 下降;恢复后 loss 一致第9章 TinyGPT
第10章RoPE、RMSNorm、MQA/GQA、prefill/decode、KV Cache、量化cache 与全量重算结果等价;性能比较记录环境与重复次数第10章 推理与量化
第11章SFT、assistant-only mask、LoRA、极小 DPOadapter/权重真实更新;base/SFT/LoRA/DPO 行为差异可复现第11章 后训练
第12章MLA/MoE/GRPO 记账规则 toy 复现、R1 思考链、MoE 推理通信、蒸馏与稀疏注意力KV 字节数手算与程序一致;router 坍缩纠偏对照;GRPO advantage 零均值单位方差第12章 DeepSeek 架构专题
第13章embedding、chunking、召回/rerank、引用、访问控制recall@k、引用正确率、无依据率;越权和注入被拒绝第13章 向量检索与 RAG 原理
第14章真实 embedding、混合检索、结构感知 chunking、最小评估集实战版 recall@5、引用正确率、拒答率达标第14章 工业级 RAG 实战
第15章typed tools、MCP、状态持久化、幂等、重试、人工介入schema 先验校验;批准前无副作用;中断后从 checkpoint 恢复第15章 Typed Tools 与 Agent
第16章真实 LLM API:messages、SSE 流式、function calling、退避限流离线回放测试全绿;live 路径如实标注未验证第16章 真实 LLM API 实战
第17章system prompt 结构、few-shot 边界、结构化输出、记忆模式golden 回归通过;记忆冲突决策序列确定第17章 Prompt 工程与记忆
第18章手写 loop 逐件映射 LangGraph、checkpointer、interrupt 语义同 fixture 对拍;故障版/修复版副作用次数实证第18章 生产编排 LangGraph 对拍
第19章SSE 帧协议、流式 fetch、TextDecoder、增量渲染帧格式/半行重组/乱码对照/中断测试全绿第19章 全栈流式交付与增量渲染
第20章orchestrator + 隔离 subagent、任务契约、结果合并、A2A 概念隔离断言全通过;委派循环被 depth limit 拦截第20章 Subagent 与 Multi-Agent 架构
第21章评估与 Judge 校准、trace、安全、容器化与云 smoke阈值在见结果前冻结;攻击/故障报告齐全第21章 严谨评估与受控云部署
第22章Capstone、clean-room 抽测、闭卷解释与答辩Safe Agent Harness 交付;人类毕业判定第22章 毕业设计 Capstone 与答辩
第23章支撑集论证、结构—灵活性权衡、逐位置/跨位置算子、多头、因果掩码重归一化、采样手术、分词粒度成本21 条断言全绿;支撑集与参数量差 4600 个数量级以上第23章 取舍的骨架

毕业后前沿研究专题推荐 ​

专题核心内容检验标志入口
前沿专题形式化验证、Lean 4、Curry-Howard 同构、AlphaProof 闭环、LeanDojo、神经符号推理极简命题证明器运行无误;合取交换律与假言推理 Q.E.D.;成功拦截注入的逻辑幻觉形式化验证与神经定理证明
前沿专题一般 MDP 与 Bellman 最优性、价值迭代与精确解对拍、MC→TD 谱系、策略梯度定理与方差缩减、AlphaGo 与 expert iterationCliff Walk 五级实验全绿:V*(start)=-13、迭代解与线性代数精确解对拍一致、关 baseline(同 seed)回报退化可复现强化学习理论基础:从 MDP 到策略梯度
前沿专题RNN/LSTM/GRU/seq2seq/Bahdanau attention 谱系、BPTT 梯度病根与门控修补、束搜索与 BLEU、与 Transformer 的血缘对照numpy 三级实验跑通(连乘稳定性 / 谱半径扫描 / BPTT 有限差分对拍);能讲清「为什么 Transformer 长这个样子」;血缘对照表逐行配对序列建模前史:从循环网络到注意力机制
前沿专题16Φ 三笔账与 MFU、DP/TP/PP 三并行心智模型与通信原语、ZeRO 三阶段每卡记账、expert parallelism 与 all-to-all、DualPipe、FP8 训练侧定位口述「通信频率决定物理位置」的取舍;写出 ZeRO-1/2/3 每卡静态显存;讲清梯度累积是数据并行的单机影子分布式训练收拢地图:三并行、ZeRO 与 MoE 集群
检索层23 章检索层:九域术语卡、结论式公式、判断支持型对照表与高频故障速查任一核心术语 30 秒内定位到深度小节;故障按症状找到机制与对应章课程速查表 · 九域检索索引

六大内容区块进阶阶梯 ​

  • 第一大块(第 1–4 章 · 数学与工程底座):环境可复现、工程底座打通、数学符号消解、Autograd 原理跑通。标志:Python 核心语法熟练对拍,手写 Value 通过数值差分对拍。
  • 第二大块(第 5–9 章 · 模型内核与 nanoGPT 手搓实战):自回归语言模型内核。标志:能从空白接口手写 BPE、注意力与 Transformer Block,在单机 CPU 上训练出 Loss 断崖式收敛的 TinyGPT,并讲清每一次张量 shape 变化。
  • 第三大块(第 10–12 章 · 推理加速、后训练与前沿架构):极致性能与指令对齐。标志:实现 KV Cache 使自回归生成提速 5 倍以上,完成 SFT/LoRA/DPO 参数更新,并透彻理解 DeepSeek MLA/MoE/GRPO 架构。
  • 第四大块(第 13–20 章 · 检索增强与 Agent 工业级落地):应用与智能体。标志:能交付带引用和访问控制的 RAG、具备 Checkpoint 恢复与 MCP 协议的 Agent,并实现全栈无乱码流式交付与 Multi-Agent 任务隔离。
  • 第五大块(第 21–22 章 · 评估、安全、云部署与毕业验收):工业级工程交付与毕业。标志:掌握 LLM-as-a-Judge 裁判校准与红队注入防御,完成 Capstone,通过 clean-room 抽测和口头答辩。
  • 第六大块(第 23 章 · 毕业后的读法):从「论文这么写」回到「不这么写会怎样」。标志:拿到任意架构改动能指出它落在结构—灵活性轴的哪一端、牺牲与换来了什么,并能区分自己能从头推一遍的部分与只记住了名字的部分。
  • 前沿研究专题(形式化验证与超人类推理):零幻觉数学与形式化闭环。标志:透彻理解 Lean 4 形式化验证与 AlphaProof 的 RL 编译器闭环,掌握 LeanDojo 与 DSP 神经符号范式,能手写命题逻辑验证器并在代码层面确定性拦截逻辑跳跃与幻觉。

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥