Skip to content

实验 08 · TinyGPT 端到端 — 训练、检查点与按配置恢复 ​

本实验将 Transformer Block 组装成具备完整自回归生成能力的微型 GPT 语言模型(TinyGPT)。验证三个核心物理契约:训练损失平稳收敛、按相同 config_hash 保存与恢复检查点无缝续跑、自回归生成循环逻辑自洽。


Google Colab Pro 云端全速预训练 ​

TinyGPT 的训练涉及大规模参数矩阵运算与反向传播。利用你的 Google Pro 会员挂载高性能 GPU(A100 / L4 / T4),可以直接在云端体验极速预训练:

Google Pro 云端实验

实验 08 · TinyGPT 端到端架构与预训练 Colab 实验场

⚡推荐规格:Google Pro A100 / L4 GPU (High-RAM)

点击一键在 Colab Pro 启动自回归训练循环,并可挂载 Google Drive 保存模型权重

💡 运行提示:若本仓库为 GitHub 私有仓库,首次在 Colab 打开时请在弹出的对话框中点击「Authorize with GitHub」授权读取;或直接点击「⬇️ 下载 .ipynb」并在 Colab 中选择「上传笔记本」运行。
🐍

实验 08 · TinyGPT 自回归生成循环

自回归 Next-Token 循环、Greedy 贪心选择与序列终止
↗ 独立演练台
Python 3行 1, 列 121 行 · 660 字符
运行:⌘ / Ctrl + ↵
就绪 (点击运行)
点击右上角「▶ 运行」或按 ⌘/Ctrl+Enter 在浏览器端直接执行

云端预训练实验指引 ​

  1. GPU 加速识别:进入 Notebook 后运行首个单元格,自动检测当前分配的 GPU 算力型号并开启 TF32 矩阵乘法加速。
  2. 端到端前向与损失收敛:观察 10 轮迭代内交叉熵损失从初始高位稳定下降的过程。
  3. 自回归生成(Text Generation):向模型输入提示词序列(Prompt Token),观察模型如何通过 generate() 方法按步采样生成后续文本。

本地动手实验与检查点对拍 ​

在云端理解整套预训练循环后,回到本地运行完整的模型实现与检查点恢复验证:

bash
cd <仓库根目录>
source .venv/bin/activate
export PYTHONPATH="$PWD/python"

# 运行 TinyGPT 完整自动化单测(训练、前向与生成)
pytest python/tests/test_tinygpt.py -v

下一步 ​

→ 返回第9章正文查看完整预训练理论与超参数配置
→ 进入实验 09:RoPE 旋转位置编码与 KV Cache 演进

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥