Appearance
实验 08 · TinyGPT 端到端 — 训练、检查点与按配置恢复
本实验将 Transformer Block 组装成具备完整自回归生成能力的微型 GPT 语言模型(TinyGPT)。验证三个核心物理契约:训练损失平稳收敛、按相同
config_hash保存与恢复检查点无缝续跑、自回归生成循环逻辑自洽。
Google Colab Pro 云端全速预训练
TinyGPT 的训练涉及大规模参数矩阵运算与反向传播。利用你的 Google Pro 会员挂载高性能 GPU(A100 / L4 / T4),可以直接在云端体验极速预训练:
推荐规格:Google Pro A100 / L4 GPU (High-RAM)
点击一键在 Colab Pro 启动自回归训练循环,并可挂载 Google Drive 保存模型权重
💡 运行提示:若本仓库为 GitHub 私有仓库,首次在 Colab 打开时请在弹出的对话框中点击「Authorize with GitHub」授权读取;或直接点击「⬇️ 下载 .ipynb」并在 Colab 中选择「上传笔记本」运行。
就绪 (点击运行)
点击右上角「▶ 运行」或按 ⌘/Ctrl+Enter 在浏览器端直接执行云端预训练实验指引
- GPU 加速识别:进入 Notebook 后运行首个单元格,自动检测当前分配的 GPU 算力型号并开启
TF32矩阵乘法加速。 - 端到端前向与损失收敛:观察 10 轮迭代内交叉熵损失从初始高位稳定下降的过程。
- 自回归生成(Text Generation):向模型输入提示词序列(Prompt Token),观察模型如何通过
generate()方法按步采样生成后续文本。
本地动手实验与检查点对拍
在云端理解整套预训练循环后,回到本地运行完整的模型实现与检查点恢复验证:
bash
cd <仓库根目录>
source .venv/bin/activate
export PYTHONPATH="$PWD/python"
# 运行 TinyGPT 完整自动化单测(训练、前向与生成)
pytest python/tests/test_tinygpt.py -v