Appearance
MIT 6.5940 与 Learn LLM 覆盖差距审计(2026-10-04)
结论与边界
本轮只吸收能直接提高文本 LLM 训练、压缩、推理或笔记本部署能力,并能在当前本地 CPU 环境形成 Explain / Perform / Debug / Transfer 证据的内容。MIT 6.5940 是覆盖高效 AI 系统的完整研究生课程,不是 Learn LLM 主线的替代目录。
审计后的首要缺口是高级权重量化:Learn LLM 原先只有 per-tensor 对称 INT8/INT4,clean_room/gptq.py 又没有进入正式合同。本轮将它闭环为真实打包的 group-wise INT4、校准 Hessian、逐列误差补偿、确定性测试、故障注入、课程正文和 evidence。NAS、MCUNet/TinyEngine、ViT、Diffusion 与生产级分布式训练保持排除;它们是未来 learn-efficient-ai 的候选,不扩张本课主线。
研究方法与时效边界
- 类型:课程覆盖审计 + 学习/原理掌握 + 实现路径。
- 深度:deep;L0 官方课程页/目录、论文与官方项目源码,加本地 E 层测试。
- 时间边界:2026-10-04。Fall 2026 的 Quantization (Part II) 已列在 9 月 29 日;“LLM Quantization and Deployment”排在 10 月 27 日,尚未发生,页面中的课件和视频仍是占位链接。因此 2026 只能支持主题与时间表事实,不能支持尚未发布的实验细节。
- 版权边界:只保存链接、访问日期、commit 与精确定位;未复制 MIT slides、Notebook、视频、图、代码或模型权重。
可反向索引信源
| ID | 层级 | 来源与精确定位 | 取用范围 | 许可/再分发 |
|---|---|---|---|---|
| S1 | L0 | MIT HAN Lab, Fall 2026,About;Schedule L3–L15;Labs | 课程主题、2026 量化/LLM 部署日程、五个 lab 名称 | 页面版权未作复制授权;link-only |
| S2 | L0 | MIT HAN Lab, Fall 2024,About;Schedule L3–L21;Labs | 2024 课程主题、LLM compression 与 laptop deployment lab | 页面版权未作复制授权;link-only |
| S3 | L0 | MIT 2026–2027 Catalog 6.5940,subject 6.5940 | 官方课程范围与先修 | link-only |
| S4 | L4 | GPTQ paper, arXiv:2210.17323 v2,摘要与算法 | 二阶近似、逐列量化与误差补偿机制 | citation-only |
| S5 | L0 | IST-DASLab/gptq,README 的 new features / license | act-order、static-groups、实现边界;Apache-2.0 只作实现对照 | 未复制代码;link-only |
| S6 | L4 | AWQ paper, arXiv:2306.00978 v6,摘要 | activation-aware weight-only 量化的对照边界 | citation-only |
| S7 | L0 | mit-han-lab/llm-awq,README 的 features / usage | W4A16、group size 128、fake 与 real quantization 区分 | MIT 仓库;本课未复制代码/权重 |
| E1 | E | python scripts/verify_gptq_gate.py --implementation reference | 本地 packed bytes 与校准输出误差 | 课程原创 fixture |
| E2 | E | python scripts/verify_gptq_gate.py --implementation no-damping | 无阻尼错误实现被 gate 拒绝 | 课程原创故障注入 |
| E3 | E | python scripts/benchmark_gptq.py | 本机质量、体积与耗时;不外推到其他设备 | 课程原创 fixture |
MIT 主题 → 当前资产 → 决策矩阵
| MIT 主题 | Learn LLM 当前章节/代码/测试/evidence | 决策 | 本轮可验证增量或边界 |
|---|---|---|---|
| Basics of Deep Learning | 第2–9章;autograd、BPE、attention、TinyGPT 与训练测试 | 保留 | 已有更贴合文本 LLM 的主线,无需复制 MIT 基础课 |
| Pruning and Sparsity | 第12章仅有概念提及;没有权重稀疏参考实现或内核 | 延期 | NumPy mask 只能证明零值,不能证明真实延迟收益;未来需“小模型质量 + 稀疏存储/内核”闭环 |
| Quantization I/II | 第10章原有 quantize_symmetric 与 2 个测试 | 深化 | 新增真实 packed group-wise INT4 与 metadata 字节统计 |
| Knowledge Distillation | 第12章解释 logit/response distillation;无训练闭环 | 仅文档覆盖,延期实现 | 需要 teacher/student 训练与 held-out 迁移任务;本轮 ROI 低于量化孤儿闭环 |
| Neural Architecture Search | 无主线实现 | 排除 | 与文本 LLM 当前终局无最小可靠增量;候选 learn-efficient-ai |
| MCUNet / TinyEngine | 无主线实现 | 排除 | MCU 视觉模型和专用 runtime 不属于文本 LLM 本课主线 |
| Transformer and LLM | 第8–12章;attention、TinyGPT、RoPE/KV、post-training | 保留 | 当前覆盖深度已高于目录级吸收需求 |
| LLM Quantization / Compression | 第10章原先只到 per-tensor;clean_room/gptq.py 合同外 | 本轮实现 | python/llm_core/gptq.py、python/tests/test_gptq.py、第10章、clean-room 第8模块、故障 gate、evidence |
| LLM Deployment on Laptop | 有本地 CPU 实验、Notebook 导航与静态部署;无 packed kernel/大型权重 | 延期 | 不下载大型权重;教学 NumPy 路径明确不声称推理加速。未来需已授权小权重与真实 laptop kernel |
| LLM Post Training | 第11章 SFT/LoRA/DPO 与评估测试 | 保留 | 无需为 MIT 目录再建一套正文 |
| Long Context LLM | 第10章 RoPE/KV/PagedKV/FlashAttention;第12章 MLA | 保留 | 已有机制、故障与数值对拍 |
| ViT / video / point cloud | 无主线实现 | 排除 | 非文本 LLM 终局;候选 learn-efficient-ai |
| Diffusion | 无主线实现 | 排除 | 非文本 LLM 终局;候选独立系列 |
| Distributed training / gradient compression | README L1 与说明性边界;无生产实现 | 排除 | 用户明确不做生产级分布式训练 |
| On-device fine-tuning | 第11章 LoRA 教学实现;没有真实端侧 runtime | 仅文档/局部代码覆盖 | 保留 LoRA,不扩成设备矩阵或付费资源实验 |
首个纵向切片的能力合同
- Explain:说明 per-tensor 与 per-group scale 的误差来源;解释为什么校准 Hessian 需要阻尼;区分存储压缩与 kernel 加速。
- Perform:把二维权重按输出行/输入列分组量化,两个 signed INT4 打包为一个
uint8,并恢复原列顺序。 - Debug:在秩亏校准集上移除阻尼,观察 gate 失败,再恢复正阻尼通过。
- Transfer:改变 group size、校准分布或打开 act-order,仍保持 shape、有限值、确定性和字节合同。
- Delayed:从空白
clean_room/gptq.py重建三个接口;自动通过后仍是human-review-required。
实测与不能推出的结论
固定 seed=5940 的小矩阵 gate 中,FP32 权重为 384 bytes,packed INT4 payload 为 48 bytes,含 per-row/per-group float32 scale 后为 144 bytes;同一校准 fixture 上,group-wise round-to-nearest output MSE 为 0.1801436422,GPTQ-style 顺序补偿为 0.1578135745。这些数字只描述该合成 fixture,不代表真实模型困惑度。
scripts/benchmark_gptq.py 另测 64×64 权重:FP32 16,384 bytes,对称 group-wise 与 GPTQ-style 都是 3,072 bytes(含 scale)。本机测得 GPTQ-style 量化比直接 group-wise 更慢;当前 NumPy 路径每次先反量化再矩阵乘,端到端也慢于直接 FP32 matmul。它证明了机制、质量与物理存储增量,没有 packed INT4 kernel,因此不声称吞吐提升。
闸门后 ROI 重算
| 候选 | 目标覆盖 | 可验证性 | 准备成本/风险 | 决策 |
|---|---|---|---|---|
| 高级量化 | 高:直接连接第10章与 laptop inference | 高:CPU、确定性、可注入故障 | 低;无需外部权重 | 已完成首切片 |
| 知识蒸馏 | 中:压缩/训练 | 中:需 teacher/student 与 held-out 任务 | 中高;容易只得到 toy loss | 延期 |
| 模型剪枝/稀疏 | 中:压缩 | 低到中:无稀疏 kernel 时延迟结论弱 | 高:质量恢复与硬件相关 | 延期 |
| 本地笔记本部署 | 高:终端任务直接 | 当前低:需要模型权重、runtime 与真实设备路径 | 高;大型下载与许可证/设备边界 | 延期 |
继续堆叠后三项会降低本轮闭环质量,且不能在当前约束下同时形成真实质量、体积、性能与故障证据,因此本轮在高级量化切片完成后停止扩张。
反面证据与不确定性
- GPTQ 官方仓明确说明部分 3-bit kernel 只针对特定大模型/GPU 优化;算法压缩成功不能外推为任意硬件速度提升。[S5]
- AWQ 官方使用区分 fake quantization evaluation 与 real quantized weights;只在浮点中模拟低比特不等于真实存储或内核部署。[S7]
- 2026 第13讲尚未发生,课程页无法裁决最终 lab4 内容;2024 的公开课程页只支持 lab 名称和链接,不授予复制 Notebook 的权限。[S1][S2]
- 本地 fixture 没有真实语言模型 perplexity,也没有 packed kernel。真实权重质量、跨设备吞吐、能耗和 laptop deployment 仍未验证。
检索日志
| 渠道 | 查询式原文 | 日期 | 命中 | 采纳 |
|---|---|---|---|---|
| Web | site:efficientml.ai 6.5940 Fall 2024 TinyML Efficient Deep Learning Computing syllabus | 2026-10-04 | 10+ | 1 |
| Web | site:mit.edu 6.5940 Fall 2026 TinyML Efficient AI Computing | 2026-10-04 | 10+ | 2 |
| Web | site:hanlab.mit.edu 6.5940 TinyML Efficient Deep Learning Computing 2024 | 2026-10-04 | 10+ | 2 |
| Web | site:github.com mit-han-lab 6.5940 lab quantization pruning distillation | 2026-10-04 | 10+ | 2 |
| GitHub CLI | gh search repos "MIT 6.5940" --limit 10 | 2026-10-04 | 10 | 0(只作 L2 反向扫描,不用学生仓裁决事实) |
| GitHub API | repos/IST-DASLab/gptq;repos/mit-han-lab/llm-awq | 2026-10-04 | 2 | 2 |
未使用搜索摘要支持实现语义;关键机制上溯到论文与官方源码仓,再由本地 E 层实验裁决当前实现行为。