Skip to content

MIT 6.5940 与 Learn LLM 覆盖差距审计(2026-10-04) ​

结论与边界 ​

本轮只吸收能直接提高文本 LLM 训练、压缩、推理或笔记本部署能力,并能在当前本地 CPU 环境形成 Explain / Perform / Debug / Transfer 证据的内容。MIT 6.5940 是覆盖高效 AI 系统的完整研究生课程,不是 Learn LLM 主线的替代目录。

审计后的首要缺口是高级权重量化:Learn LLM 原先只有 per-tensor 对称 INT8/INT4,clean_room/gptq.py 又没有进入正式合同。本轮将它闭环为真实打包的 group-wise INT4、校准 Hessian、逐列误差补偿、确定性测试、故障注入、课程正文和 evidence。NAS、MCUNet/TinyEngine、ViT、Diffusion 与生产级分布式训练保持排除;它们是未来 learn-efficient-ai 的候选,不扩张本课主线。

研究方法与时效边界 ​

  • 类型:课程覆盖审计 + 学习/原理掌握 + 实现路径。
  • 深度:deep;L0 官方课程页/目录、论文与官方项目源码,加本地 E 层测试。
  • 时间边界:2026-10-04。Fall 2026 的 Quantization (Part II) 已列在 9 月 29 日;“LLM Quantization and Deployment”排在 10 月 27 日,尚未发生,页面中的课件和视频仍是占位链接。因此 2026 只能支持主题与时间表事实,不能支持尚未发布的实验细节。
  • 版权边界:只保存链接、访问日期、commit 与精确定位;未复制 MIT slides、Notebook、视频、图、代码或模型权重。

可反向索引信源 ​

ID层级来源与精确定位取用范围许可/再分发
S1L0MIT HAN Lab, Fall 2026,About;Schedule L3–L15;Labs课程主题、2026 量化/LLM 部署日程、五个 lab 名称页面版权未作复制授权;link-only
S2L0MIT HAN Lab, Fall 2024,About;Schedule L3–L21;Labs2024 课程主题、LLM compression 与 laptop deployment lab页面版权未作复制授权;link-only
S3L0MIT 2026–2027 Catalog 6.5940,subject 6.5940官方课程范围与先修link-only
S4L4GPTQ paper, arXiv:2210.17323 v2,摘要与算法二阶近似、逐列量化与误差补偿机制citation-only
S5L0IST-DASLab/gptq,README 的 new features / licenseact-order、static-groups、实现边界;Apache-2.0 只作实现对照未复制代码;link-only
S6L4AWQ paper, arXiv:2306.00978 v6,摘要activation-aware weight-only 量化的对照边界citation-only
S7L0mit-han-lab/llm-awq,README 的 features / usageW4A16、group size 128、fake 与 real quantization 区分MIT 仓库;本课未复制代码/权重
E1Epython scripts/verify_gptq_gate.py --implementation reference本地 packed bytes 与校准输出误差课程原创 fixture
E2Epython scripts/verify_gptq_gate.py --implementation no-damping无阻尼错误实现被 gate 拒绝课程原创故障注入
E3Epython scripts/benchmark_gptq.py本机质量、体积与耗时;不外推到其他设备课程原创 fixture

MIT 主题 → 当前资产 → 决策矩阵 ​

MIT 主题Learn LLM 当前章节/代码/测试/evidence决策本轮可验证增量或边界
Basics of Deep Learning第2–9章;autograd、BPE、attention、TinyGPT 与训练测试保留已有更贴合文本 LLM 的主线,无需复制 MIT 基础课
Pruning and Sparsity第12章仅有概念提及;没有权重稀疏参考实现或内核延期NumPy mask 只能证明零值,不能证明真实延迟收益;未来需“小模型质量 + 稀疏存储/内核”闭环
Quantization I/II第10章原有 quantize_symmetric 与 2 个测试深化新增真实 packed group-wise INT4 与 metadata 字节统计
Knowledge Distillation第12章解释 logit/response distillation;无训练闭环仅文档覆盖,延期实现需要 teacher/student 训练与 held-out 迁移任务;本轮 ROI 低于量化孤儿闭环
Neural Architecture Search无主线实现排除与文本 LLM 当前终局无最小可靠增量;候选 learn-efficient-ai
MCUNet / TinyEngine无主线实现排除MCU 视觉模型和专用 runtime 不属于文本 LLM 本课主线
Transformer and LLM第8–12章;attention、TinyGPT、RoPE/KV、post-training保留当前覆盖深度已高于目录级吸收需求
LLM Quantization / Compression第10章原先只到 per-tensor;clean_room/gptq.py 合同外本轮实现python/llm_core/gptq.py、python/tests/test_gptq.py、第10章、clean-room 第8模块、故障 gate、evidence
LLM Deployment on Laptop有本地 CPU 实验、Notebook 导航与静态部署;无 packed kernel/大型权重延期不下载大型权重;教学 NumPy 路径明确不声称推理加速。未来需已授权小权重与真实 laptop kernel
LLM Post Training第11章 SFT/LoRA/DPO 与评估测试保留无需为 MIT 目录再建一套正文
Long Context LLM第10章 RoPE/KV/PagedKV/FlashAttention;第12章 MLA保留已有机制、故障与数值对拍
ViT / video / point cloud无主线实现排除非文本 LLM 终局;候选 learn-efficient-ai
Diffusion无主线实现排除非文本 LLM 终局;候选独立系列
Distributed training / gradient compressionREADME L1 与说明性边界;无生产实现排除用户明确不做生产级分布式训练
On-device fine-tuning第11章 LoRA 教学实现;没有真实端侧 runtime仅文档/局部代码覆盖保留 LoRA,不扩成设备矩阵或付费资源实验

首个纵向切片的能力合同 ​

  • Explain:说明 per-tensor 与 per-group scale 的误差来源;解释为什么校准 Hessian 需要阻尼;区分存储压缩与 kernel 加速。
  • Perform:把二维权重按输出行/输入列分组量化,两个 signed INT4 打包为一个 uint8,并恢复原列顺序。
  • Debug:在秩亏校准集上移除阻尼,观察 gate 失败,再恢复正阻尼通过。
  • Transfer:改变 group size、校准分布或打开 act-order,仍保持 shape、有限值、确定性和字节合同。
  • Delayed:从空白 clean_room/gptq.py 重建三个接口;自动通过后仍是 human-review-required。

实测与不能推出的结论 ​

固定 seed=5940 的小矩阵 gate 中,FP32 权重为 384 bytes,packed INT4 payload 为 48 bytes,含 per-row/per-group float32 scale 后为 144 bytes;同一校准 fixture 上,group-wise round-to-nearest output MSE 为 0.1801436422,GPTQ-style 顺序补偿为 0.1578135745。这些数字只描述该合成 fixture,不代表真实模型困惑度。

scripts/benchmark_gptq.py 另测 64×64 权重:FP32 16,384 bytes,对称 group-wise 与 GPTQ-style 都是 3,072 bytes(含 scale)。本机测得 GPTQ-style 量化比直接 group-wise 更慢;当前 NumPy 路径每次先反量化再矩阵乘,端到端也慢于直接 FP32 matmul。它证明了机制、质量与物理存储增量,没有 packed INT4 kernel,因此不声称吞吐提升。

闸门后 ROI 重算 ​

候选目标覆盖可验证性准备成本/风险决策
高级量化高:直接连接第10章与 laptop inference高:CPU、确定性、可注入故障低;无需外部权重已完成首切片
知识蒸馏中:压缩/训练中:需 teacher/student 与 held-out 任务中高;容易只得到 toy loss延期
模型剪枝/稀疏中:压缩低到中:无稀疏 kernel 时延迟结论弱高:质量恢复与硬件相关延期
本地笔记本部署高:终端任务直接当前低:需要模型权重、runtime 与真实设备路径高;大型下载与许可证/设备边界延期

继续堆叠后三项会降低本轮闭环质量,且不能在当前约束下同时形成真实质量、体积、性能与故障证据,因此本轮在高级量化切片完成后停止扩张。

反面证据与不确定性 ​

  • GPTQ 官方仓明确说明部分 3-bit kernel 只针对特定大模型/GPU 优化;算法压缩成功不能外推为任意硬件速度提升。[S5]
  • AWQ 官方使用区分 fake quantization evaluation 与 real quantized weights;只在浮点中模拟低比特不等于真实存储或内核部署。[S7]
  • 2026 第13讲尚未发生,课程页无法裁决最终 lab4 内容;2024 的公开课程页只支持 lab 名称和链接,不授予复制 Notebook 的权限。[S1][S2]
  • 本地 fixture 没有真实语言模型 perplexity,也没有 packed kernel。真实权重质量、跨设备吞吐、能耗和 laptop deployment 仍未验证。

检索日志 ​

渠道查询式原文日期命中采纳
Website:efficientml.ai 6.5940 Fall 2024 TinyML Efficient Deep Learning Computing syllabus2026-10-0410+1
Website:mit.edu 6.5940 Fall 2026 TinyML Efficient AI Computing2026-10-0410+2
Website:hanlab.mit.edu 6.5940 TinyML Efficient Deep Learning Computing 20242026-10-0410+2
Website:github.com mit-han-lab 6.5940 lab quantization pruning distillation2026-10-0410+2
GitHub CLIgh search repos "MIT 6.5940" --limit 102026-10-04100(只作 L2 反向扫描,不用学生仓裁决事实)
GitHub APIrepos/IST-DASLab/gptq;repos/mit-han-lab/llm-awq2026-10-0422

未使用搜索摘要支持实现语义;关键机制上溯到论文与官方源码仓,再由本地 E 层实验裁决当前实现行为。

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥