Skip to content

毕业口试、产品验收与总复习

使用时机:第1章 + 第3–19章完成后。两条互不替代的验收链:

  1. 课程产品链:自动化、Capstone、真实 headed Chrome、隐私和安全 evidence 是否足以发布前就绪。
  2. 学习者掌握链:学习者能否从空白接口手写、解释、定位故障并答辩;最终批准只能由人类作出。

边界:「已阅读」或「已运行」不等于「已掌握」。站点复选框最多记录阅读/尝试,不能推导 learner_graduation_approved=true

A. 证据包

每个章节模块都要有机器可读 manifest,至少包含:

yaml
module: 19-capstone
commit: <git-sha>
verified_at: <iso-date>
environment: <sanitized-os-python-device>
seed: <integer-or-not-applicable>
commands:
  - <reproducible-command>
metrics:
  - name: <metric-name>
    expected: <versioned-threshold>
    actual: <measured-value>
artifacts:
  - evidence/19/<relative-file>
cost:
  gross_usd: <number>
  credit_usd: <number>
licenses:
  - <source-version-license>
known_failures:
  - <sanitized-description>

规则:

  • commit、环境、seed/外部非确定性说明、命令、版本化阈值和实际值不可省略。
  • 只保存仓库相对路径;不得保存用户目录、服务器地址、项目号、账号标识、cookie、authorization header 或 token。
  • 失败也要记录;不能只保留绿色结果或用一次 API 成功代表稳定能力。
  • 本地确定性样例固定 seed 连续跑 3 次;外部模型固定参数至少跑 3 次,并报告均值、最差值和分歧。
  • eval-spec-v1 冻结后,样例、分母和 hash 不可静默改变;任何变更创建新版本、取得人类批准并完整重跑。

B. L3 clean-room 与故障题

不看教程实现,从空白接口完成 L3 主题组。七个主题组的具体接口和阈值以目标第 3 节及对应 evidence 为准:

  1. 标量计算图、链式法则、拓扑反传和共享节点梯度累加;
  2. Bigram/MLP、自回归概率、NLL/交叉熵、采样和真实参数更新;
  3. UTF-8/byte BPE、merge、特殊 token 和可逆 encode/decode;
  4. Tensor shape、scaled dot-product attention、causal mask、MHA、残差、Norm 和 Transformer Block;
  5. TinyGPT batch/训练循环、AdamW、梯度裁剪、checkpoint、恢复和生成;
  6. RoPE、prefill/decode、KV Cache、上下文边界和 full/cache 等价;
  7. 从空白骨架重建上述模型主链,并修复至少一个课程注入的 shape、mask、梯度、tokenizer 或 cache 故障。

每组必须同时满足:数值对拍或固定测试通过、故障前确实失败、修复后通过、能解释 shape/复杂度/失败原因。页面交互和单次 forward 不能替代这些证据。

C. 口试题(不看稿)

C1. 模型机制

  1. 一段 UTF-8 文本如何经过 tokenizer、embedding、Transformer、logits、softmax 和采样得到下一个 token?
  2. 用公式写出 scaled dot-product attention,并解释为什么要除以 (\sqrt{d_k})。
  3. causal mask 具体阻止了哪类信息泄漏?如何用未来 token 扰动测试它?
  4. 残差、LayerNorm/RMSNorm、FFN 和位置表示各自解决什么问题?
  5. BPE merge 如何改变序列长度?特殊 token 的边界为何是协议安全问题?
  6. 交叉熵与最大似然是什么关系?temperature、top-k 对分布做了什么?
  7. 为什么 TinyGPT 必须证明参数改变、loss 下降和 checkpoint 恢复,而不是只打印一个 loss?
  8. RoPE、prefill/decode 和 KV Cache 的 shape、复杂度和上下文边界是什么?

C2. 训练、Agent 与安全

  1. SFT assistant-only loss mask 为什么不能把 system、user、padding 一并监督?
  2. LoRA 和全量微调的参数/容量/灾难性遗忘取舍是什么?DPO 的 chosen、rejected、reference 各做什么?
  3. RAG 的 ACL 为什么必须在排名前过滤?如何分别测 recall、引用正确率和无依据断言率?
  4. typed tool 从模型输出到副作用之间有哪些 schema、policy、HITL、idempotency 和 checkpoint 边界?
  5. MCP 是协议边界还是权限边界?为什么 adapter 不能绕过 policy?
  6. 超时、重试、重复事件、参数篡改和跨会话批准如何恢复或拒绝?
  7. fixture/replay 证明了什么,不能证明什么?为什么 Judge 不能是唯一真相?
  8. 在 cloud eligibility 未核验、授权为 false 或成本估算过期时,系统应该做什么、不能声称什么?
  9. LangChain 的高层 agent 抽象与 LangGraph 的显式 state/graph 分别隐藏什么?哪些 schema、policy、HITL、幂等和 evidence 仍必须由应用自己证明?
  10. 从本地 TinyGPT 到真实 Google Cloud 小模型验证,哪一条 artifact chain 证据能把“本地通过”升级为“云训练/部署通过”?缺少哪一段时应保持什么状态?

D. Capstone 指标门槛

先冻结 eval-spec-v1,再实现 Capstone 逻辑。固定评估集至少 60 个不重复样例:20 个单工具任务、10 个多步任务、10 个 RAG 任务、10 个恢复故障、10 个安全攻击。两名独立 reviewer 使用同一 manifest 必须得到相同分母和通过结论。

首版最低阈值来自冻结的 eval/eval-spec-v1.yaml,测试后不得临时下调:

指标门槛
确定性任务成功率≥ 85%
工具 schema/参数合法率100%
引用正确率≥ 90%
无依据断言率≤ 5%
ACL/HITL 绕过数0
已定义故障的恢复率≥ 95%
Judge 与人工简单一致率≥ 80%,至少抽取 30 条并报告分歧

指标公式的分母必须固定;无工具调用不能让 schema 合法率通过,越权读取或副作用不能被“删除高风险工具”掩盖。性能报告同机 baseline 的 p50/p95、吞吐和成本,不设跨设备的虚假统一延迟目标。

E. 云与发布状态

定位:产品 evidence 的独立门禁,不替代学习者口试。

  • cloud_training_eligibility 只能是 eligibleunavailableunverified,来源是本人当天官方 UI 的脱敏核验。
  • 默认 route 是 cloud_run_job_cpu;Vertex T4 只有在 quota、价格、billing、最长时长和人类批准均满足时使用。
  • cloud_training_smoke_authorizedcloud_training_full_run_authorizedcloud_service_deploy_authorized 分别绑定 approval_id/operation_id,一次使用即失效。
  • 必须回读 dataset/config/tokenizer hash → Job execution ID → checkpoint/metrics → image digest → Service revision → authenticated generation comparison;同日清理并做 48 小时资源/账单回读。
  • 当前本地 dry-run、Python Job 入口、fixture Service、模拟 image/revision 和本地生成对拍只能证明适配器/合同;它们不产生 cloud_execution、IAM、真实账单或 48 小时清理 evidence。
  • 资格不可用或授权缺失时,模型原理和离线 harness 仍可验收,但 cloud_training_passed=falselive_capstone_passed=false 保持阻塞;本地 fixture 不能冒充云通过。

产品发布前就绪还需在本地 commit-specific preview 用 headed Chrome 完成完整旅程:第1章 → 学习路径 → attention/causal mask 与另一交互 → 刷新恢复 → Notebook/命令 → 论文/失败模式/evidence → Capstone/eval → 移动端/键盘/console/network/security。生产 URL 的 HTTPS 验收另需人类批准和 Phase E 证据。

F. 当前可执行回归

bash
export PYTHONPATH="$PWD/python"
pnpm test:labs
python -m pytest python/tests -q --tb=short
pnpm docs:build
pnpm verify

当前工作树验证(Python 3.14、规范安装含 PyTorch)为 139 passed;最新 exact-state clean clone 的 Python 3.11/Node 20/pnpm 9 完整执行结果以 evidence/clean-clone-snapshot-local-v3.json 本轮记录为准。这不等于 GitHub Actions、生产或云执行证据。缺依赖的环境不属于受支持基线。它不是全书毕业门;训练、Agent、eval、浏览器、云和人工学习者门禁仍必须分别满足对应 evidence。

G. 最终判定

课程产品只有在自动化、Capstone、真实浏览器、隐私/安全和必要的云 evidence 均通过后,才能由人类写入 course_product_w12_passed=true;生产发布还需独立的 commit/push、Actions、DNS、部署和公开范围授权。学习者只有在 C 组口试、B 组 clean-room/故障题和答辩全部由人类确认后,才能写入 learner_graduation_approved=true。任一状态都不得由 AI、构建成功或复选框自动宣称。

参考首页 · 环境准备 · 与应用站边界

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥