Skip to content

SFT 与对齐 — assistant 损失掩码、LoRA 适配、DPO 偏好对比

把后训练三件事钉牢:SFT 的损失只由 assistant 区域贡献;LoRA 训练中 base 权重冻结;DPO 让 chosen 相对 rejected 的对数比单调上升。

在第10章正文里查看完整命令、预期输出与故障注入

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥