Appearance
把后训练三件事钉牢:SFT 的损失只由 assistant 区域贡献;LoRA 训练中 base 权重冻结;DPO 让 chosen 相对 rejected 的对数比单调上升。
→ 在第10章正文里查看完整命令、预期输出与故障注入