KL 散度惩罚是 RLHF 稳定训练的关键机制,用于防止策略在优化中偏离过远。
1. 衡量策略偏离程度
- KL 散度用于度量强化学习后模型的输出分布,与 SFT 参考模型输出分布之间的差异
- 差异越大,说明策略偏离原始语言能力越远
2. 抑制奖励黑客与语言退化
- 若只追求奖励最大化,模型可能钻奖励模型的漏洞,输出"高分但无实质内容"的回答
- 也可能坍塌到"高奖励但丧失语言能力"的退化分布
- KL 惩罚项对过度偏离施加代价,把策略约束在参考模型附近,保留基础语言能力
3. 作为可调的约束强度
- KL 惩罚系数是训练中最常调节的超参数之一,系数过低约束不足、过高则几乎不更新
- 不同算法(如 PPO、GRPO)会以不同方式施加这一约束