首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 中为什么需要 KL 散度惩罚约束?

RLHF 中为什么需要 KL 散度惩罚约束?

词条归属:RLHF

KL 散度惩罚是 RLHF 稳定训练的关键机制,用于防止策略在优化中偏离过远。

1. 衡量策略偏离程度

  • KL 散度用于度量强化学习后模型的输出分布,与 SFT 参考模型输出分布之间的差异
  • 差异越大,说明策略偏离原始语言能力越远

2. 抑制奖励黑客与语言退化

  • 若只追求奖励最大化,模型可能钻奖励模型的漏洞,输出"高分但无实质内容"的回答
  • 也可能坍塌到"高奖励但丧失语言能力"的退化分布
  • KL 惩罚项对过度偏离施加代价,把策略约束在参考模型附近,保留基础语言能力

3. 作为可调的约束强度

  • KL 惩罚系数是训练中最常调节的超参数之一,系数过低约束不足、过高则几乎不更新
  • 不同算法(如 PPO、GRPO)会以不同方式施加这一约束
相关文章
浅谈KL散度(相对熵)在用户画像中的应用
本文由CDA作者库成员Charlotte原创,并授权发布。 原文:http://www.cnblogs.com/charlotte77/p/5392052.html?from=timeline&isa
CDA数据分析师
2018-02-24
2K0
【原】浅谈KL散度(相对熵)在用户画像中的应用
  最近做用户画像,用到了KL散度,发现效果还是不错的,现跟大家分享一下,为了文章的易读性,不具体讲公式的计算,主要讲应用,不过公式也不复杂,具体可以看链接。   首先先介绍一下KL散度是啥。KL散度全称Kullback–Leibler divergence,也称为相对熵,信息增益,它是度量两个概率分布P与Q之间差异的一种不对称度量,可以看做是概率分布P到目标概率Q之间距离。一般情况下,P表示数据的真是分布,Q表示数据的理论分布,也可以理解为影响P分布的一种因素。计算公式为:                
Charlotte77
2018-01-09
1.7K0
深入解析强化学习中的自然策略梯度:信息几何视角下的Fisher信息矩阵与KL散度约束
在人工智能领域,强化学习(Reinforcement Learning, RL)作为机器学习的重要分支,近年来取得了突破性进展。与监督学习和无监督学习不同,强化学习的核心思想是通过智能体(Agent)与环境(Environment)的交互学习最优策略。智能体在每个时间步观察环境状态,采取行动,并根据环境反馈的奖励信号调整其行为策略,最终目标是最大化长期累积奖励。
用户6320865
2025-08-27
1.1K0
深入解析t-SNE中的困惑度参数与KL散度优化梯度推导
在机器学习领域,高维数据的可视化一直是极具挑战性的任务。传统线性降维方法如PCA(主成分分析)在处理复杂非线性数据结构时往往力不从心,而t-SNE(t-Distributed Stochastic Neighbor Embedding)算法的出现为解决这一难题提供了创新思路。这种由Laurens van der Maaten和Geoffrey Hinton于2008年提出的非线性降维技术,已经成为探索高维数据内在结构的利器。
用户6320865
2025-08-27
7260
从 KL 的方向看 SFT 与 RL:模型到底是在"学会做",还是在"学会选"
最近在看RL相关的几篇论文,发现和KL关联紧密,然后就深入看了下KL,Reverse KL与SFT,RL的对应关系,结合与ChatGPT的交互思考,整理文章如下。
小陡坡香菜
2026-05-19
3290
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券