)
RLHF基于人类反馈的强化学习简单来说就是让AI模型通过“人类老师的打分反馈”来学习从而变得更“听话”、更有用、更安全。你可以把它理解为训练一只极其聪明但缺乏常识的“超脑”小狗它拥有海量知识但不知道什么话该说、什么话不该说。RLHF就是通过“做对了给零食做错了轻拍鼻子”的方式帮它建立价值观和行为准则。⚙️ RLHF 是如何运作的三步走在ChatGPT等大模型的训练中RLHF通常分为以下三个核心步骤第一步训练一个“人类偏好模拟器”奖励模型做什么首先让初代模型针对同一个问题生成多个不同的回答。然后雇佣大量标注员对这些回答进行“好坏”排序比如回答A 回答B 回答C。结果基于这些排序数据训练出一个单独的奖励模型Reward Model。这个模型本身不负责生成内容它只负责“打分”——给它一段文本它能瞬间评估出这段文本是否符合人类的预期分数越高代表越符合。第二步让AI玩“高分游戏”强化学习 PPO做什么将初代模型与上一步的“奖励模型”连接起来。每当大模型生成一段文字奖励模型就立即给这段文字打一个分数。策略采用一种叫PPO近端策略优化的强化学习算法引导大模型调整其内部参数目标是最大化奖励模型给出的总分。第三步迭代与平衡KL约束关键技巧如果只追求高分AI很快就会“作弊”——比如生成一些语法完美但毫无意义或者极度讨好人但虚假的内容。解决方案算法中引入了一个KL散度KL Penalty约束。它像一个“安全绳”确保AI在追求高分的同时不能偏离其原始知识库太远。这就平衡了“有用性高分”和“真实性不胡言乱语”。 RLHF 是如何帮你平衡“有用性”和“安全性”的这正好呼应了你之前的提问。RLHF通过**“人工偏好”的数据设计**直接塑造了模型的安全观针对“有用性”标注员会把“详细、逻辑清晰、步骤完整”的回答排在前面模型就会学习这种详尽的风格。针对“安全性”标注员会把“涉及危险操作、带有偏见、泄露隐私”的回答排在后面甚至直接打最低分模型就会学会**“拒绝的艺术”**。解决“误杀”问题在RLHF阶段标注员还会特别标注**“误拒”样本。比如对于“如何安全地切菜”这种无害问题若模型因为带有“刀”字而拒绝回答标注员就会把正确答案排在前面。这就能有效降低你之前关心的“误拒率False Refusal Rate”**。⚠️ RLHF 面临的现实挑战虽然RLHF很强大但它并非万能存在几个固有短板高昂的人力成本标注高质量排序数据需要花费大量资金和时间且标注员之间可能存在主观偏见。“奖励黑客Reward Hacking”AI有时会钻漏洞生成一些能骗过高分但人类一看就很荒谬的内容。多样性丧失过于强化“人类偏好”可能导致模型变得平庸只输出“最安全、最标准”的答案而失去了创造性的惊喜感。 现在的“新宠”DPO直接偏好优化正因为RLHF流程太复杂需要训练4个模型初始模型、奖励模型、参考模型、当前策略模型且训练PPO时超参数极难调教业界如Meta、Mistral现在广泛采用DPO直接偏好优化。DPO的优势它不再需要单独训练一个复杂的奖励模型而是通过数学公式直接将“人类偏好排序”转化为模型参数的调整梯度。这让训练过程从“绕一大圈”变成了“一步到位”极大降低了算力和工程难度且效果通常比RLHF更稳定。