RLHF:基于人类反馈的强化学习
定义
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一套 post-training 流程:先收集人类对模型回答的比较、排序或示范,再训练 reward model 预测这些偏好,最后用强化学习或偏好优化方法更新模型策略。它不是单个算法,而是数据标注、训练、评估、安全审查和上线监控组成的工程系统。
为什么对 AI 求职重要
AI 公司重视 RLHF,因为前沿模型的可用性、安全性和指令遵循能力很大程度来自 post-training。懂 RLHF 的候选人能设计偏好数据管线、发现 reward hacking、搭建评估集、稳定训练过程,并把研究实验接到真实产品行为上;这对 alignment、agent、coding model、应用研究和模型行为团队都很关键。
核心概念
- 偏好数据:人类对多个回答做比较、排序、打分或给出示范,是 RLHF 的基础信号。
- 奖励模型:学习预测人类偏好的模型,用来给策略模型提供可优化的 reward。
- 策略优化:用 PPO、DPO 等方法更新模型,让输出更接近人类偏好。
- KL 约束:限制新模型偏离参考模型过远,降低训练发散和能力退化风险。
- Reward hacking:模型钻奖励模型空子,看似得分变高但真实质量或安全性下降。
- 评估闭环:用离线 eval、红队测试和线上监控确认优化是否真的改善用户任务。
学习路径
- 先用小模型做一次 instruction fine-tuning,理解监督式 post-training 的基本流程。
- 构造一个小型偏好数据集:同一 prompt 生成两个回答,人工选择更好的,并检查标注一致性。
- 使用 TRL 等库训练 reward model,或尝试 PPO、DPO 等偏好优化算法。
- 用任务 eval、安全 case 和回归测试比较训练前后效果,重点观察 reward hacking 和能力退化。
- 继续学习生产化问题:标注指南、数据质检、隐私、分布式训练成本、发布门禁和上线监控。