RLHF

技术原理

Reinforcement Learning from Human Feedback

简明定义

RLHF(人类反馈强化学习)是通过人类偏好反馈来优化AI模型行为的技术。训练过程:1)收集人类对AI回答的偏好数据;2)训练奖励模型;3)用强化学习优化AI模型以最大化奖励。这是ChatGPT、Claude对齐人类价值观的核心方法。