DPO直接偏好优化

技术原理

Direct Preference Optimization

简明定义

DPO是一种替代RLHF的模型对齐技术。它直接从人类偏好数据中学习,无需先训练奖励模型再用强化学习,使对齐训练更简单、更稳定。2025-2026年被Claude、DeepSeek等主流模型广泛采用。