训练方法预训练、微调与对齐技术

直接偏好优化(DPO)

直接从偏好数据优化策略、无需奖励模型的简化对齐方法。

DPO 把 RLHF 的奖励建模与强化学习合并为一步:用偏好对直接构造损失函数更新策略。实现简单、训练稳定,已成为开源社区最常用的对齐方法之一。

相关术语