AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
直接偏好优化(DPO)
训练方法
预训练、微调与对齐技术
直接偏好优化(DPO)
直接从偏好数据优化策略、无需奖励模型的简化对齐方法。
DPO 把 RLHF 的奖励建模与强化学习合并为一步:用偏好对直接构造损失函数更新策略。实现简单、训练稳定,已成为开源社区最常用的对齐方法之一。
相关术语
基于人类反馈的强化学习(RLHF)
对齐
监督微调(SFT)