AILabox
校对于
2026-08-25
EN
◐
☰
模型价格
▾
LLM Token
视频生成
图片生成
套餐订阅
数据源
AI 工具
▾
AI 工具
AI 资源
▾
模型百科
AI 术语
AI 资讯
AI 术语库
/
直接偏好优化(DPO)
训练方法
预训练、微调与对齐技术
直接偏好优化(DPO)
直接从偏好数据优化策略、无需奖励模型的简化对齐方法。
DPO 把 RLHF 的奖励建模与强化学习合并为一步:用偏好对直接构造损失函数更新策略。实现简单、训练稳定,已成为开源社区最常用的对齐方法之一。
相关术语
基于人类反馈的强化学习(RLHF)
对齐
监督微调(SFT)