训练方法预训练、微调与对齐技术

基于人类反馈的强化学习(RLHF)

用人类偏好反馈训练奖励模型、再优化策略的对齐方法。

RLHF 流程为:收集人类对模型回答的排序 → 训练奖励模型 → 用强化学习(如 PPO)更新策略。它能显著提升回答的有用性与安全性,是 ChatGPT 等产品成功的关键技术。

相关术语