训练方法预训练、微调与对齐技术

PPO(近端策略优化)

RLHF 中常用的强化学习算法,通过裁剪更新幅度保持训练稳定。

PPO 是 RLHF 阶段优化策略的标准算法:它约束每次更新幅度,避免策略突变导致崩溃,并配合奖励模型与 KL 惩罚引导模型行为。

相关术语