AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
PPO(近端策略优化)
训练方法
预训练、微调与对齐技术
PPO(近端策略优化)
RLHF 中常用的强化学习算法,通过裁剪更新幅度保持训练稳定。
PPO 是 RLHF 阶段优化策略的标准算法:它约束每次更新幅度,避免策略突变导致崩溃,并配合奖励模型与 KL 惩罚引导模型行为。
相关术语
基于人类反馈的强化学习(RLHF)
对齐