训练方法预训练、微调与对齐技术

监督微调(SFT)

用人工标注的「指令-回答」数据训练模型学会遵循指令。

监督微调(SFT)是让预训练模型「开口说话」的关键一步:通过高质量对话数据教会模型回答格式与任务行为,是 RLHF 之前的基础对齐手段。

相关术语