推理部署推理性能、量化与成本优化

推理时扩展

通过增加推理时的计算投入换取更高质量输出的策略。

推理时扩展让模型在回答前进行更长的内部思考:生成多个候选再择优、反复自我检查等。它使小模型也能逼近大模型的表现,但 Token 消耗显著上升。

相关术语