模型架构Transformer、注意力与混合专家等模型结构

自回归

逐 Token 预测下一个 Token 的生成方式。

大语言模型多为自回归模型:每步把已生成内容作为输入预测下一个 Token,如此循环直到结束标记。这种方式天然支持条件生成与流式输出,但生成速度受限于串行解码。

相关术语