模型架构Transformer、注意力与混合专家等模型结构

稀疏注意力

只计算部分 Token 对之间注意力的高效近似方案。

稀疏注意力通过局部窗口、全局锚点或聚类等策略跳过不重要的注意力计算,把长序列成本从平方级降下来。它是长上下文模型常用的加速手段之一。

相关术语