模型架构Transformer、注意力与混合专家等模型结构

Transformer 架构

基于自注意力机制的神经网络架构,现代大语言模型的基础。

Transformer 于 2017 年提出,用自注意力替代循环结构,支持并行训练并擅长捕捉长距离依赖。此后几乎所有主流大模型(GPT、Claude、Gemini、DeepSeek)都基于该架构或其变体。

相关术语