🧊 前沿科技知识库
全部 / 人工智能(AI)

Transformer 架构原理

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·基础原理 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

Transformer 由 Vaswani 等人在 2017 年论文《Attention Is All You Need》中提出,是此后所有主流大语言模型的基础架构(The History of AI)。现代 LLM 的骨架可概括为"注意力 + FFN 的堆叠块"模式:GPT-4、Claude、Llama 4、DeepSeek-R1、Qwen3 等共享一批趋同的设计选择(What Changed? How Modern LLMs Evolved Beyond the Original Transformer)。

最新进展(2025–2026)

现代 LLM 相对原始 Transformer 的演进,集中在若干组件级的标准化上:

组件原始 Transformer现代 LLM
位置编码正弦式(Sinusoidal)RoPE(旋转位置编码)
归一化LayerNormRMSNorm
注意力头MHA(多头)GQA / MLA
激活函数ReLUSwiGLU
FFN 结构单一大 FFNMoE(稀疏混合专家)

上述选择在 GPT-4、Claude、Llama 4、DeepSeek-R1、Qwen3 中基本一致(What Changed? How Modern LLMs Evolved Beyond the Original Transformer)。一个具体案例是 Supernova 架构,它组合使用 RoPE 做位置编码、GQA(3:1 压缩比)降低显存带宽需求、RMSNorm 提升计算效率、SwiGLU 改善梯度流,并称这些组件协同可最大化每参数的效率(Supernova: Achieving More with Less in Transformer Architectures)。

2025–2026 年的两个显著走向是:(1)注意力机制向"混合"与"稀疏/线性替代"演进,以缓解长序列的二次复杂度;(2)FFN 层大规模稀疏化(MoE)以在固定推理算力下扩大参数池。代表案例包括 NVIDIA 的 Nemotron 3 Super——采用 Mamba-MoE 混合架构,512 个专家、top-22 路由(k=22),以 sigmoid 路由打分配合专家偏置,并用无辅助损失的负载均衡策略在 120.6B 参数上保证专家利用均衡(Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning);以及 MiniCPM-SALA,一个 9B 参数混合架构,按 1:3 比例交织稀疏注意力(InfLLM-V2)与线性注意力(Lightning Attention),并采用混合位置编码(HyPE)兼顾效率与长上下文性能(MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling)。

核心技术与关键概念

自注意力与多头注意力

自注意力(Self-Attention)的核心计算为 softmax(QKᵀ/√d_k)·V,其中 Query 表示"我在找什么",Key/Value 由序列中各 token 生成(KV-Caching in LLMs)。多头注意力(Multi-Head Attention, MHA)将其并行化为多个子空间,使模型可从不同表示子空间同时关注信息。现代模型为降低推理显存与带宽,普遍改用 GQA(Grouped Query Attention,多个查询头共享同一组 K/V)或 MLA(Multi-head Latent Attention),在效率与表示能力之间取舍(What Changed? How Modern LLMs Evolved、Supernova)。

位置编码与上下文扩展(RoPE / YaRN)

原始 Transformer 使用正弦式位置编码,现代模型转向 RoPE(Rotary Positional Embeddings),以更高效地编码位置(Supernova)。RoPE 把位置信息编码为对 Q/K 的旋转,但当推理序列超出训练时的最大长度时,旋转角度会落在训练未见过的范围,导致注意力权重失真、性能下降(Rotary Position Embeddings (RoPE) and Context Extension)。

YaRN(Yet another RoPE extensioN method)是系统化解决该问题的代表方法,其核心包括"NTK-by-parts"(按波长把维度分成三段分别处理)与"温度缩放"(对 softmax 前的 logits 施加全局温度,实践中通过把 √(1/t) 乘入 RoPE 的 cos/sin 缓存实现)(YaRN: Efficient Context Window Extension of Large Language Models、Long Context RoPE YaRN MLA Tutorial)。YaRN 通过选择性重标定旋转频率与注意力幅度来外推上下文,仅插值编码全局结构的低频维度、保留负责局部次序的高频分量(Analysing Extrapolation Capabilities of Modern Positional Embeddings)。

层归一化:Post-LN / Pre-LN / RMSNorm

归一化位置的演进尤为关键:

FFN、SwiGLU 与 MoE

FFN 层方面,激活函数从 ReLU 转向门控线性单元,主流为 SwiGLU(Swish-Gated Linear Unit),被认为可改善参数效率与梯度流(Architectural Evolution And Component Standardisation、Supernova)。

在超大模型中,单一稠密 FFN 常被稀疏 MoE 取代:以"许多更小的专家网络"替换一个大 FFN,每个 token 只激活少量专家,从而在扩大知识容量的同时付出线性级别的算力(Mixture-of-Experts (MoE) in DeepSeek)。以 DeepSeek-V3 为例,其主模型参数达 671B,但每个 token 的激活路径仅约 37B 参数,由一个学习到的路由器为每个 token 选择专家(Mixture of Experts DeepSeek: How MoE Models Work)。NVIDIA 的说明指出,在 DeepSeek-R1、gpt-oss-120B 等 MoE 模型中,token 先经过与稠密架构相同的自注意力块,随后才由门控网络选择专家子集并逐层路由(What Is Mixture of Experts?)。DeepSeek-V3 的专家路由可用"专家中心嵌入"与输入表示的相似度来理解(Unpacking DeepSeek-V3: From Architectural Renovations to Technical Innovations)。

注意力效率变体:滑动窗口、线性与混合

密集全连接注意力的复杂度随序列长度二次增长,因而出现多种高效替代(Efficient Transformers: Sparse Attention and Linear Attention):

KV cache

KV cache 是 Transformer 推理的基础优化:自回归生成时,已计算过的 token 的 Key/Value 不再变化,只有新 token 的 Query 是新的,因此缓存 K/V 可消除对历史表示的重复计算(KV-Caching in LLMs)。但其显存占用随上下文长度线性增长,当上下文从数千扩展到百万 token 时,会成为 GPU 显存容量、显存带宽与吞吐的首要瓶颈(KV Cache Optimization Strategies for Scalable and Efficient LLM Inference)。

2025–2026 年的应对手段包括量化与压缩:

三种变体

按注意力掩码与用途,可分为:

趋势与争议

参考来源

← 分词与嵌入视频生成与世界模型 →