🧊 前沿科技知识库
全部 / 人工智能(AI)

MoE 稀疏架构

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·基础原理 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

混合专家(Mixture of Experts, MoE)通过让网络的局部组件"条件性激活"来突破稠密模型的算力约束:一个 MoE 层拥有 N 个独立的 FFN(称为"专家")以及一个决定每个 token 使用哪些专家的小型路由器网络;对任一 token,只有 k 个专家被激活,其余不参与计算,因此模型可拥有远超单次前向所需参数量的总参数(Mixture of Experts (MoE) Models: Why They're Dominating 2025)。这种设计常被称为"稀疏激活"。

在 DeepSeek-R1、gpt-oss-120B 等 MoE 大模型中,token 先经过与稠密架构相同的自注意力模块,随后门控网络(gating network)检查注意力输出、选取目标专家子集并据此路由每个 token;这种稀疏路由在连续的 MoE 层中重复,逐步塑造模型的内部表示,直至产生最终输出(What Is Mixture of Experts? — NVIDIA Glossary)。到 2025 年,MoE 已成为高效扩展大语言模型的主导架构,Mixtral 8x7B、DeepSeek-V2 等均以 MoE 在控制推理成本的前提下实现巨大参数量(Product of Experts and Mixture of Experts)。

最新进展(2025–2026)

核心技术与关键概念

路由机制

Top-K 路由是标准策略:路由器(线性层 + softmax)为每个 token 选出得分最高的 k 个专家并加权组合其输出(Mixture of Experts (MoE) Explained、Mixtral of Experts)。DeepSeek 的路由机制用一个线性层把隐藏维度映射到 n 个路由专家,以按语义内容对每个 token 分别路由——专家是在 token 级别而非序列(或查询)级别选择的(DeepSeek Inference Theoretical Model)。

k 越大,每 token 计算越多、质量可能越好;k 越小越高效,但可能错过相关专家知识(Mixture of Experts (MoE) Explained)。

路由器通过梯度下降学习,因此路由是可变的、训练中会漂移,可能不稳定;若不加约束,路由器常收敛到只使用 8 个专家中的 2–3 个(MoE models: Mixtral, Llama 4, Qwen3)。在对 Mixtral 的分析中,路由器显示出可测量的专长倾向,例如 Python 关键词倾向于某些专家、数学术语倾向于另一些专家,这种专长并非人工编程,而是从训练中涌现(Chapter 30: Mixture of Experts)。

负载均衡损失

为防止"路由坍缩"(routing collapse,即少数专家被过度使用),多数生产级 MoE 实现引入辅助的负载均衡损失,以保持专家使用均衡(MoE models: Mixtral, Llama 4, Qwen3)。DeepSeek-V3 则提出无辅助损失的均衡策略,转向用偏置项等方式调节负载,以避免辅助损失带来的性能退化(DeepSeek-V3 Technical Report)。

专家并行与通信

MoE 训练依赖专家并行(Expert Parallelism, EP):需要 all-to-all 集合通信把 token 分派到其被分配的专家所在设备,再收集结果(Scalable Training of Mixture-of-Experts Models with Megatron Core)。每次 all-to-all 的每 GPU 发送量约为 T·K·h·(EP−1)/EP,其中 T 为本地 token 数、K 为 top-k、h 为隐藏维度,一次完整的 dispatch-and-combine 周期使通信量翻倍(Scalable Training of MoE Models with Megatron Core)。EP 过程通常分为三个阶段:先按专家对 token 做重排(dispatching),再以 All-to-All 在设备间交换 token 数据,使每个设备只收到本地专家所需的 token,随后各设备对自己的 token 批次做专家计算(MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core)。该工作还提出"MoE Parallel Folding",解耦注意力层与 MoE 层的并行方式,并使用五维混合并行(张量、专家、上下文、数据、流水并行)(MoE Parallel Folding)。

工程上,NVIDIA Megatron Core 提供多种 token dispatcher:标准 alltoall 基于 NCCL 进行 token 交换,适合常规 EP 场景;FlexDispatcher 配 DeepEP 后端可在跨节点通信时去除冗余 token、把节点内/间通信融合为单个 kernel,适合跨节点 EP 与细粒度 MoE(如 DeepSeek-V3)(Mixture of Experts (Megatron Core))。NVIDIA 的 Wide Expert Parallelism 在 NVL72 机架级系统上把专家分布到 8 个以上 GPU,以缓解 DeepSeek-R1(256 专家、671B 参数)等大模型的权重加载压力并提升 GroupGEMM 效率(Scaling Large MoE Models with Wide Expert Parallelism on NVL72 Rack Scale Systems)。

关键数据与评测结果

模型总参数每 token 激活路由配置
Mixtral 8x7B47B每 token 仅激活所选 2 个专家(远低于总参数)8 专家,top-2
DeepSeek-V3671B37B256 路由专家,top-8(含共享专家)
DeepSeek-V4-Flash284B13BDeepSeekMoE + MTP,1M 上下文
DeepSeek-V4-Pro1.6T49BDeepSeekMoE + MTP,1M 上下文
Llama 4 Scout109B17B16 专家
Llama 4 Maverick400B17B128 专家
gpt-oss-120b120B—默认 MXFP4 量化,可放入 80GB 内存

数据来源:Mixtral of Experts、Mixtral 8×7B 论文解读、DeepSeek-V3 Technical Report、DeepSeek V4 Technical Documentation、Intel Data Center AI Solutions Support Llama 4 Release、gpt-oss 介绍、Mixture of Experts (MoE) Explained。Mixtral 8x7B 以稀疏 MoE 在开源模型中超越了当时的 GPT-3.5 与 LLaMA 2 70B(Mixtral 8×7B 论文解读)。

趋势与争议

参考来源

← 长上下文技术:位置外推、稀疏注意力与状态空间模型MLOps 与 LLMOps →