混合专家模型(MoE)

模型与量化

MoE 模型把前馈层拆成多个"专家",每个 Token 只激活其中一小部分(如 Qwen3-30B-A3B 只激活 3B),从而用大参数的质量换来接近小模型的推理速度。

#为什么它又大又快

传统稠密模型每个 Token 都要过全部参数;MoE 由路由器为每个 Token 挑选最相关的 1-2 个专家。总参数量决定知识容量(30B、200B 都可以),激活参数量决定每步计算量。代价是:全部专家权重必须完整载入显存,但对显存的需求不能按激活参数估算。

#使用注意

  • 显存估算按总参数量算,速度预期按激活参数量算
  • MoE 模型通常带 "A" 标注激活量,如 30B-A3B、235B-A22B
  • 专家分布不均时某些 GPU 利用率偏低,属正常现象

#关于「混合专家模型(MoE)」的常见问题

MoE 模型把前馈层拆成多个"专家",每个 Token 只激活其中一小部分(如 Qwen3-30B-A3B 只激活 3B),从而用大参数的质量换来接近小模型的推理速度。

本词条属于模型与量化分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具