Press⌘+Kto search
混合专家模型(MoE)
模型与量化MoE 模型把前馈层拆成多个"专家",每个 Token 只激活其中一小部分(如 Qwen3-30B-A3B 只激活 3B),从而用大参数的质量换来接近小模型的推理速度。
#为什么它又大又快
传统稠密模型每个 Token 都要过全部参数;MoE 由路由器为每个 Token 挑选最相关的 1-2 个专家。总参数量决定知识容量(30B、200B 都可以),激活参数量决定每步计算量。代价是:全部专家权重必须完整载入显存,但对显存的需求不能按激活参数估算。
#使用注意
- 显存估算按总参数量算,速度预期按激活参数量算
- MoE 模型通常带 "A" 标注激活量,如 30B-A3B、235B-A22B
- 专家分布不均时某些 GPU 利用率偏低,属正常现象
配套工具
理解了概念,用工具直接上手验证
本页目录
- #为什么它又大又快
- #使用注意
更新于 2026-10-02
#关于「混合专家模型(MoE)」的常见问题
MoE 模型把前馈层拆成多个"专家",每个 Token 只激活其中一小部分(如 Qwen3-30B-A3B 只激活 3B),从而用大参数的质量换来接近小模型的推理速度。
本词条属于模型与量化分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。