混合专家(mixture of experts, MoE)是让模型「纸面巨大、实际跑得起」的架构技巧。不同于每个 token 都要完整穿过的稠密权重块,MoE 模型把大部分容量拆成许多并行的专家(expert)——较小的子网络——再由一个轻量的**路由器(router)**为每个 token 挑选其中几个。结果是:一个总参数 1 万亿的模型,每个 token 只激活 300–400 亿——前沿级的知识容量,中型模型的算力开销。
路由怎么运作
在每个 MoE 层,路由器给所有专家打分,把 token 送进得分最高的几个(常见 64–256 个专家里选 2–8 个)。不同 token 走不同路径——这个流过对代码模式敏感的专家,下一个流过被数学语料喂出来的专家。「专家」是个宽松的比喻:分工不是人为指定的主题,而是训练中自发涌现的特化,路由器与专家一起学习。训练必须维持负载均衡(没人路由到的专家就是浪费的容量),这是个真实的工程难题——但大实验室已基本解决。
为什么成了主流
模型质量随参数量涨,而推理成本随激活参数量涨——MoE 把这两件事解耦了。这就是 2026 年多数前沿与准前沿 LLM 都是 MoE 的原因,也是最强开源权重模型的共同标签:DeepSeek V4 Pro(总参 ~1T / 激活 ~32B)、Kimi K2.7 Code(1T / 32B)、MiniMax M3(230B / 10B)全靠同一根杠杆——以此在价格上击穿稠密对手,同时咬住大部分质量。
代价在哪
算力折扣不覆盖显存:所有专家都必须驻留 VRAM,因为任何 token 都可能被路由到任何专家。万亿参数的 MoE 跑得快,但装下它仍需集群级硬件——自部署者通常给 MoE 配上量化来压缩体积。对 API 用户这笔交易是隐形的,你只看见结果——大模型的质量、小模型的价格,而这正是 MoE 的意义。