知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

Mixtral 8x7B有467亿总参数,但每次推理只激活约129亿——这就是混合专家(MoE)的魔力。模型有8个"专家",路由器每次只选2个,让模型拥有大容量却保持低推理成本。MoE被认为是下一代大模型的关键架构。

一句话总结
💡

MoE 将前馈网络替换为多个专家子网络,由门控按 token 动态选择少量专家计算,在固定计算量下扩大参数规模。

常见误区

这些坑别踩

✗

误区 1

MoE 让所有专家都参与每次计算。

✓

正确理解

稀疏 MoE 每次只激活 Top-k 个专家,以此实现以小算力驱动大参数。

✗

误区 2

专家各有专长领域。

✓

正确理解

专家的分工是数据驱动自动形成的,不一定是人类可解释的领域划分。

✗

误区 3

MoE 总参数虽大但显存需求小。

✓

正确理解

虽计算量少但所有专家参数都需驻留显存,显存占用仍按总参数计算。