🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉Mixtral 8x7B有467亿总参数,但每次推理只激活约129亿——这就是混合专家(MoE)的魔力。模型有8个"专家",路由器每次只选2个,让模型拥有大容量却保持低推理成本。MoE被认为是下一代大模型的关键架构。
一句话总结
💡
MoE 将前馈网络替换为多个专家子网络,由门控按 token 动态选择少量专家计算,在固定计算量下扩大参数规模。
常见误区
这些坑别踩
✗
误区 1
MoE 让所有专家都参与每次计算。
✓
正确理解
稀疏 MoE 每次只激活 Top-k 个专家,以此实现以小算力驱动大参数。
✗
误区 2
专家各有专长领域。
✓
正确理解
专家的分工是数据驱动自动形成的,不一定是人类可解释的领域划分。
✗
误区 3
MoE 总参数虽大但显存需求小。
✓
正确理解
虽计算量少但所有专家参数都需驻留显存,显存占用仍按总参数计算。