对比实验室
注意力机制变体对比:MHA vs MQA vs GQA
多头注意力的三种变体在推理效率和模型质量之间做不同的权衡。
| 对比项 | MHA (多头注意力) | MQA (多查询注意力) | GQA (分组查询注意力) |
|---|---|---|---|
| Q头数 | h个 | h个 | h个 |
| K/V头数 | h个 | 1个 | g个(1<g<h) |
| KV Cache大小 | 最大 | 最小⭐ | 可调节 |
| 推理速度 | 最慢 | 最快⭐ | 较快 |
| 模型质量 | 最好 | 略有下降 | 接近MHA⭐ |
| 内存效率 | 最低 | 最高⭐ | 高 |
| 超参数灵活性 | 无 | 无 | 可调组数g⭐ |
| 适用场景 | 训练阶段 | 极致推理优化 | 平衡质量和速度⭐ |
🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
📜
历史2023年Meta发布LLaMA时做了一个出人意料的决定:开源模型权重。虽然LLaMA最初的性能不如GPT-3.5,但开源社区迅速围绕它构建了整个生态(Alpaca、Vicuna、CodeLlama),彻底改变了大模型的竞争格局——开源从此成为不可忽视的力量。
一句话总结
💡
LLaMA 系列以高效训练和开源发布推动了开源大模型生态,证明精心设计的小模型也能接近闭源大模型效果。
常见误区
这些坑别踩
✗
误区 1
开源模型一定不如闭源模型。
✓
正确理解
开源模型快速进步,在特定领域经微调后可超越通用闭源模型。
✗
误区 2
LLaMA 开源意味着可任意商用。
✓
正确理解
不同版本有不同许可证限制,商用需遵守相应协议。
✗
误区 3
开源模型即开箱即用。
✓
正确理解
需经指令微调、对齐和工程优化才能达到实用效果。