🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉Transformer的前馈网络(FFN)把维度先扩大4倍再缩回,这个"先胖后瘦"的设计让模型有足够的容量做非线性变换。有趣的是,研究表明FFN起到了类似"键值存储"的作用,存储了大量的事实知识。
一句话总结
💡
前馈网络由两层线性变换夹激活函数组成,对每个位置独立进行非线性变换,扩展模型的表示能力。
常见误区
这些坑别踩
✗
误区 1
FFN 和注意力层功能重复。
✓
正确理解
注意力做跨位置信息混合,FFN 做位置内的非线性特征变换,二者互补。
✗
误区 2
FFN 的隐藏层维度应和模型维度相同。
✓
正确理解
FFN 隐藏维度通常是模型维度的 4 倍,以提供足够的非线性容量。
✗
误区 3
FFN 跨位置共享权重导致它无法建模上下文。
✓
正确理解
FFN 本就设计为位置独立,上下文建模交给注意力层,这是合理分工。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
Transformer 中的前馈网络(FFN)的结构是?
2
为什么 FFN 要先升维(d_model→4·d_model)再降维?
3
现代 Transformer(如 GPT、LLaMA)的 FFN 中常用的激活函数是?
4
关于 FFN 的"position-wise"特性,下列说法正确的是?
面试经典题
共 4 题 · 先思考再看答案
1
基础
描述 Transformer 前馈网络(FFN)的结构,并说明它在编码器/解码器中的作用。
2
中等
为什么 FFN 要升维到 4 倍 d_model?这个比例如何影响模型?
3
困难
比较 ReLU、GELU、SwiGLU 等激活函数在 FFN 中的表现。
4
中等
FFN 与自注意力在 Transformer 中如何分工?能否去掉 FFN?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺