知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

Transformer的前馈网络(FFN)把维度先扩大4倍再缩回,这个"先胖后瘦"的设计让模型有足够的容量做非线性变换。有趣的是,研究表明FFN起到了类似"键值存储"的作用,存储了大量的事实知识。

一句话总结
💡

前馈网络由两层线性变换夹激活函数组成,对每个位置独立进行非线性变换,扩展模型的表示能力。

常见误区

这些坑别踩

✗

误区 1

FFN 和注意力层功能重复。

✓

正确理解

注意力做跨位置信息混合,FFN 做位置内的非线性特征变换,二者互补。

✗

误区 2

FFN 的隐藏层维度应和模型维度相同。

✓

正确理解

FFN 隐藏维度通常是模型维度的 4 倍,以提供足够的非线性容量。

✗

误区 3

FFN 跨位置共享权重导致它无法建模上下文。

✓

正确理解

FFN 本就设计为位置独立,上下文建模交给注意力层,这是合理分工。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Transformer 中的前馈网络(FFN)的结构是?

2

为什么 FFN 要先升维(d_model→4·d_model)再降维?

3

现代 Transformer(如 GPT、LLaMA)的 FFN 中常用的激活函数是?

4

关于 FFN 的"position-wise"特性,下列说法正确的是?

面试经典题

共 4 题 · 先思考再看答案

1
基础

描述 Transformer 前馈网络(FFN)的结构,并说明它在编码器/解码器中的作用。

2
中等

为什么 FFN 要升维到 4 倍 d_model?这个比例如何影响模型?

3
困难

比较 ReLU、GELU、SwiGLU 等激活函数在 FFN 中的表现。

4
中等

FFN 与自注意力在 Transformer 中如何分工?能否去掉 FFN?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺