你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
残差连接(Residual Connection)由何恺明在ResNet中提出,解决的是"网络越深反而越差"的退化问题。在Transformer中,残差连接像一条"高速公路",让梯度可以无损地直达浅层,是训练深层Transformer的关键。
来源:He et al., "Deep Residual Learning for Image Recognition", CVPR 2016
残差连接将输入直接加到输出缓解梯度消失,LayerNorm 对每个样本的特征维度归一化以稳定训练。
这些坑别踩
误区 1
LayerNorm 和 BatchNorm 作用相同可互换。
正确理解
BatchNorm 按批次维归一化依赖 batch 大小,LayerNorm 按特征维归一化不受 batch 影响,更适合序列模型。
误区 2
残差连接只是简单相加没意义。
正确理解
残差提供恒等映射路径,使深层网络梯度可回传,是训练深层 Transformer 的关键。
误区 3
Pre-Norm 和 Post-Norm 效果一样。
正确理解
Post-Norm(先残差后归一)更难训练但上限高,Pre-Norm 更易训练但可能略损精度。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
Transformer 中残差连接(Residual Connection)的主要作用是?
Transformer 为什么使用 LayerNorm 而非 BatchNorm?
LayerNorm 的计算方式是?
关于 Add&Norm 中的梯度流,下列描述正确的是?
面试经典题
共 4 题 · 先思考再看答案
解释 Transformer 中 Add&Norm 的作用,并说明残差连接与 LayerNorm 各自的贡献。
为什么 Transformer 用 LayerNorm 而不是 BatchNorm?请详细对比。
RMSNorm 与 LayerNorm 有什么区别?为什么一些大模型改用 RMSNorm?
在实际训练 Transformer 时,LayerNorm 有哪些常见变体与注意事项?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺