知了AI学习平台Logo知了
公式推导

ReLU导数: ReLU及其导数推导

从ReLU激活函数的定义出发,推导其分段导数,并讨论次梯度与Leaky ReLU变体。

第 1 / 617%
1

ReLU的定义

ReLU(x)=max⁡(0,x)\text{ReLU}(x) = \max(0, x)
👉

关键部分

max⁡(0,x)\max(0, x)

ReLU(修正线性单元)将负值置零、正值保持不变,是最常用的隐藏层激活函数。

代码沙盒

激活函数

使用 NumPy 实现常见激活函数并理解其特性。

📌 常见激活函数实现:Sigmoid、Tanh、ReLU、Leaky ReLU、GELU。

对比实验室

激活函数对比:Sigmoid vs Tanh vs ReLU vs GELU

不同激活函数在梯度特性、收敛速度和适用场景上有显著差异。

对比项SigmoidTanhReLUGELU
输出范围(0, 1)(-1, 1)[0, +inf)约(-0.17, +inf)
梯度消失严重较严重无(正区间)⭐无(正区间)
零中心化否是⭐否近似是
计算复杂度高(指数运算)高(指数运算)极低(max运算)⭐较高
神经元死亡不会不会会(负输入梯度为0)不会⭐
收敛速度慢较快快⭐快
适用场景二分类输出层浅层网络/隐藏层CNN/深层网络隐藏层Transformer/BERT/GPT
现代使用频率低低高高(大模型首选)⭐
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

ReLU函数(f(x)=max(0,x))看起来太简单了——它只是把负数变成零。但正是这个简单到近乎"粗暴"的函数解决了Sigmoid的梯度消失问题,成为深度学习革命的关键之一。

📜
历史

Sigmoid曾是最流行的激活函数,因为输出在(0,1)之间很优雅。但当网络变深时,Sigmoid的梯度在反向传播中反复乘以小于1的数,会指数级衰减——这就是著名的"梯度消失"问题。

一句话总结
💡

激活函数为神经网络引入非线性,常见有Sigmoid、Tanh、ReLU及其变体,选择影响训练效果和速度。

常见误区

这些坑别踩

✗

误区 1

激活函数可有可无,加上只是增加计算量。

✓

正确理解

没有激活函数,多层神经网络等价于单层线性变换,无法学习非线性关系,激活函数是深度网络能拟合复杂函数的关键。

✗

误区 2

Sigmoid是最好的激活函数。

✓

正确理解

Sigmoid在深层网络中易导致梯度消失且输出非零中心化,隐藏层普遍使用ReLU及其变体,Sigmoid主要用于输出层做二分类。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

ReLU 激活函数的主要优点是?

2

Sigmoid 函数的主要缺点是?

3

关于 tanh 激活函数,下列说法正确的是?

4

激活函数在神经网络中的核心作用是?

面试经典题

共 5 题 · 先思考再看答案

1
基础

请列举常见的激活函数及其特点。

2
中等

ReLU 的优缺点是什么?什么是"死神经元"问题?如何缓解?

3
中等

为什么神经网络需要激活函数?如果没有激活函数会怎样?

4
困难

梯度消失和梯度爆炸的成因是什么?激活函数在其中起什么作用?

5
困难

为什么深层网络隐层通常选择 ReLU 而不是 Sigmoid?请从梯度与训练效率角度分析。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺