知了AI学习平台Logo知了
算法动画 · 神经网络

LSTM 门控机制动画

展示 LSTM 如何通过遗忘门、输入门、输出门三条门控回路精细控制细胞状态的读写与更新。

Long Short-Term Memory (LSTM)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
未激活·当前高亮(4 个元素)
1

LSTM 单元的核心是一条贯穿所有时间步的细胞状态 C_t(顶部水平线),它是信息的"传送带"。

第 1 步 / 共 617%
公式推导

LSTM门控: 遗忘门输入门输出门公式

从RNN的梯度消失问题出发,推导LSTM三个门控和细胞状态的更新公式。

第 1 / 617%
1

遗忘门

ft=σ(Wf⋅[ht−1,xt]+bf)f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f)
👉

关键部分

ft=σ(Wf⋅[ht−1,xt]+bf)f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f)

遗忘门决定从上一时刻细胞状态中保留多少信息,\sigma 输出0到1之间的值,1为完全保留,0为完全遗忘。

知识图谱

LSTM 长短期记忆网络

LSTM 通过三个门控机制解决 RNN 的梯度消失问题,能够捕捉长距离依赖关系。

门控门控门控核心输出改进自控制更新经过生成LSTM遗忘门输入门输出门细胞状态隐藏状态RNN
核心
概念
方法
应用
对比实验室

RNN vs LSTM vs GRU 对比

循环神经网络的三种主要变体,在处理长序列依赖方面能力不同。

对比项RNNLSTMGRU
门控数量无门控3个(遗忘/输入/输出)2个(重置/更新)
细胞状态无有(独立cell state)无(合并到hidden)
参数量最少最多中等(约为LSTM的3/4)⭐
长程依赖差(梯度消失)优秀⭐良好
训练速度最快最慢较快⭐
内存消耗最低最高中等
适用序列长度短序列(<20)长序列(>100)中长序列(20-100)
表现稳定性不稳定稳定稳定且高效⭐
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

LSTM的遗忘门初始偏置通常设为较大的正值(如1.0),让遗忘门默认处于"打开"状态——这鼓励信息在长序列中保持流动,是LSTM能学到长距离依赖的关键工程技巧。

💡
概念

LSTM的"细胞状态"像一条贯穿所有时间步的传送带,信息可以几乎无损地流动。三个门(遗忘门、输入门、输出门)像传送带上的检查站,决定什么信息该保留、什么该遗忘、什么该输出。

一句话总结
💡

LSTM通过输入门、遗忘门和输出门控制信息的读写,有效缓解RNN的梯度消失问题,适合学习长程依赖。

常见误区

这些坑别踩

✗

误区 1

LSTM完全解决了梯度消失问题。

✓

正确理解

LSTM显著缓解了梯度消失,能在更长的序列上保留信息,但并非完全解决,超长序列仍可能信息丢失,且梯度爆炸仍需梯度裁剪。

✗

误区 2

LSTM的三个门作用相同可以合并。

✓

正确理解

输入门、遗忘门、输出门各有不同功能:遗忘门决定丢弃什么、输入门决定写入什么、输出门决定输出什么,缺一不可,是LSTM有效性的关键。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

LSTM 引入门控机制主要是为了解决什么问题?

2

LSTM 的三个门分别是?

3

LSTM 中细胞状态(cell state)的作用是?

4

关于 LSTM 与普通 RNN 的区别,下列说法正确的是?

面试经典题

共 5 题 · 先思考再看答案

1
基础

请介绍 RNN 的基本原理及它适合处理的任务类型。

2
中等

RNN 为什么会出现梯度消失和梯度爆炸?

3
中等

请详细说明 LSTM 的结构及三个门的作用。

4
困难

比较 GRU 与 LSTM 的异同,各自有何优劣?

5
困难

LSTM 是如何从数学上缓解梯度消失的?请结合细胞状态分析。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺