知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

BERT的预训练任务"掩码语言建模"(MLM)很简单:随机遮住15%的词让模型猜。但这个简单任务让BERT学会了双向理解上下文,在11个NLP基准上刷新纪录。BERT的发布引发了"刷榜"狂潮,2019年被称为"NLP的ImageNet时刻"。

来源:Devlin et al., "BERT: Pre-training of Deep Bidirectional Transformers", 2018

一句话总结
💡

BERT 使用仅编码器架构与掩码语言模型预训练,通过双向注意力获得深度上下文表示,擅长理解类任务。

常见误区

这些坑别踩

✗

误区 1

BERT 可以用来生成文本。

✓

正确理解

BERT 的 MLM 预训练不是自回归的,直接用于生成效果差,生成更适合 GPT 类模型。

✗

误区 2

预训练的掩码在真实场景也存在。

✓

正确理解

预训练用 [MASK] 但微调和推理时没有,存在预训练-微调偏差。

✗

误区 3

双向注意力意味着预测时能看到未来。

✓

正确理解

BERT 通过掩码预训练学习表示,推理时对每个位置用全部上下文编码,用于理解而非生成。