🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
📜
历史BERT的预训练任务"掩码语言建模"(MLM)很简单:随机遮住15%的词让模型猜。但这个简单任务让BERT学会了双向理解上下文,在11个NLP基准上刷新纪录。BERT的发布引发了"刷榜"狂潮,2019年被称为"NLP的ImageNet时刻"。
来源:Devlin et al., "BERT: Pre-training of Deep Bidirectional Transformers", 2018
一句话总结
💡
BERT 使用仅编码器架构与掩码语言模型预训练,通过双向注意力获得深度上下文表示,擅长理解类任务。
常见误区
这些坑别踩
✗
误区 1
BERT 可以用来生成文本。
✓
正确理解
BERT 的 MLM 预训练不是自回归的,直接用于生成效果差,生成更适合 GPT 类模型。
✗
误区 2
预训练的掩码在真实场景也存在。
✓
正确理解
预训练用 [MASK] 但微调和推理时没有,存在预训练-微调偏差。
✗
误区 3
双向注意力意味着预测时能看到未来。
✓
正确理解
BERT 通过掩码预训练学习表示,推理时对每个位置用全部上下文编码,用于理解而非生成。