🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉MAE (Masked Autoencoder) 的做法大胆到近乎"暴力"——随机遮住图像 75% 的 patch,让模型从剩下的 25% 重建。这个比例远高于 BERT 的 15%——因为图像的信息冗余度远高于文本(相邻像素高度相关),只遮 15% 太容易"猜"出来。遮 75% 后,模型必须真正理解图像的全局结构才能重建,而非简单插值。MAE 的另一个创新是编码器只处理可见 patch,被遮的 patch 用一个共享的占位符——这让训练速度提升了 3 倍以上,因为编码器的工作量直接减少了 75%。
来源:He et al., "Masked Autoencoders Are Scalable Vision Learners", CVPR 2022
一句话总结
💡
MAE 随机遮挡图像大部分 patch,让 ViT 编码器只处理可见部分并重建被遮挡像素,高效学习视觉表征。
常见误区
这些坑别踩
✗
误区 1
MAE 和 BERT 的 MLM 完全一样。
✓
正确理解
MAE 遮挡比例极高(75%)且编码器不处理被遮 patch,与 BERT 处理所有 token 不同。
✗
误区 2
重建像素不重要。
✓
正确理解
重建任务迫使模型理解图像整体结构和语义,是学习有效表征的关键。
✗
误区 3
MAE 的解码器和编码器一样重要。
✓
正确理解
解码器轻量且预训练后丢弃,重点是编码器表征。