知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

MAE (Masked Autoencoder) 的做法大胆到近乎"暴力"——随机遮住图像 75% 的 patch,让模型从剩下的 25% 重建。这个比例远高于 BERT 的 15%——因为图像的信息冗余度远高于文本(相邻像素高度相关),只遮 15% 太容易"猜"出来。遮 75% 后,模型必须真正理解图像的全局结构才能重建,而非简单插值。MAE 的另一个创新是编码器只处理可见 patch,被遮的 patch 用一个共享的占位符——这让训练速度提升了 3 倍以上,因为编码器的工作量直接减少了 75%。

来源:He et al., "Masked Autoencoders Are Scalable Vision Learners", CVPR 2022

一句话总结
💡

MAE 随机遮挡图像大部分 patch,让 ViT 编码器只处理可见部分并重建被遮挡像素,高效学习视觉表征。

常见误区

这些坑别踩

✗

误区 1

MAE 和 BERT 的 MLM 完全一样。

✓

正确理解

MAE 遮挡比例极高(75%)且编码器不处理被遮 patch,与 BERT 处理所有 token 不同。

✗

误区 2

重建像素不重要。

✓

正确理解

重建任务迫使模型理解图像整体结构和语义,是学习有效表征的关键。

✗

误区 3

MAE 的解码器和编码器一样重要。

✓

正确理解

解码器轻量且预训练后丢弃,重点是编码器表征。