🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉DINO (自蒸馏) 让 ViT 学到了令人震惊的"语义分割"能力——尽管训练时从未给过任何分割标注。研究者发现 DINO 的注意力图自动把图像分成了不同的语义区域(如"狗"和"背景"),效果堪比监督训练的分割模型。更惊人的是,DINO 的注意力图和人类视觉注意力的模式高度相似——它学会了"看哪里",而不仅是"看到什么"。Meta 的研究者认为,这种能力可能来自自蒸馏中"教师网络"和"学生网络"的迭代演化——学生不断逼近一个更强大的自己。
来源:Caron et al., "Emerging Properties in Self-Supervised Vision Transformers", ICCV 2021
一句话总结
💡
DINO 用自蒸馏让 ViT 学到含语义分割的表征,SwAV 用在线聚类分配做对比,均无需负样本队列。
常见误区
这些坑别踩
✗
误区 1
DINO 是知识蒸馏因此需要教师标签。
✓
正确理解
DINO 是自蒸馏,教师和教师标签都来自模型自身,无外部标签。
✗
误区 2
SwAV 和 SimCLR 完全一样。
✓
正确理解
SwAV 用聚类分配替代逐对对比,计算更高效且不依赖大 batch 负样本。
✗
误区 3
DINO 学到的注意力图没用。
✓
正确理解
DINO 的自注意力图天然捕捉物体边界,可做无监督分割。