知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

DINO (自蒸馏) 让 ViT 学到了令人震惊的"语义分割"能力——尽管训练时从未给过任何分割标注。研究者发现 DINO 的注意力图自动把图像分成了不同的语义区域(如"狗"和"背景"),效果堪比监督训练的分割模型。更惊人的是,DINO 的注意力图和人类视觉注意力的模式高度相似——它学会了"看哪里",而不仅是"看到什么"。Meta 的研究者认为,这种能力可能来自自蒸馏中"教师网络"和"学生网络"的迭代演化——学生不断逼近一个更强大的自己。

来源:Caron et al., "Emerging Properties in Self-Supervised Vision Transformers", ICCV 2021

一句话总结
💡

DINO 用自蒸馏让 ViT 学到含语义分割的表征,SwAV 用在线聚类分配做对比,均无需负样本队列。

常见误区

这些坑别踩

✗

误区 1

DINO 是知识蒸馏因此需要教师标签。

✓

正确理解

DINO 是自蒸馏,教师和教师标签都来自模型自身,无外部标签。

✗

误区 2

SwAV 和 SimCLR 完全一样。

✓

正确理解

SwAV 用聚类分配替代逐对对比,计算更高效且不依赖大 batch 负样本。

✗

误区 3

DINO 学到的注意力图没用。

✓

正确理解

DINO 的自注意力图天然捕捉物体边界,可做无监督分割。