知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

ViT (Vision Transformer) 把图像切成 16x16 的 patch,当成"词"喂给 Transformer——就像处理一句话那样处理一张图。这个想法 2020 年被提出时遭到质疑:CNN 的归纳偏置(平移不变性、局部性)难道不是视觉任务必需的吗?ViT 的回答是:在大数据集(JFT-300M 的 3 亿张图)上训练后,Transformer 完全可以从数据中学到这些偏置,甚至学得更好。但在小数据集上 ViT 确实不如 CNN——它"吃数据"的特性是早期被冷落的主因。如今 ViT 已成为视觉领域的标准架构,DETR、Sora、DINO 都建立在它之上。

来源:Dosovitskiy et al., "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale", ICLR 2021

一句话总结
💡

ViT 将图像切分为 patch 序列送入 Transformer,像处理文本一样建模图像,在大数据下超越 CNN。

常见误区

这些坑别踩

✗

误区 1

ViT 在少量数据上就比 CNN 强。

✓

正确理解

ViT 缺乏归纳偏置,需大规模预训练数据才能超越 CNN。

✗

误区 2

ViT 的 patch 切分会破坏图像结构。

✓

正确理解

patch 化是有效近似,注意力能跨 patch 建模全局关系。

✗

误区 3

ViT 只能做分类。

✓

正确理解

ViT 是通用骨干,可用于检测、分割、生成等多种视觉任务。