🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
从超越人类到超越CNNImageNet的Top-5准确率从2010年的72%一路飙升到2020年的98.8%——人类水平约为95%,机器早在2015年(ResNet)就已超越人类。CNN统治图像识别近十年,直到2020年Vision Transformer(ViT)横空出世。ViT证明了一个惊人的事实:如果数据量足够大(3亿张图片),完全不需要CNN的"归纳偏置"(局部性和平移不变性),纯Transformer也能达到甚至超越CNN的效果。不过在中小数据集上,CNN仍然是性价比最高的选择——ViT的数据饥渴是它的阿喀琉斯之踵。
来源:Dosovitskiy et al., "An Image is Worth 16x16 Words: Transformers for Image Recognition", ICLR 2021
一句话总结
💡
CNN 从 LeNet 到 ResNet 不断加深加宽,核心是用卷积提取层次特征,目标检测等任务在其上扩展。
常见误区
这些坑别踩
✗
误区 1
ViT 已让 CNN 完全过时。
✓
正确理解
CNN 在效率、小数据和边缘端仍优势明显,二者共存互补。
✗
误区 2
图像识别已解决。
✓
正确理解
细粒度、开放世界、少样本和视频理解仍是开放难题。
✗
误区 3
更大模型一定更好。
✓
正确理解
需平衡精度、速度和资源,轻量化在落地中同样重要。