🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
💡
概念自监督学习的"pretext task"(前置任务)设计是一门"猜谜艺术":旋转预测(这张图被旋转了几度)、拼图(把图片打乱再拼回去)、颜色化(给黑白图上色)。这些任务本身没有业务价值,但训练过程中模型学到的特征对下游任务极有价值。有趣的是,2020 年后 pretext task 的设计逐渐被对比学习和掩码重建取代——研究表明,简单的"遮住再猜"(MAE) 比精心设计的 pretext task 效果更好。深度学习的哲学似乎是"越简单的任务越通用"。
一句话总结
💡
自监督学习利用数据自身构造 pretext 任务(如掩码、对比)从无标签数据中学习表征,减少对标注的依赖。
常见误区
这些坑别踩
✗
误区 1
自监督学习完全不需要任何标注。
✓
正确理解
预训练阶段无需标签,但下游微调通常仍需少量标注。
✗
误区 2
自监督一定比监督学习好。
✓
正确理解
在标注充足时监督学习常更优,自监督优势在标注稀缺和大规模预训练。
✗
误区 3
任何 pretext 任务都有效。
✓
正确理解
pretext 任务需与下游相关且具适当难度,随意设计可能学到无用表征。