🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉REPA (Representation Alignment) 是 2024 年提出的新方法,核心思想极其简单:在训练扩散模型时,把中间特征和 DINO 预训练的表征做对齐。这个"对齐"只需要一行代码(加一个余弦相似度损失),却让扩散模型的训练效率提升了 10 倍以上。更深刻的意义是:视觉生成和视觉理解可能共享同一套"视觉语言"——当你让生成模型"学会像理解模型一样看世界",它生成图像的质量和速度都大幅提升。这暗示着未来多模态模型可能不需要分别训练理解和生成能力。
来源:Yu et al., "Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think", 2024
一句话总结
💡
REPA 通过对齐自监督表示与预训练特征(如 DINO)提升训练效率与表征质量。
常见误区
这些坑别踩
✗
误区 1
REPA 需要监督标签。
✓
正确理解
它对齐的是无监督表征空间,不依赖人工标签。
✗
误区 2
表征对齐就是复制 teacher 输出。
✓
正确理解
对齐是分布或方向层面的约束,不等于逐像素模仿。
✗
误区 3
REPA 只对 MAE 有效。
✓
正确理解
表征对齐思想可推广到多种自监督和监督方法。