知了AI学习平台Logo知了
算法动画 · 注意力

CLIP 图文对齐动画

展示 CLIP 如何通过对比学习将图像和文本对齐到统一的嵌入空间,实现零样本分类。

CLIP (Contrastive Language-Image Pre-training)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
未激活·当前高亮(6 个元素)
1

CLIP 同时接收一批图像和文本对,目标是将匹配的图文对在嵌入空间中对齐。

第 1 步 / 共 714%
知识图谱

CLIP 对比学习模型

CLIP 通过对比学习将图像和文本映射到同一向量空间,实现零样本分类能力。

组件组件训练方法能力特性映射到映射到对齐CLIP图像编码器文本编码器对比学习零样本多模态共享嵌入…
核心
概念
方法
应用
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

CLIP 是 OpenAI 2021 年的杰作,用 4 亿张图文对训练了一个"零样本"图像分类器——你告诉它"这是一只猫的图片",它就能判断对错,无需任何标注数据。CLIP 的训练目标极其简单:让正确图文对的相似度最高,错误图文对的相似度最低。但它真正震撼的是"涌现能力"——CLIP 可以识别训练时从未见过的概念,比如手绘的"数据可视化图表"或"戴墨镜的柴犬"。这种零样本能力让 CLIP 成了多模态 AI 的基石,DALL-E、Stable Diffusion 的文本编码器都基于 CLIP。

来源:Radford et al., "Learning Transferable Visual Models From Natural Language Supervision", ICML 2021

一句话总结
💡

CLIP 通过对比学习将图像和文本对齐到共享嵌入空间,实现零样本图像分类和跨模态检索。

常见误区

这些坑别踩

✗

误区 1

CLIP 能生成图像。

✓

正确理解

CLIP 是理解模型(对齐图文),生成需配合扩散模型等。

✗

误区 2

CLIP 的零样本分类完美。

✓

正确理解

零样本在细粒度和分布外类别上仍不如专用微调模型。

✗

误区 3

CLIP 只对齐图像和文本。

✓

正确理解

思想可扩展到视频、音频等多模态(如 AudioCLIP)。