对比实验室
相似度度量对比:余弦相似度 vs L2距离 vs 点积
向量检索中三种常用相似度/距离度量方式的对比。
| 对比项 | 余弦相似度 | L2 距离 (欧氏) | 点积 (内积) |
|---|---|---|---|
| 计算公式 | cos(a,b) = a.b / (|a||b|) | d = ||a - b|| | s = a.b |
| 值域 | [-1, 1] | [0, +inf) | (-inf, +inf) |
| 是否归一化 | 是(考虑方向) | 否(考虑大小和方向) | 否 |
| 对向量长度敏感 | 否 | 是 | 是 |
| 计算开销 | 中(需归一化) | 中 | 低(最快)⭐ |
| 归一化后等价于 | 自身 | 与余弦单调相关 | 与余弦等价 |
| 适用场景 | 文本语义相似度⭐ | 空间位置相近 | 推荐系统/排序 |
| 主流向量库默认 | 是 | 是 | 是 |
🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎯
相似度搜索为什么向量搜索几乎都用余弦相似度?因为它忽略向量长度只看"方向"——这意味着一篇短文和一本长书只要主题相近就能匹配,不会因为字数差异而被排除。这就像比较两个人"性格像不像",而不是比谁更高。
一句话总结
💡
相似度搜索通过余弦、内积或欧氏距离等度量计算向量间接近程度,返回最相似的若干结果。
常见误区
这些坑别踩
✗
误区 1
余弦相似度和欧氏距离总是一致的。
✓
正确理解
二者在向量未归一化时不等价,结果排序可能不同。
✗
误区 2
相似度高就一定语义相关。
✓
正确理解
Embedding 的相似度是模型习得的统计近似,可能有偏差。
✗
误区 3
距离度量和向量归一化无关。
✓
正确理解
余弦相似度等价于归一化后的内积,归一化与否影响度量选择。