Word2Vec 词向量模型
Word2Vec 通过 CBOW 或 Skip-gram 架构学习词的分布式表示,使语义相近的词在向量空间中接近。
CBOW vs Skip-gram 对比
Word2Vec 的两种架构在训练目标和适用场景上有明显差异。
| 对比项 | CBOW | Skip-gram |
|---|---|---|
| 预测方向 | 上下文预测中心词 | 中心词预测上下文 |
| 训练速度 | 快⭐ | 慢(训练样本多) |
| 对低频词效果 | 较差 | 较好⭐ |
| 对高频词效果 | 较好⭐ | 一般 |
| 训练样本数量 | 少(每个窗口一条) | 多(窗口内每个词一条) |
| 向量质量 | 一般 | 更精细⭐ |
| 适用数据量 | 大数据集 | 小数据集也有效⭐ |
| 内存需求 | 较低 | 较高 |
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
Word2Vec训练出的词向量可以做"向量运算":king - man + woman ≈ queen。这意味着模型无师自通地学会了性别、时态等语义关系——这是词嵌入最令人惊叹的特性之一。
来源:Mikolov et al., "Efficient Estimation of Word Representations in Vector Space", 2013
Word2Vec的作者Tomas Mikolov最初在Google工作时开发了这个工具。他发现通过简单的向量减法就能发现语义关系,这一发现催生了整个"词嵌入"研究领域,也间接启发了后来Transformer的嵌入层设计。
Word2Vec 通过在大规模语料上训练浅层神经网络,将词映射为稠密向量,使语义相近的词向量距离相近。
这些坑别踩
误区 1
词向量维度越高越好。
正确理解
过高维度会增加计算量并可能过拟合,典型值在 100-300 维。
误区 2
Word2Vec 能解决一词多义。
正确理解
Word2Vec 为每个词分配单一静态向量,无法区分多义词,需上下文嵌入(如 BERT)解决。
误区 3
CBOW 和 Skip-gram 效果一样。
正确理解
Skip-gram 对小语料和低频词更友好,CBOW 训练更快。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
Word2Vec 的两种模型架构是?
负采样(Negative Sampling)在 Word2Vec 中的作用是?
Word2Vec 词向量的一个重要特性是?
Word2Vec 的主要局限是?
面试经典题
共 4 题 · 先思考再看答案
请详细解释 Word2Vec 的 CBOW 和 Skip-gram 模型的原理与区别。
解释负采样(Negative Sampling)的原理,以及它如何替代标准 Softmax。
Word2Vec 为什么能学到语义关系(如国王-男人+女人=女王)?请分析其原理。
比较 Word2Vec、GloVe 和 FastText 三种静态词嵌入方法的异同。
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺