知了AI学习平台Logo知了
知识图谱

Word2Vec 词向量模型

Word2Vec 通过 CBOW 或 Skip-gram 架构学习词的分布式表示,使语义相近的词在向量空间中接近。

架构架构产出优化用上下文预测用词预测基于训练Word…CBOWSkip…词向量负采样上下文滑动窗口
核心
概念
方法
应用
对比实验室

CBOW vs Skip-gram 对比

Word2Vec 的两种架构在训练目标和适用场景上有明显差异。

对比项CBOWSkip-gram
预测方向上下文预测中心词中心词预测上下文
训练速度快⭐慢(训练样本多)
对低频词效果较差较好⭐
对高频词效果较好⭐一般
训练样本数量少(每个窗口一条)多(窗口内每个词一条)
向量质量一般更精细⭐
适用数据量大数据集小数据集也有效⭐
内存需求较低较高
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

Word2Vec训练出的词向量可以做"向量运算":king - man + woman ≈ queen。这意味着模型无师自通地学会了性别、时态等语义关系——这是词嵌入最令人惊叹的特性之一。

来源:Mikolov et al., "Efficient Estimation of Word Representations in Vector Space", 2013

📜
历史

Word2Vec的作者Tomas Mikolov最初在Google工作时开发了这个工具。他发现通过简单的向量减法就能发现语义关系,这一发现催生了整个"词嵌入"研究领域,也间接启发了后来Transformer的嵌入层设计。

一句话总结
💡

Word2Vec 通过在大规模语料上训练浅层神经网络,将词映射为稠密向量,使语义相近的词向量距离相近。

常见误区

这些坑别踩

✗

误区 1

词向量维度越高越好。

✓

正确理解

过高维度会增加计算量并可能过拟合,典型值在 100-300 维。

✗

误区 2

Word2Vec 能解决一词多义。

✓

正确理解

Word2Vec 为每个词分配单一静态向量,无法区分多义词,需上下文嵌入(如 BERT)解决。

✗

误区 3

CBOW 和 Skip-gram 效果一样。

✓

正确理解

Skip-gram 对小语料和低频词更友好,CBOW 训练更快。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Word2Vec 的两种模型架构是?

2

负采样(Negative Sampling)在 Word2Vec 中的作用是?

3

Word2Vec 词向量的一个重要特性是?

4

Word2Vec 的主要局限是?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请详细解释 Word2Vec 的 CBOW 和 Skip-gram 模型的原理与区别。

2
中等

解释负采样(Negative Sampling)的原理,以及它如何替代标准 Softmax。

3
困难

Word2Vec 为什么能学到语义关系(如国王-男人+女人=女王)?请分析其原理。

4
困难

比较 Word2Vec、GloVe 和 FastText 三种静态词嵌入方法的异同。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺