你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
Transformer的Token嵌入层输出会被乘以√d_model。这个缩放是为了让嵌入向量的方差和位置编码处于同一量级——否则位置编码会被数值更大的嵌入淹没,模型就无法感知词的位置信息。
Token 嵌入将离散 token 通过查表映射为稠密向量,是模型将符号转化为连续表示的第一步。
这些坑别踩
误区 1
嵌入矩阵是随机初始化固定不变的。
正确理解
嵌入矩阵是可训练参数,随训练不断更新。
误区 2
嵌入维度越大语义越丰富。
正确理解
过大维度增加计算和过拟合风险,需与模型规模匹配。
误区 3
位置编码和 token 嵌入是一回事。
正确理解
token 嵌入编码语义,位置编码编码顺序,二者相加而非等价。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
在 Transformer 中,Token Embedding 层的作用是?
Transformer 中常将输入 Embedding 与输出层的 softmax 权重共享(weight tying),其目的是?
为什么 Transformer 在 Embedding 输出后要乘以 √d_model 进行缩放?
关于 Token Embedding 的维度 d_model,下列说法正确的是?
面试经典题
共 4 题 · 先思考再看答案
解释 Transformer 中 Token Embedding 的工作原理及其与 Word2Vec 的区别。
为什么 Transformer 要对 Embedding 乘以 √d_model?请从数值角度分析。
什么是权重共享(weight tying)?它在 Transformer 中如何实现?有什么优缺点?
在 Vision Transformer(ViT)中,图像如何被转换为 token embedding?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺