知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

Transformer的Token嵌入层输出会被乘以√d_model。这个缩放是为了让嵌入向量的方差和位置编码处于同一量级——否则位置编码会被数值更大的嵌入淹没,模型就无法感知词的位置信息。

一句话总结
💡

Token 嵌入将离散 token 通过查表映射为稠密向量,是模型将符号转化为连续表示的第一步。

常见误区

这些坑别踩

✗

误区 1

嵌入矩阵是随机初始化固定不变的。

✓

正确理解

嵌入矩阵是可训练参数,随训练不断更新。

✗

误区 2

嵌入维度越大语义越丰富。

✓

正确理解

过大维度增加计算和过拟合风险,需与模型规模匹配。

✗

误区 3

位置编码和 token 嵌入是一回事。

✓

正确理解

token 嵌入编码语义,位置编码编码顺序,二者相加而非等价。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

在 Transformer 中,Token Embedding 层的作用是?

2

Transformer 中常将输入 Embedding 与输出层的 softmax 权重共享(weight tying),其目的是?

3

为什么 Transformer 在 Embedding 输出后要乘以 √d_model 进行缩放?

4

关于 Token Embedding 的维度 d_model,下列说法正确的是?

面试经典题

共 4 题 · 先思考再看答案

1
基础

解释 Transformer 中 Token Embedding 的工作原理及其与 Word2Vec 的区别。

2
中等

为什么 Transformer 要对 Embedding 乘以 √d_model?请从数值角度分析。

3
中等

什么是权重共享(weight tying)?它在 Transformer 中如何实现?有什么优缺点?

4
困难

在 Vision Transformer(ViT)中,图像如何被转换为 token embedding?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺