知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

BPE分词器会把"unbelievable"切成"un"+"believ"+"able"这样的子词。这导致同一个词在不同上下文中token数不同,也让大模型在数数、拼写等任务上表现诡异——它们看到的是token而非字符。很多大模型能流畅讨论量子物理,却数不清"strawberry"里有几个"r"。

一句话总结
💡

现代分词器采用 BPE/WordPiece 等子词算法,在词与字符间取得平衡,将文本切分为可管理词表的 token 单元。

常见误区

这些坑别踩

✗

误区 1

一个 token 等于一个词或一个字。

✓

正确理解

子词分词下 token 可能是词、子词或字符,取决于词频和算法。

✗

误区 2

词表越大越好。

✓

正确理解

大词表增加嵌入参数和 softmax 开销,需在覆盖率和效率间权衡。

✗

误区 3

不同模型的分词器可以混用。

✓

正确理解

每个模型有专属分词器,混用会导致编码不一致和性能下降。