🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉BPE分词器会把"unbelievable"切成"un"+"believ"+"able"这样的子词。这导致同一个词在不同上下文中token数不同,也让大模型在数数、拼写等任务上表现诡异——它们看到的是token而非字符。很多大模型能流畅讨论量子物理,却数不清"strawberry"里有几个"r"。
一句话总结
💡
现代分词器采用 BPE/WordPiece 等子词算法,在词与字符间取得平衡,将文本切分为可管理词表的 token 单元。
常见误区
这些坑别踩
✗
误区 1
一个 token 等于一个词或一个字。
✓
正确理解
子词分词下 token 可能是词、子词或字符,取决于词频和算法。
✗
误区 2
词表越大越好。
✓
正确理解
大词表增加嵌入参数和 softmax 开销,需在覆盖率和效率间权衡。
✗
误区 3
不同模型的分词器可以混用。
✓
正确理解
每个模型有专属分词器,混用会导致编码不一致和性能下降。