知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

🎯
趣闻

中文分词比英文难得多——英文天然用空格分词,中文则需要算法判断。"南京市长江大桥"应该分词为"南京市/长江大桥"还是"南京市长/江大桥"?这就是中文NLP的经典歧义难题。

一句话总结
💡

文本预处理将原始文本清洗、分词并转换为模型可处理的数值序列,是 NLP 流程的基础环节。

常见误区

这些坑别踩

✗

误区 1

中文分词就是按空格切。

✓

正确理解

中文无空格分隔,需用专门分词工具(如 jieba)或子词算法。

✗

误区 2

分词越细越好。

✓

正确理解

过细会丢失词语语义完整性,需根据任务选择粒度。

✗

误区 3

停用词一定要删。

✓

正确理解

视任务而定,情感分析中否定词等停用词可能携带关键信息。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

中文分词常用工具 jieba 的主要分词算法基于?

2

BPE(Byte Pair Encoding)分词算法的核心思想是?

3

WordPiece 与 BPE 的主要区别是?

4

NLP 文本预处理通常包括哪些步骤(按合理顺序)?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请描述中文 NLP 文本预处理的完整流程,并说明每步的作用。

2
中等

比较 BPE、WordPiece、SentencePiece 三种子词分词算法的原理与适用场景。

3
中等

为什么现代大模型(GPT、LLaMA)普遍采用子词分词而非词级或字符级分词?

4
困难

在实际 NLP 项目中,如何选择和优化分词方案?有哪些注意事项?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺