🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎯
趣闻中文分词比英文难得多——英文天然用空格分词,中文则需要算法判断。"南京市长江大桥"应该分词为"南京市/长江大桥"还是"南京市长/江大桥"?这就是中文NLP的经典歧义难题。
一句话总结
💡
文本预处理将原始文本清洗、分词并转换为模型可处理的数值序列,是 NLP 流程的基础环节。
常见误区
这些坑别踩
✗
误区 1
中文分词就是按空格切。
✓
正确理解
中文无空格分隔,需用专门分词工具(如 jieba)或子词算法。
✗
误区 2
分词越细越好。
✓
正确理解
过细会丢失词语语义完整性,需根据任务选择粒度。
✗
误区 3
停用词一定要删。
✓
正确理解
视任务而定,情感分析中否定词等停用词可能携带关键信息。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
中文分词常用工具 jieba 的主要分词算法基于?
2
BPE(Byte Pair Encoding)分词算法的核心思想是?
3
WordPiece 与 BPE 的主要区别是?
4
NLP 文本预处理通常包括哪些步骤(按合理顺序)?
面试经典题
共 4 题 · 先思考再看答案
1
基础
请描述中文 NLP 文本预处理的完整流程,并说明每步的作用。
2
中等
比较 BPE、WordPiece、SentencePiece 三种子词分词算法的原理与适用场景。
3
中等
为什么现代大模型(GPT、LLaMA)普遍采用子词分词而非词级或字符级分词?
4
困难
在实际 NLP 项目中,如何选择和优化分词方案?有哪些注意事项?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺