🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
💡
概念业界有句名言:"Garbage In, Garbage Out"(垃圾进,垃圾出)。在机器学习中,数据清洗和预处理往往占去80%的工作时间,却决定了模型效果的上限。一个被污染的特征会让最好的模型也无能为力。
一句话总结
💡
数据预处理包括缺失值处理、异常值处理、数据标准化和编码转换等,是保证模型效果的基础步骤。
常见误区
这些坑别踩
✗
误区 1
数据预处理只是可有可无的辅助步骤。
✓
正确理解
数据预处理直接影响模型效果,低质量数据会导致"垃圾进垃圾出", preprocessing往往比算法选择更重要。
✗
误区 2
缺失值一律用均值填充即可。
✓
正确理解
缺失值的填充方式应根据缺失机制(完全随机、随机、非随机)和数据特征选择,均值填充可能引入偏差,有时用中位数、众数或模型预测更合适。
✗
误区 3
标准化和归一化是一回事。
✓
正确理解
标准化(z-score)将数据转为均值为0标准差为1,归一化(Min-Max)压缩到[0,1],两者算法和适用场景不同,对异常值敏感度也不同。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
关于 Min-Max 归一化,下列说法正确的是?
2
处理缺失值时,下列哪种方法最简单但可能引入较大偏差?
3
Z-score 标准化(标准分数)的变换公式是?
4
对于含有显著异常值的数据集,下列哪种归一化/标准化方法最鲁棒?
面试经典题
共 5 题 · 先思考再看答案
1
基础
请说明数据预处理在机器学习流程中的重要性,并列举常见的预处理步骤。
2
中等
Min-Max 归一化和 Z-score 标准化各有什么优缺点?分别适用于什么场景?
3
中等
处理缺失值的常见策略有哪些?如何选择?
4
困难
如何检测和处理异常值?
5
中等
为什么对类别不平衡数据需要进行特殊处理?常见方法有哪些?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺