知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

业界有句名言:"Garbage In, Garbage Out"(垃圾进,垃圾出)。在机器学习中,数据清洗和预处理往往占去80%的工作时间,却决定了模型效果的上限。一个被污染的特征会让最好的模型也无能为力。

一句话总结
💡

数据预处理包括缺失值处理、异常值处理、数据标准化和编码转换等,是保证模型效果的基础步骤。

常见误区

这些坑别踩

✗

误区 1

数据预处理只是可有可无的辅助步骤。

✓

正确理解

数据预处理直接影响模型效果,低质量数据会导致"垃圾进垃圾出", preprocessing往往比算法选择更重要。

✗

误区 2

缺失值一律用均值填充即可。

✓

正确理解

缺失值的填充方式应根据缺失机制(完全随机、随机、非随机)和数据特征选择,均值填充可能引入偏差,有时用中位数、众数或模型预测更合适。

✗

误区 3

标准化和归一化是一回事。

✓

正确理解

标准化(z-score)将数据转为均值为0标准差为1,归一化(Min-Max)压缩到[0,1],两者算法和适用场景不同,对异常值敏感度也不同。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

关于 Min-Max 归一化,下列说法正确的是?

2

处理缺失值时,下列哪种方法最简单但可能引入较大偏差?

3

Z-score 标准化(标准分数)的变换公式是?

4

对于含有显著异常值的数据集,下列哪种归一化/标准化方法最鲁棒?

面试经典题

共 5 题 · 先思考再看答案

1
基础

请说明数据预处理在机器学习流程中的重要性,并列举常见的预处理步骤。

2
中等

Min-Max 归一化和 Z-score 标准化各有什么优缺点?分别适用于什么场景?

3
中等

处理缺失值的常见策略有哪些?如何选择?

4
困难

如何检测和处理异常值?

5
中等

为什么对类别不平衡数据需要进行特殊处理?常见方法有哪些?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺