知了AI学习平台Logo知了
公式推导

交叉熵损失: 从MLE到交叉熵

从极大似然估计出发,推导对数似然,最终得到交叉熵损失函数及其梯度。

第 1 / 617%
1

极大似然估计

θ∗=arg⁡max⁡θ∏i=1mP(y(i)∣x(i);θ)\boldsymbol{\theta}^* = \arg\max_{\boldsymbol{\theta}} \prod_{i=1}^{m} P(y^{(i)}|\mathbf{x}^{(i)}; \boldsymbol{\theta})
👉

关键部分

∏i=1mP(y(i)∣x(i);θ)\prod_{i=1}^{m} P(y^{(i)}|\mathbf{x}^{(i)}; \boldsymbol{\theta})

MLE思想:寻找使观测数据出现概率最大的参数。假设样本独立,联合概率为各样本概率之积。

代码沙盒

损失函数

使用 NumPy 实现常见的损失函数。

📌 回归损失:MSE 与 MAE:均方误差与平均绝对误差。

🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

✨
实用技巧

选择损失函数是建模的关键决策:回归用MSE,分类用交叉熵。如果用MSE做分类,梯度在预测接近正确时会变得极小,导致训练极慢——这是Sigmoid+MSE的经典陷阱。

一句话总结
💡

损失函数衡量模型预测与真实标签的差异,是模型优化的目标,常见有MSE、交叉熵等。

常见误区

这些坑别踩

✗

误区 1

损失函数越小模型一定越好。

✓

正确理解

训练集损失小可能意味着过拟合,应关注验证集损失,且损失值不直接反映业务效果,需结合具体指标评估。

✗

误区 2

任何任务都可以用MSE作为损失函数。

✓

正确理解

MSE适用于回归,分类任务应用交叉熵,因为交叉熵与最大似然对应且梯度更利于优化,用错损失函数会导致训练效果差。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

交叉熵损失(Cross-Entropy Loss)用于二分类时的公式是?

2

Hinge Loss(合页损失)主要用于哪种模型?

3

关于均方误差(MSE)用于回归任务,下列说法正确的是?

4

对比损失(Contrastive Loss)常用于什么场景?

面试经典题

共 4 题 · 先思考再看答案

1
中等

请说明交叉熵损失的原理,以及为什么分类任务用交叉熵而非 MSE。

2
困难

解释 Hinge Loss 与交叉熵在分类中的区别。

3
困难

什么是对比损失?它在表征学习中的作用是什么?

4
中等

回归任务中如何选择损失函数?请对比 MSE、MAE、Huber Loss。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺