首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >概率论:深度学习最重要的数学工具

概率论:深度学习最重要的数学工具

作者头像
heidsoft
发布2026-07-24 20:43:56
发布2026-07-24 20:43:56
1050
举报

概率论是深度学习最重要的数学地基之一:cross-entropy loss 是 Shannon 熵的工程实现,BatchNorm 的理论基础是正态分布,Variational Autoencoder 的核心是贝叶斯推断。本文给出3周补完路线图,对应 Stanford STATS 116 教材 + Harvard STATS 110 课程,配 Goodfellow《Deep Learning》第三章精读。

01

为什么深度学习必须学概率论

神经网络本质上是一个随机函数逼近器:训练数据是随机采样,梯度是随机估计(mini-batch),输出是概率分布。每一次前向传播都是一次概率采样,每一次参数更新都是一次贝叶斯更新。

02

3周学习路线图

目标:掌握深度学习所需的概率工具,不过度深入测度论,重点在分布直觉 + 贝叶斯框架 + 信息论度量

W1

第1周:概率分布

DeGroot & Schervish《Probability and Statistics》第1-3章

Ch1:概率公理 / 计数(排列组合)— 一切概率的起点

Ch2:条件概率 / 贝叶斯公式 — 机器学习最重要的公式

Ch3:随机变量 / 期望 / 方差 — 深度学习梯度的统计解释

辅助课程:STATS 110 L1-L8(Harvard Blitzstein,B站有)

W2

第2周:常用分布族

记住每个分布的期望/方差/典型用途,不用背推导

Bernoulli / Binomial — 0-1 分布,逻辑回归 sigmoid 的概率论根基

Gaussian / Normal — 最重要的分布,中心极限定理保证深度学习中梯度近似正态分布

Poisson — 稀有事件建模,NLP 中罕见词建模

Exponential / Gamma — 时间间隔建模,指数衰减学习率的理论基础

W3

第3周:贝叶斯推断 + 信息论

贝叶斯 + 信息论 = 深度学习概率理论的核心

贝叶斯推断 — DeGroot Ch4 + STATS 110 L10-L12,先验/后验/似然/Evidence

EM 算法 — Self-Instruct 论文(arXiv:2212.10560)的核心,E步=期望/M步=最大化

信息论基础 — Cover & Thomas《Elements of Information Theory》Ch1-2,只读熵和KL散度

KL 散度 — DKL(p||q) = 损失函数根基,GAN loss / VAE loss / 正则化的理论依据

03

最少必要概念清单

以下8个概念覆盖深度学习 90% 的概率工具需求,优先掌握:

最少必要概念 · 深度学习概率工具

① 概率分布 / PMF / PDF — softmax 输出、loss 计算

② 条件概率 / 贝叶斯公式 — P(θ|D) = P(D|θ)·P(θ) / P(D)

③ 期望 E[X] / 方差 Var(X) — BatchNorm 梯度估计的理论基础

④ 正态分布 — 中心极限定理:独立随机变量和→正态分布

⑤ 最大似然估计 MLE — 神经网络参数估计的核心方法

⑥ Shannon 熵 H(p) — H(p) = -Σ p(x) log p(x)

⑦ KL 散度 DKL(p||q) — 交叉熵损失函数理论根基

⑧ 协方差 / 相关系数 — 多任务学习、特征相关性分析

· · ·

本周 读 DeGroot Ch1-Ch2,完成 STATS 110 L1-L4

本月 学完概率三板块(分布/贝叶斯/信息论),整理公式卡片

永远 每篇论文涉及的概率工具,立刻回溯教材查证,不留盲点

END

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-24,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 为什么深度学习必须学概率论
  • 3周学习路线图
    • 第1周:概率分布
    • 第2周:常用分布族
    • 第3周:贝叶斯推断 + 信息论
  • 最少必要概念清单
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档