概率与统计
给不确定性画张地图:条件概率、采样、期望,以及平均数看不见的波动。
猜一个结果,不如画一张概率地图
掷一枚骰子,下一次会是几?我们不知道。但如果六个面公平,每面出现的概率都是 1/6。不知道一次的结果,并不等于对这件事一无所知。
把结果记成随机变量 X:它可能取 1 到 6。给每种结果一个概率,就得到离散概率分布。概率都非负,所有可能结果的概率加起来等于 1。
长期重复时,频率可以帮助估计概率;但一次掷出 6 不会推翻 1/6 的模型,也不能仅凭六次试验就要求每面恰好一次。
有了新条件,地图就要更新
现在有人告诉你:「这次结果是偶数。」你还会给 1、3、5 分配概率吗?当然不会。候选结果只剩 2、4、6,它们在公平骰子下各占 1/3。
P(X=6 | X 是偶数) = (1/6)/(3/6) = 1/3
竖线读作「在……条件下」。知道上下文后,下一个词的概率 P(词|前文),与不看前文的 P(词),正是两张不同的地图。
如果知道 B 不改变 A 的概率,就称 A 与 B 独立,此时 P(A∩B)=P(A)P(B)。两次独立掷骰子可以相乘;同一次的「是偶数」和「等于 6」却不能当作独立事件。
期望:很多次以后,平均落在哪里?
如果连续掷很多次,把所有点数加起来再除以次数,平均值通常会靠近 3.5。3.5 不在任何一个骰子面上,却是长期平均的目标。
公平骰子:E[X]=(1+2+3+4+5+6)/6=3.5
期望就是按概率加权的平均。它不是最常出现的结果,也不是下一次必须出现的结果。回想向量加权和:规则相同,只是这次权重来自概率。
样本均值则是已经观察到的数据的平均。有限次采样会偏离期望;在独立同分布、期望存在等条件下,样本变多,平均值会逐渐稳定。
平均一样,波动却完全不同
有两种骰子:A 公平地出 1 到 6;B 只出 1 或 6,各占一半。两者期望都是 3.5,但 B 永远离平均值很远,波动明显更大。
标准差 σ=√Var(X)
| 分布 | 期望 | 方差 | 标准差 |
|---|---|---|---|
| 公平骰子 | 3.5 | 35/12 ≈ 2.917 | ≈ 1.708 |
| 只出 1 或 6,各半 | 3.5 | 6.25 | 2.5 |
为什么要平方?直接平均正负偏差会抵消,平方让两边都算作波动。标准差再开根号,回到原来的单位:身高的标准差仍用厘米,而方差用平方厘米。
这里计算的是已知分布的方差。估计总体方差时,样本公式有除以 n 或 n−1 的不同约定,不能不说明对象就混用。后面的 LayerNorm 沿特征轴计算均值与方差,也要先看清被平均的是哪些数。
动手采样:理论地图与实际点数
切换两种均值相同的分布,看方差如何变化。再加一个条件,看剩余概率怎么重新分配。点击采样,比较有限样本的均值和理论期望;也可以自定义权重,试试某个条件完全不可能发生时会怎样。
抽样时我们按分布随机选择一个结果,而不是永远选概率最大的那一个。语言生成也有类似区分。至于「这张分布整体有多难猜」以及「模型的地图画错了多少」,下一课交给熵与交叉熵。
总结:不确定,也可以算清楚
概率分布描述可能结果;条件概率根据已知信息更新地图;期望描述平均,方差和标准差描述波动。
💡 用大白话梳理:这一课的核心直觉
- 随机变量可以取多个值,分布为它们分配概率。
- 条件概率先筛选,再归一化;零概率条件不能直接相除。
- 期望是概率加权平均,样本均值是有限观测的平均。
- 平均值相同,不代表分布相同;还要看方差与标准差。
学习小测验
动动脑筋:核心直觉小测验(选出你的答案后点击「提交」,即可查看生动通俗的详细解析)
10 信息量、熵与交叉熵
有了概率地图,怎样量出意外、不确定性,以及模型猜错的代价?