LESSON 09 · 卷I 基础数学

概率与统计

给不确定性画张地图:条件概率、采样、期望,以及平均数看不见的波动。

第 1 站

猜一个结果,不如画一张概率地图

掷一枚骰子,下一次会是几?我们不知道。但如果六个面公平,每面出现的概率都是 1/6。不知道一次的结果,并不等于对这件事一无所知。

把结果记成随机变量 X:它可能取 1 到 6。给每种结果一个概率,就得到离散概率分布。概率都非负,所有可能结果的概率加起来等于 1。

长期重复时,频率可以帮助估计概率;但一次掷出 6 不会推翻 1/6 的模型,也不能仅凭六次试验就要求每面恰好一次。

第 2 站

有了新条件,地图就要更新

现在有人告诉你:「这次结果是偶数。」你还会给 1、3、5 分配概率吗?当然不会。候选结果只剩 2、4、6,它们在公平骰子下各占 1/3。

P(A | B) = P(A∩B) / P(B),要求 P(B)>0
P(X=6 | X 是偶数) = (1/6)/(3/6) = 1/3

竖线读作「在……条件下」。知道上下文后,下一个词的概率 P(词|前文),与不看前文的 P(词),正是两张不同的地图。

如果知道 B 不改变 A 的概率,就称 A 与 B 独立,此时 P(A∩B)=P(A)P(B)。两次独立掷骰子可以相乘;同一次的「是偶数」和「等于 6」却不能当作独立事件。

公平骰子里,P(X=6)=1/6。已知结果大于 3 后,概率是多少?
第 3 站

期望:很多次以后,平均落在哪里?

如果连续掷很多次,把所有点数加起来再除以次数,平均值通常会靠近 3.5。3.5 不在任何一个骰子面上,却是长期平均的目标。

E[X] = Σx x·P(X=x)
公平骰子:E[X]=(1+2+3+4+5+6)/6=3.5

期望就是按概率加权的平均。它不是最常出现的结果,也不是下一次必须出现的结果。回想向量加权和:规则相同,只是这次权重来自概率。

样本均值则是已经观察到的数据的平均。有限次采样会偏离期望;在独立同分布、期望存在等条件下,样本变多,平均值会逐渐稳定。

第 4 站

平均一样,波动却完全不同

有两种骰子:A 公平地出 1 到 6;B 只出 1 或 6,各占一半。两者期望都是 3.5,但 B 永远离平均值很远,波动明显更大。

Var(X)=E[(X−μ)²],其中 μ=E[X]
标准差 σ=√Var(X)
同样的期望,不同的波动
分布期望方差标准差
公平骰子3.535/12 ≈ 2.917≈ 1.708
只出 1 或 6,各半3.56.252.5

为什么要平方?直接平均正负偏差会抵消,平方让两边都算作波动。标准差再开根号,回到原来的单位:身高的标准差仍用厘米,而方差用平方厘米。

把边界说清楚

这里计算的是已知分布的方差。估计总体方差时,样本公式有除以 n 或 n−1 的不同约定,不能不说明对象就混用。后面的 LayerNorm 沿特征轴计算均值与方差,也要先看清被平均的是哪些数。

第 5 站

动手采样:理论地图与实际点数

切换两种均值相同的分布,看方差如何变化。再加一个条件,看剩余概率怎么重新分配。点击采样,比较有限样本的均值和理论期望;也可以自定义权重,试试某个条件完全不可能发生时会怎样。

骰子实验室 · 平均值一样,波动也一样吗?

抽样时我们按分布随机选择一个结果,而不是永远选概率最大的那一个。语言生成也有类似区分。至于「这张分布整体有多难猜」以及「模型的地图画错了多少」,下一课交给熵与交叉熵。

第 6 站

总结:不确定,也可以算清楚

💡 章节速记 · 本课核心

概率分布描述可能结果;条件概率根据已知信息更新地图;期望描述平均,方差和标准差描述波动。

💡 用大白话梳理:这一课的核心直觉

  • 随机变量可以取多个值,分布为它们分配概率。
  • 条件概率先筛选,再归一化;零概率条件不能直接相除。
  • 期望是概率加权平均,样本均值是有限观测的平均。
  • 平均值相同,不代表分布相同;还要看方差与标准差。
小测验

学习小测验

动动脑筋:核心直觉小测验(选出你的答案后点击「提交」,即可查看生动通俗的详细解析)

Q1公平骰子已知结果为偶数,此时结果为 6 的概率是多少?
Q2两个分布的期望都为 3.5,能断定它们波动一样吗?