均值与期望
离散随机变量
均值(期望)
设离散随机变量 $X$ 的概率分布函数为 $P(X = x_i) = p_i$,则其数学期望(均值)定义为:
$$ \mu = E[X] = \sum_{i=1}^{\infty} x_i p_i $$方差
离散随机变量 $X$ 的方差定义为:
$$ \sigma^2 = D(X) = E[(X - E[X])^2] = \sum_{i} (x_i - E[X])^2 p_i $$也可等价表示为:
$$ D(X) = E[X^2] - (E[X])^2 $$连续随机变量
均值(期望)
设连续随机变量 $X$ 的概率密度函数为 $f(x)$,则其期望为:
$$ \mu = E[X] = \int_{-\infty}^{\infty} x f(x) \, dx $$方差
连续随机变量 $X$ 的方差为:
$$ \sigma^2 = D(X) = E[(X - E[X])^2] = \int_{-\infty}^{\infty} (x - E[X])^2 f(x) \, dx $$同样有简化公式:
$$ D(X) = E[X^2] - (E[X])^2 $$样本方差
给定一个容量为 $n$ 的样本 $x_1, x_2, \dots, x_n$,其样本均值为:
$$ \bar{X} = \frac{1}{n} \sum_{i=1}^{n} x_i $$样本方差(无偏估计)定义为:
$$ s^2 = \frac{1}{n - 1} \sum_{i=1}^{n} (x_i - \bar{X})^2 $$注:分母使用 $n-1$(而非 $n$)是为了使 $s^2$ 成为总体方差 $\sigma^2$ 的无偏估计量,这一修正称为 贝塞尔修正(Bessel’s correction)。
无偏估计简介
在统计学中,我们常常无法获取整个总体的数据,只能通过样本来推断总体的某些特征(如均值、方差等)。用于推断总体参数的样本函数称为估计量。一个重要的评价标准是该估计量是否“无偏”。
设 $\theta$ 是某个总体参数(例如总体均值 $\mu$ 或总体方差 $\sigma^2$),$\hat{\theta}$ 是基于样本构造的估计量。如果满足:
$$ E[\hat{\theta}] = \theta $$则称 $\hat{\theta}$ 是 $\theta$ 的无偏估计量(unbiased estimator)。
换句话说:无偏估计的期望等于它所要估计的真实参数值。这意味着,如果我们反复从总体中抽样并计算该估计量,其平均值会趋近于真实参数。
无偏估计常见例子
样本均值是总体均值的无偏估计
设总体均值为 $\mu$,样本为 $x_1, x_2, \dots, x_n$,样本均值为:
$$ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i $$可以证明:
$$ E[\bar{x}] = E[\frac{1}{n} \sum_{i=1}^{n} x_i] =\frac{1}{n} \sum_{i=1}^{n} E[x_i] = \frac{1}{n} n \mu = \mu $$因此,$\bar{x}$ 是 $\mu$ 的无偏估计。
样本方差是总体方差的无偏估计
总体方差定义为 $\sigma^2 = E[(X - \mu)^2]$。若使用:
$$ s^2 = \frac{1}{n - 1} \sum_{i=1}^{n} (x_i - \bar{x})^2 $$则有:
$$ E[s^2] = \sigma^2 $$所以 $s^2$ 是 $\sigma^2$ 的无偏估计。
为什么样本方差是总体方差的无偏估计
如果已知随机变量 $ X $ 的期望为 $ \mu $,那么可以如下计算方差 $ \sigma^2 $:
$$ \sigma^2 = E[(X - \mu)^2] $$上面的式子需要知道 $ X $ 的具体分布是什么(在现实应用中往往不知道准确分布),计算起来也比较复杂。
所以实践中常常采样之后,用下面这个 $ S^2 $ 来近似 $ \sigma^2 $:
$$ S^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \mu)^2 $$其实现实中,往往连 $ X $ 的期望 $ \mu $ 也不清楚,只知道样本的均值:
$$ \bar{X} = \frac{1}{n} \sum_{i=1}^{n} x_i $$那可以这么来计算 $ s^2 $:
$$ s^2 = \frac{1}{n - 1} \sum_{i=1}^{n} (x_i - \bar{X})^2 $$$$ \begin{aligned} E(s^2) &= E\left(\frac{1}{n-1} \sum_{i=1}^{n} (x_i - \bar{X})^2\right) \\ &= E\left[\frac{1}{n-1} \sum_{i=1}^{n} (x_i)^2 - \frac{2}{n-1} \sum_{i=1}^{n} (x_i)(\bar{x}) + \frac{1}{n-1} \sum_{i=1}^{n} (\bar{X})^2\right] \\ &= E\left[\frac{1}{n-1} \sum_{i=1}^{n} \left\{ (x_i)^2 - 2(\bar{X})^2 + (\bar{X})^2 \right\} \right] \\ &= E\left[\frac{1}{n-1} \sum_{i=1}^{n} \left\{ (x_i)^2 - (\bar{X})^2 \right\} \right] \\ &= E\left[\frac{1}{n-1} \sum_{i=1}^{n} \left\{ (x_i)^2 - E[(\bar{X})^2]\right\} \right] \\ &= \frac{1}{n-1} \sum_{i=1}^{n} \left\{ E[(x_i)^2] - E[(\bar{x})^2] \right\} \\ &= \frac{1}{n-1} \sum_{i=1}^{n} \left\{ D[(x_i)] + (E[x_i])^2 - (D[\bar{X}] + (E[\bar{X}])^2) \right\} \\ &= \frac{1}{n-1} n \left\{ (\sigma^2 + \mu^2)- (\frac{1}{n} \sigma^2 + \mu^2 ) \right\} \\ &=\sigma^2 \end{aligned} $$$D(X) = E[X^2] - (E[X])^2$ $D[\bar{X}]=D[\frac{1}{n} \sum_{i=1}^{n} x_i]= \frac{1}{n^2} \sum_{i=1}^{n} D[x_i] = \frac{1}{n^2} n \sigma^2 = \frac{1}{n} \sigma^2 $ 故样本方差是总体方差的无偏估计,分母使用 $n-1$(而非 $n$)是为了使 $s^2$ 成为总体方差 $\sigma^2$ 的无偏估计量,这一修正称为 贝塞尔修正(Bessel’s correction)
从自由度的方面看,n 个样本$x_1$ ~ $x_n$ , 但加入了一个约束$\bar{X} = \frac{1}{n} \sum_{i=1}^{n} x_i$, 在已知 $n-1$ 个样本和 $\bar{X}$ 的情况下,第n个也就确定了(一个n维向量,若有一个线性约束$k_1x_1 +…+k_nx_n=c$,则其中任意一个向量可以由其余向量线性表出,且这n个向量的秩维n-1),所以$s^2$的自由度就是n-1了,也正是因为除以了正确的自由度,才得到了无偏的方差统计量。