Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

2.2 基本统计概念

上面所述波特兰水泥试验中的每一个观测值都称为一次运行(run)。注意各次运行互不相同,因此所观测到的粘结强度中存在波动或噪声。这种噪声通常称为试验误差(experimental error)或简称为误差。它是一种统计误差,意即它来自不受控制且通常无法避免的变异。误差或噪声的存在意味着响应变量——拉伸粘结强度——是一个随机变量(random variable)。随机变量可以是离散的或连续的。如果随机变量所有可能取值的集合是有限集或可数无限集,则该随机变量是离散的;如果其所有可能取值的集合是一个区间,则该随机变量是连续的。

变异的图形描述。 我们常常用简单的图形方法来辅助分析试验数据。图 2.1 所示的点图是展示少量数据(比如最多约 20 个观测值)的非常有用的工具。点图使试验者能够迅速看出观测值的大致位置(集中趋势)及其散布或变异。例如,在波特兰水泥拉伸粘结试验中,点图显示两种配方的平均强度可能不同,但两种配方产生的强度变异大致相同。

图 2.2 某熔炼过程金属回收率(收率)的 200 个观测值的直方图

如果数据相当多,点图中的点就难以区分,此时直方图(histogram)可能更好。图 2.2 给出了某熔炼过程金属回收率(收率)的 200 个观测值的直方图。直方图显示了数据中心趋势、散布以及分布的大致形状。回忆一下,直方图是这样构造的:把横轴分成若干组距(bin,通常等长),在第 jj 个组距上画一个矩形,使矩形面积正比于 njn_{j},即落入该组距的观测值个数。直方图是大样本工具。当样本量很小时,直方图的形状对组距数、组距宽度以及第一个组距的起始值都很敏感。观测值少于 75~100 个时不应使用直方图。

箱线图(box plot,或称箱须图)是一种非常有用的数据展示方式。箱线图在一个水平或垂直放置的矩形箱上显示最小值、最大值、下四分位数和上四分位数(分别为第 25 百分位数和第 75 百分位数)以及中位数(第 50 百分位数)。箱体从下四分位数延伸到上四分位数,并在中位数处画一条穿过箱体的线。从箱体两端向外延伸的线(即须,whisker)通常画到最小值和最大值。[箱线图有若干变体,它们标出极端样本点的规则不同,更多细节见 Montgomery 和 Runger(2018)。]

图 2.3 给出了波特兰水泥砂浆试验中两个拉伸粘结强度样本的箱线图。这一图形显示两种配方的平均强度存在某些差异,同时也显示两种配方产生的强度分布都相当对称、变异或散布相近。

图 2.3 波特兰水泥拉伸粘结强度试验的箱线图

点图、直方图和箱线图有助于概括样本数据中的信息。为了更完整地描述样本中可能出现的观测值,我们要使用概率分布的概念。

概率分布。 随机变量(记为 yy)的概率结构由它的概率分布来描述。如果 yy 是离散的,我们常把它的概率分布 p(y)p(y) 称为 yy 的概率质量函数(probability mass function)。如果 yy 是连续的,它的概率分布 f(y)f(y) 常称为 yy 的概率密度函数(probability density function)。

图 2.4 给出了假想的离散和连续概率分布。注意,在离散概率分布图 2.4a 中,代表概率的是函数 p(yj)p(y_{j}) 的高度;而在连续情形图 2.4b 中,代表概率的是与给定区间相对应的曲线 f(y)f(y) 下方的面积。概率分布的性质可以定量地概括如下:

y 离散:0≤p(yj)≤1P(y=yj)=p(yj)∑所有 yj 取值p(yj)=1\begin{array}{ll} y \ \text{离散:} & 0 \leq p(y_{j}) \leq 1 \\ & P(y=y_{j}) = p(y_{j}) \\ & \sum_{\text{所有 } y_{j} \text{ 取值}} p(y_{j}) = 1 \end{array}

yy 连续:

P(a≤y≤b)=∫abf(y) dy∫−∞∞f(y) dy=1\begin{array}{l} P(a \leq y \leq b) = \int_{a}^{b} f(y)\,dy \\ \int_{-\infty}^{\infty} f(y)\,dy = 1 \end{array}

均值、方差与期望值。 概率分布的均值 μ\mu 是其集中趋势或位置的度量。数学上,我们把均值定义为

μ={∫−∞∞yf(y) dyy 连续∑所有 yyp(yj)y 离散(2.1)\mu = \left\{ \begin{array}{ll} \int_{-\infty}^{\infty} y f(y)\,dy & y \text{ 连续} \\ \sum_{\text{所有 } y} y p(y_{j}) & y \text{ 离散} \end{array} \right. \tag{2.1}

我们也可以用随机变量 yy 的期望值(expected value),即其长期平均值,来表示均值:

μ=E(y)={∫−∞∞yf(y) dyy 连续∑所有 yyp(yj)y 离散(2.2)\mu = E(y) = \left\{ \begin{array}{ll} \int_{-\infty}^{\infty} y f(y)\,dy & y \text{ 连续} \\ \sum_{\text{所有 } y} y p(y_{j}) & y \text{ 离散} \end{array} \right. \tag{2.2}

其中 EE 表示期望值算子。

图 2.4 离散和连续概率分布

概率分布的变异或离散程度可以用方差来度量,其定义为

σ2={∫−∞∞(y−μ)2f(y) dyy 连续∑所有 y(y−μ)2p(yj)y 离散(2.3)\sigma^{2} = \left\{ \begin{array}{ll} \int_{-\infty}^{\infty} (y-\mu)^{2} f(y)\,dy & y \text{ 连续} \\ \sum_{\text{所有 } y} (y-\mu)^{2} p(y_{j}) & y \text{ 离散} \end{array} \right. \tag{2.3}

注意,方差可以完全用期望来表示,因为

σ2=E[(y−μ)2](2.4)\sigma^{2} = E[(y-\mu)^{2}] \tag{2.4}

最后,由于方差被如此广泛地使用,我们不妨定义一个方差算子 VV,使得

V(y)=E[(y−μ)2]=σ2(2.5)V(y) = E[(y-\mu)^{2}] = \sigma^{2} \tag{2.5}

期望值和方差这两个概念在本书中通篇使用,回顾若干关于这些算子的初等结果可能是有帮助的。如果 yy 是一个均值为 μ\mu、方差为 σ2\sigma^{2} 的随机变量,cc 是常数,则

1. E(c)=c2. E(y)=μ3. E(cy)=cE(y)=cμ4. V(c)=05. V(y)=σ26. V(cy)=c2V(y)=c2σ2\begin{array}{l} \textbf{1.}\ E(c) = c \\ \textbf{2.}\ E(y) = \mu \\ \textbf{3.}\ E(cy) = cE(y) = c\mu \\ \textbf{4.}\ V(c) = 0 \\ \textbf{5.}\ V(y) = \sigma^{2} \\ \textbf{6.}\ V(cy) = c^{2}V(y) = c^{2}\sigma^{2} \end{array}

如果有两个随机变量,比如 y1y_{1} 满足 E(y1)=μ1E(y_{1})=\mu_{1}、V(y1)=σ12V(y_{1})=\sigma_{1}^{2},y2y_{2} 满足 E(y2)=μ2E(y_{2})=\mu_{2}、V(y2)=σ22V(y_{2})=\sigma_{2}^{2},则

7. E(y1+y2)=E(y1)+E(y2)=μ1+μ2\textbf{7.}\ E(y_{1}+y_{2}) = E(y_{1})+E(y_{2}) = \mu_{1}+\mu_{2}

可以证明

8. V(y1+y2)=V(y1)+V(y2)+2Cov⁡(y1,y2)\textbf{8.}\ V(y_{1}+y_{2}) = V(y_{1})+V(y_{2})+2\operatorname{Cov}(y_{1},y_{2})

其中

Cov⁡(y1,y2)=E[(y1−μ1)(y2−μ2)](2.6)\operatorname{Cov}(y_{1},y_{2}) = E[(y_{1}-\mu_{1})(y_{2}-\mu_{2})] \tag{2.6}

是随机变量 y1y_{1} 与 y2y_{2} 的协方差(covariance)。协方差是 y1y_{1} 与 y2y_{2} 之间线性关联程度的度量。更具体地说,可以证明若 y1y_{1} 与 y2y_{2} 独立,[1] 则 Cov⁡(y1,y2)=0\operatorname{Cov}(y_{1},y_{2})=0。我们还可以证明

9. V(y1−y2)=V(y1)+V(y2)−2Cov⁡(y1,y2)\textbf{9.}\ V(y_{1}-y_{2}) = V(y_{1})+V(y_{2})-2\operatorname{Cov}(y_{1},y_{2})

若 y1y_{1} 与 y2y_{2} 独立,则

10. V(y1±y2)=V(y1)+V(y2)=σ12+σ22\textbf{10.}\ V(y_{1} \pm y_{2}) = V(y_{1})+V(y_{2}) = \sigma_{1}^{2}+\sigma_{2}^{2}

并且

11. E(y1⋅y2)=E(y1)⋅E(y2)=μ1⋅μ2\textbf{11.}\ E(y_{1} \cdot y_{2}) = E(y_{1}) \cdot E(y_{2}) = \mu_{1} \cdot \mu_{2}

然而要注意,一般而言

12. E(y1y2)≠E(y1)E(y2)\textbf{12.}\ E\left(\frac{y_{1}}{y_{2}}\right) \neq \frac{E(y_{1})}{E(y_{2})}

无论 y1y_{1} 与 y2y_{2} 是否独立都成立。

Footnotes
  1. 注意其逆命题不一定成立,即可以有 Cov⁡(y1,y2)=0\operatorname{Cov}(y_{1},y_{2})=0,但这并不意味着 y1y_{1} 与 y2y_{2} 相互独立。例子参见 Hines 等(2003)。