Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

3.2 方差分析

假设我们有 aa 个处理,即某个单因子的 aa 个不同水平,希望加以比较。aa 个处理中每一个的观测响应都是一个随机变量。数据将如表 3.2 所示。表 3.2 中的每一项(例如 yijy_{ij})表示在因子水平(或处理)ii 下取得的第 jj 个观测值。一般地,在第 ii 个处理下有 nn 个观测值。注意表 3.2 就是表 3.1 中等离子体刻蚀试验数据的一般情形。

数据的模型。 用模型来描述试验的观测值是很有用的。写出这一模型的一种方式是

yij=μi+ϵij{i=1,2,…,aj=1,2,…,n(3.1)y_{ij} = \mu_{i}+\epsilon_{ij} \quad \left\{ \begin{array}{l} i = 1, 2, \ldots, a \\ j = 1, 2, \ldots, n \end{array} \right. \tag{3.1}

其中 yijy_{ij} 是第 ijij 个观测值,μi\mu_{i} 是第 ii 个因子水平(或处理)的均值,ϵij\epsilon_{ij} 是随机误差分量,它包含了试验中所有其他变异来源,包括测量误差、来自未受控制因子的变异、施加处理的试验单元(如试验材料)之间的差异,以及过程中的一般本底噪声(例如随时间的变异、环境变量的影响)。方便的做法是把误差看作均值为零,从而 E(yij)=μiE(y_{ij})=\mu_{i}。

式 3.1 称为均值模型(means model)。写出数据模型的另一种方式是定义

μi=μ+τi,i=1,2,…,a\mu_{i} = \mu+\tau_{i}, \quad i = 1, 2, \ldots, a

于是式 3.1 变为

yij=μ+τi+ϵij{i=1,2,…,aj=1,2,…,n(3.2)y_{ij} = \mu+\tau_{i}+\epsilon_{ij} \quad \left\{ \begin{array}{l} i = 1, 2, \ldots, a \\ j = 1, 2, \ldots, n \end{array} \right. \tag{3.2}

在这种形式的模型中,μ\mu 是所有处理共有的参数,称为总均值(overall mean);τi\tau_{i} 是第 ii 个处理特有的参数,称为第 ii 个处理效应(treatment effect)。式 3.2 通常称为效应模型(effects model)。

均值模型和效应模型都是线性统计模型;也就是说,响应变量 yijy_{ij} 是模型参数的线性函数。两种形式的模型都有用,但效应模型在试验设计文献中更为常见。它有一定的直观吸引力:μ\mu 是常数,而处理效应 τi\tau_{i} 表示施加具体处理时对这一常数的偏离。

式 3.2(或式 3.1)也称为一元或单因子方差分析(analysis of variance,ANOVA)模型,因为只考察了一个因子。此外,我们要求试验按随机顺序进行,使施加处理的环境(常称为试验单元,experimental unit)尽可能均匀。因此,试验设计是一个完全随机化设计。我们的目标是检验关于处理均值的适当假设并估计它们。对于假设检验,假定模型误差是均值为零、方差为 σ2\sigma^{2} 的正态独立随机变量。方差 σ2\sigma^{2} 假定对因子的所有水平都相同,这意味着观测值

yij∼N(μ+τi,σ2)y_{ij} \sim N(\mu+\tau_{i}, \sigma^{2})

且各观测值相互独立。

表 3.2 单因子试验的典型数据

处理(水平)观测值合计平均
1y11y_{11}y12y_{12}⋯\cdotsy1ny_{1n}y1.y_{1.}y‾1.\overline{y}_{1.}
2y21y_{21}y22y_{22}⋯\cdotsy2ny_{2n}y2.y_{2.}y‾2.\overline{y}_{2.}
⋮\vdots⋮\vdots⋮\vdots⋯\cdots⋮\vdots⋮\vdots⋮\vdots
aaya1y_{a1}ya2y_{a2}⋯\cdotsyany_{an}ya.y_{a.}y‾a.\overline{y}_{a.}
y..y_{..}y‾..\overline{y}_{..}

固定因子还是随机因子? 统计模型(式 3.2)就处理效应描述了两种不同的情形。第一,这 aa 个处理可能是由试验者特意选定的。在这种情形下,我们希望检验关于处理均值的假设,而我们的结论只适用于分析中所考虑的那些因子水平,不能推广到未明确考虑过的类似处理。我们可能还希望估计模型参数 (μ,τi,σ2)(\mu, \tau_{i}, \sigma^{2})。这称为固定效应模型(fixed effects model)。第二,这 aa 个处理可能是从更大的处理总体中随机抽取的样本。在这种情形下,我们希望把结论(基于处理样本得出的)推广到总体中的所有处理,无论它们是否在分析中被明确考虑过。此时 τi\tau_{i} 是随机变量,关于所考察的具体那几个 τi\tau_{i} 的知识用处相对不大;相反,我们检验关于 τi\tau_{i} 变异的假设,并设法估计这种变异。这称为随机效应模型(random effects model)或方差分量模型(components of variance model)。我们将在 3.9 节讨论单因子随机效应模型,而关于随机因子试验更完整的讨论则推迟到第 13 章。