3.2 方差分析
假设我们有 个处理,即某个单因子的 个不同水平,希望加以比较。 个处理中每一个的观测响应都是一个随机变量。数据将如表 3.2 所示。表 3.2 中的每一项(例如 )表示在因子水平(或处理) 下取得的第 个观测值。一般地,在第 个处理下有 个观测值。注意表 3.2 就是表 3.1 中等离子体刻蚀试验数据的一般情形。
数据的模型。 用模型来描述试验的观测值是很有用的。写出这一模型的一种方式是
其中 是第 个观测值, 是第 个因子水平(或处理)的均值, 是随机误差分量,它包含了试验中所有其他变异来源,包括测量误差、来自未受控制因子的变异、施加处理的试验单元(如试验材料)之间的差异,以及过程中的一般本底噪声(例如随时间的变异、环境变量的影响)。方便的做法是把误差看作均值为零,从而 。
式 3.1 称为均值模型(means model)。写出数据模型的另一种方式是定义
于是式 3.1 变为
在这种形式的模型中, 是所有处理共有的参数,称为总均值(overall mean); 是第 个处理特有的参数,称为第 个处理效应(treatment effect)。式 3.2 通常称为效应模型(effects model)。
均值模型和效应模型都是线性统计模型;也就是说,响应变量 是模型参数的线性函数。两种形式的模型都有用,但效应模型在试验设计文献中更为常见。它有一定的直观吸引力: 是常数,而处理效应 表示施加具体处理时对这一常数的偏离。
式 3.2(或式 3.1)也称为一元或单因子方差分析(analysis of variance,ANOVA)模型,因为只考察了一个因子。此外,我们要求试验按随机顺序进行,使施加处理的环境(常称为试验单元,experimental unit)尽可能均匀。因此,试验设计是一个完全随机化设计。我们的目标是检验关于处理均值的适当假设并估计它们。对于假设检验,假定模型误差是均值为零、方差为 的正态独立随机变量。方差 假定对因子的所有水平都相同,这意味着观测值
且各观测值相互独立。
表 3.2 单因子试验的典型数据
| 处理(水平) | 观测值 | 合计 | 平均 | |||
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | ||||||
固定因子还是随机因子? 统计模型(式 3.2)就处理效应描述了两种不同的情形。第一,这 个处理可能是由试验者特意选定的。在这种情形下,我们希望检验关于处理均值的假设,而我们的结论只适用于分析中所考虑的那些因子水平,不能推广到未明确考虑过的类似处理。我们可能还希望估计模型参数 。这称为固定效应模型(fixed effects model)。第二,这 个处理可能是从更大的处理总体中随机抽取的样本。在这种情形下,我们希望把结论(基于处理样本得出的)推广到总体中的所有处理,无论它们是否在分析中被明确考虑过。此时 是随机变量,关于所考察的具体那几个 的知识用处相对不大;相反,我们检验关于 变异的假设,并设法估计这种变异。这称为随机效应模型(random effects model)或方差分量模型(components of variance model)。我们将在 3.9 节讨论单因子随机效应模型,而关于随机因子试验更完整的讨论则推迟到第 13 章。