Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

3.5 结果的实用解释

在实施试验、完成统计分析并考察基本假定之后,试验者就可以就所研究的问题得出实用结论了。这往往相对容易,而且对目前所考虑的这类简单试验来说,或许可以不太正式地进行,例如通过检视图 3.1 和图 3.2 那样的箱线图和散点图。然而,在某些情况下需要应用更形式化的技术。本节介绍其中一些技术。

3.5.1 回归模型

试验中涉及的因子可以是定量的或定性的。定量因子是其水平可以与数值尺度上的点相联系的因子,例如温度、压力或时间。定性因子则是其水平无法按大小顺序排列的因子。操作人员、原料批次和班次是典型的定性因子,因为没有理由按任何特定的数值顺序对它们排序。

就试验的初始设计与分析而言,两类因子的处理方式完全相同。试验者感兴趣的是确定因子各水平之间是否存在差异。事实上,方差分析把设计因子当作定性(即分类)变量来处理。如果因子确实是定性的(例如操作人员),那么考虑在该因子的某个中间水平上进行后续运行的响应就毫无意义。然而对于时间这样的定量因子,试验者通常关注所用取值的整个范围,特别是中间因子水平上后续运行的响应。也就是说,如果试验中使用了 1.0、2.0 和 3.0 小时这三个水平,我们可能希望预测 2.5 小时处的响应。因此,试验者常常希望为试验中的响应变量建立一个插值方程。这个方程就是所研究过程的一个经验模型。

拟合经验模型的一般方法称为回归分析(regression analysis),第 10 章将详细讨论。也可参见本章的补充材料。本节用例 3.1 的刻蚀速率数据简要说明这一技术。

图 3.10 给出了例 3.1 试验中刻蚀速率 yy 对功率 xx 的散点图。从散点图可以清楚看出,刻蚀速率与功率之间存在很强的关联。作为初步近似,我们可以尝试对数据拟合一个线性模型,例如

y=β0+β1x+ϵy = \beta_{0}+\beta_{1}x+\epsilon

其中 β0\beta_{0} 和 β1\beta_{1} 是待估计的未知参数,ϵ\epsilon 是随机误差项。估计这类模型参数常用的方法是最小二乘法(method of least squares),即选择 β\beta 的估计值使误差(ϵ\epsilon)的平方和最小。本例中的最小二乘拟合为

y^=137.62+2.527x\hat{y} = 137.62+2.527x

(如果你不熟悉回归方法,请参见第 10 章和本章补充材料。)

这一线性模型如图 3.10a 所示。在较高的功率设置下它似乎不太令人满意。或许在 xx 中加入一个二次项可以得到改进。所得的二次模型拟合为

y^=1147.77−8.2555x+0.028375x2\hat{y} = 1147.77-8.2555x+0.028375x^{2}

这一二次拟合如图 3.10b 所示。二次模型看来优于线性模型,因为它在较高功率设置处给出了更好的拟合。

一般地,我们希望拟合能充分描述系统或过程的最低阶多项式。在本例中,二次多项式似乎比线性模型拟合得更好,因此二次模型额外的复杂性是有道理的。然而,选择逼近多项式的阶数并不总是容易的,而且比较容易过拟合,也就是说,加入并不能真正改善拟合的高阶多项式项,反而增加了模型的复杂性,并常常损害它作为预测或插值方程的实用性。

在本例中,经验模型可以用来预测试验区域内各功率设置下的刻蚀速率。在另一些情况下,经验模型可以用来进行过程最优化,即找出使响应达到最好值的设计变量水平。这些问题的讨论和示例将在本书后面展开。

图 3.10 例 3.1 刻蚀速率数据的散点图与回归模型

3.5.2 处理均值之间的比较

假设对固定效应模型作方差分析时原假设被拒绝。这样我们就知道处理均值之间存在差异,但究竟哪些均值不同并未明确指出。在这种情形下,有时对处理均值做进一步的比较和分组分析可能有用。第 ii 个处理均值定义为 μi=μ+τi\mu_{i} = \mu+\tau_{i},μi\mu_{i} 由 y‾i.\overline{y}_{i.} 估计。处理均值之间的比较要么用处理合计 {yi.}\{y_{i.}\}、要么用处理平均 {y‾i.}\{\overline{y}_{i.}\} 来进行。进行这些比较的程序通常称为多重比较方法(multiple comparison methods)。下面几节讨论对各个处理均值或若干组处理均值进行比较的方法。

3.5.3 均值的图形比较

在方差分析之后,构造一个用于比较均值的图形程序非常容易。假设所关注的因子有 aa 个水平,y‾1.,y‾2.,…,y‾a.\overline{y}_{1.},\overline{y}_{2.},\ldots,\overline{y}_{a.} 是各处理平均。如果我们知道 σ\sigma,那么任一处理平均的标准差都是 σ/n\sigma/\sqrt{n}。因此,如果所有因子水平均值完全相同,所观测到的样本均值 y‾i.\overline{y}_{i.} 的行为就会像是一组从均值为 y‾i.\overline{y}_{i.}、标准差为 σ/n\sigma/\sqrt{n} 的正态分布中随机抽取的观测值。设想有一个正态分布可以沿某条轴滑动,而轴的下方画着 y‾1.,y‾2.,…,y‾a.\overline{y}_{1.},\overline{y}_{2.},\ldots,\overline{y}_{a.}。如果各处理均值全都相等,就应当存在某个位置,使该分布显然能把 y‾i.\overline{y}_{i.} 这些值都解释为来自同一个分布。如果不是这样,那些看起来并非来自该分布的 y‾i.\overline{y}_{i.} 值就对应于产生不同平均响应的因子水平。

这一逻辑唯一的缺陷是 σ\sigma 未知。Box、Hunter 和 Hunter(2005)指出,我们可以用方差分析中的 MSE\sqrt{MS_{E}} 代替 σ\sigma,并使用带尺度因子 MSE/n\sqrt{MS_{E}/n} 的 tt 分布代替正态分布。例 3.1 刻蚀速率数据的这种安排如图 3.11 所示。请关注图中部那条实线曲线所表示的 tt 分布。

要勾画出图 3.11 中的 tt 分布,只需把横轴的 tt 值乘以尺度因子

MSE/n=330.70/5=8.13\sqrt{MS_{E}/n} = \sqrt{330.70/5} = 8.13

并把该点处 tt 的纵坐标画出来[1]。由于 tt 分布看起来很像正态分布,只是在中心附近略扁平、尾部更长,通常靠目测就能很容易地画出这一草图。如果你想更精确,Box、Hunter 和 Hunter(2005)给出了 tt 值及其对应纵坐标的表。这一分布可以取任意的原点,不过通常最好在待比较的 y‾i.\overline{y}_{i.} 值所在区域中选取一个。图 3.11 中原点取 615 Å/min。

现在设想把图 3.11 中的 tt 分布沿水平轴滑动(如图中虚线所示),并考察图中画出的四个均值。注意不存在任何位置能使四个平均都被看作来自该分布的典型随机观测值。这意味着四个均值并不相等,因此该图就是方差分析结果的图形展示。此外,该图表明功率的四个水平(160、180、200、220 W)产生的平均刻蚀速率彼此都不同。换句话说,μ1≠μ2≠μ3≠μ4\mu_{1} \neq \mu_{2} \neq \mu_{3} \neq \mu_{4}。

对许多多重比较问题来说,这个简单的程序是一种粗略但有效的技术。不过还有更形式化的方法,下面简要讨论其中的一些。

图 3.11 例 3.1 的刻蚀速率平均值与尺度因子为 MSE/n=330.70/5=8.13\sqrt{MS_{E}/n}=\sqrt{330.70/5}=8.13 的 tt 分布的关系

3.5.4 对照

许多多重比较方法都用到对照(contrast)的概念。考虑例 3.1 的等离子体刻蚀试验。由于原假设被拒绝,我们知道某些功率设置产生的刻蚀速率与另一些不同,但究竟是哪些造成了这一差异?我们可能在试验一开始就怀疑 200 W 与 220 W 产生相同的刻蚀速率,这意味着我们希望检验假设

H0:μ3=μ4H1:μ3≠μ4\begin{array}{l} H_{0}: \mu_{3} = \mu_{4} \\ H_{1}: \mu_{3} \neq \mu_{4} \end{array}

或等价地

H0:μ3−μ4=0H1:μ3−μ4≠0(3.23)\begin{array}{l} H_{0}: \mu_{3}-\mu_{4} = 0 \\ H_{1}: \mu_{3}-\mu_{4} \neq 0 \end{array} \tag{3.23}

如果我们在试验开始时怀疑最低功率水平的平均与最高功率水平的平均没有差异,那么假设应是

H0:μ1+μ2=μ3+μ4H1:μ1+μ2≠μ3+μ4\begin{array}{l} H_{0}: \mu_{1}+\mu_{2} = \mu_{3}+\mu_{4} \\ H_{1}: \mu_{1}+\mu_{2} \neq \mu_{3}+\mu_{4} \end{array}

或

H0:μ1+μ2−μ3−μ4=0H1:μ1+μ2−μ3−μ4≠0(3.24)\begin{array}{l} H_{0}: \mu_{1}+\mu_{2}-\mu_{3}-\mu_{4} = 0 \\ H_{1}: \mu_{1}+\mu_{2}-\mu_{3}-\mu_{4} \neq 0 \end{array} \tag{3.24}

一般地,对照是形如

Γ=∑i=1aciμi\Gamma = \sum_{i=1}^{a} c_{i}\mu_{i}

的参数线性组合,其中对照常数 c1,c2,…,cac_{1}, c_{2}, \ldots, c_{a} 之和为零,即 ∑i=1aci=0\sum_{i=1}^{a} c_{i} = 0。上述两个假设都可以用对照表示为

H0:∑i=1aciμi=0H1:∑i=1aciμi≠0(3.25)\begin{array}{l} H_{0}: \sum_{i=1}^{a} c_{i}\mu_{i} = 0 \\ H_{1}: \sum_{i=1}^{a} c_{i}\mu_{i} \neq 0 \end{array} \tag{3.25}

式 3.23 中假设的对照常数为 c1=c2=0c_{1}=c_{2}=0、c3=+1c_{3}=+1、c4=−1c_{4}=-1;而式 3.24 中假设的对照常数为 c1=c2=+1c_{1}=c_{2}=+1、c3=c4=−1c_{3}=c_{4}=-1。

检验涉及对照的假设有两种基本做法。第一种做法使用 tt 检验。把所关注的对照用处理平均写出,得到

C=∑i=1aciy‾i.C = \sum_{i=1}^{a} c_{i}\overline{y}_{i.}

当各处理的样本量相等时,CC 的方差为

V(C)=σ2n∑i=1aci2(3.26)V(C) = \frac{\sigma^{2}}{n}\sum_{i=1}^{a} c_{i}^{2} \tag{3.26}

如果式 3.25 中的原假设为真,则比值

∑i=1aciy‾i.σ2n∑i=1aci2\frac{\sum_{i=1}^{a} c_{i}\overline{y}_{i.}}{\sqrt{\frac{\sigma^{2}}{n}\sum_{i=1}^{a} c_{i}^{2}}}

服从 N(0,1)N(0,1) 分布。现在把未知方差 σ2\sigma^{2} 换成它的估计——误差均方 MSEMS_{E},并用统计量

t0=∑i=1aciy‾i.MSEn∑i=1aci2(3.27)t_{0} = \frac{\sum_{i=1}^{a} c_{i}\overline{y}_{i.}}{\sqrt{\frac{MS_{E}}{n}\sum_{i=1}^{a} c_{i}^{2}}} \tag{3.27}

来检验式 3.25 中的假设。若式 3.27 中的 ∣t0∣|t_{0}| 超过 tα/2,N−at_{\alpha/2,N-a},则拒绝原假设。

第二种做法使用 FF 检验。自由度为 vv 的 tt 随机变量的平方是分子自由度为 1、分母自由度为 vv 的 FF 随机变量。因此我们可以得到

F0=t02=(∑i=1aciy‾i.)2MSEn∑i=1aci2(3.28)F_{0} = t_{0}^{2} = \frac{\left(\sum_{i=1}^{a} c_{i}\overline{y}_{i.}\right)^{2}}{\frac{MS_{E}}{n}\sum_{i=1}^{a} c_{i}^{2}} \tag{3.28}

作为检验式 3.25 的 FF 统计量。若 F0>Fα,1,N−aF_{0} > F_{\alpha,1,N-a} 则拒绝原假设。我们可以把式 3.28 的检验统计量写成

F0=MSCMSE=SSC/1MSEF_{0} = \frac{MS_{C}}{MS_{E}} = \frac{SS_{C}/1}{MS_{E}}

其中单自由度的对照平方和为

SSC=(∑i=1aciy‾i.)21n∑i=1aci2(3.29)SS_{C} = \frac{\left(\sum_{i=1}^{a} c_{i}\overline{y}_{i.}\right)^{2}}{\frac{1}{n}\sum_{i=1}^{a} c_{i}^{2}} \tag{3.29}

对照的置信区间。 与检验关于对照的假设相比,构造置信区间有时更有用。设所关注的对照为

Γ=∑i=1aciμi\Gamma = \sum_{i=1}^{a} c_{i}\mu_{i}

把处理均值换成处理平均,得到

C=∑i=1aciy‾i.C = \sum_{i=1}^{a} c_{i}\overline{y}_{i.}

因为

E(∑i=1aciyˉi.)=∑i=1aciμi且V(C)=σ2/n∑i=1aci2E\left(\sum_{i=1}^{a} c_{i}\bar{y}_{i.}\right) = \sum_{i=1}^{a} c_{i}\mu_{i} \quad \text{且} \quad V(C) = \sigma^{2}/n\sum_{i=1}^{a} c_{i}^{2}

所以对照 ∑i=1aciμi\sum_{i=1}^{a} c_{i}\mu_{i} 的 100(1−α)100(1-\alpha) 百分置信区间为

∑i=1aciy‾i.−tα/2,N−aMSEn∑i=1aci2≤∑i=1aciμi≤∑i=1aciy‾i.+tα/2,N−aMSEn∑i=1aci2(3.30)\sum_{i=1}^{a} c_{i}\overline{y}_{i.}-t_{\alpha/2,N-a}\sqrt{\frac{MS_{E}}{n}\sum_{i=1}^{a} c_{i}^{2}} \leq \sum_{i=1}^{a} c_{i}\mu_{i} \leq \sum_{i=1}^{a} c_{i}\overline{y}_{i.}+t_{\alpha/2,N-a}\sqrt{\frac{MS_{E}}{n}\sum_{i=1}^{a} c_{i}^{2}} \tag{3.30}

注意我们用 MSEMS_{E} 估计了 σ2\sigma^{2}。显然,如果式 3.30 的置信区间包含零,我们就无法拒绝式 3.25 中的原假设。

标准化对照。 当关注的对照多于一个时,把它们放在同一尺度上评价往往很有用。一种做法是把对照标准化,使其方差为 σ2\sigma^{2}。如果对照 ∑i=1aciμi\sum_{i=1}^{a} c_{i}\mu_{i} 用处理平均写成 ∑i=1aciy‾i.\sum_{i=1}^{a} c_{i}\overline{y}_{i.},那么把它除以 (1/n)∑i=1aci2\sqrt{(1/n)\sum_{i=1}^{a} c_{i}^{2}},就得到方差为 σ2\sigma^{2} 的标准化对照。于是标准化对照实际上就是

∑i=1aci∗y‾i.\sum_{i=1}^{a} c_{i}^{*}\overline{y}_{i.}

其中

ci∗=ci1n∑i=1aci2c_{i}^{*} = \frac{c_{i}}{\sqrt{\frac{1}{n}\sum_{i=1}^{a} c_{i}^{2}}}

样本量不等。 当各处理的样本量不同时,上述结果要作少许修改。首先注意,对照的定义现在要求

∑i=1anici=0\sum_{i=1}^{a} n_{i}c_{i} = 0

其他需要的改动都很直接。例如,式 3.27 中的 tt 统计量变为

t0=∑i=1aciy‾i.MSE∑i=1aci2nit_{0} = \frac{\sum_{i=1}^{a} c_{i}\overline{y}_{i.}}{\sqrt{MS_{E}\sum_{i=1}^{a}\frac{c_{i}^{2}}{n_{i}}}}

而式 3.29 的对照平方和变为

SSC=(∑i=1aciy‾i.)2∑i=1aci2niSS_{C} = \frac{\left(\sum_{i=1}^{a} c_{i}\overline{y}_{i.}\right)^{2}}{\sum_{i=1}^{a}\frac{c_{i}^{2}}{n_{i}}}

3.5.5 正交对照

3.5.4 节程序的一个有用的特例是正交对照(orthogonal contrasts)。系数为 {ci}\{c_{i}\} 和 {di}\{d_{i}\} 的两个对照正交,如果

∑i=1acidi=0\sum_{i=1}^{a} c_{i}d_{i} = 0

或者对非平衡设计,如果

∑i=1acidi/ni=0\sum_{i=1}^{a} c_{i}d_{i}/n_{i} = 0

对 aa 个处理而言,a−1a-1 个正交对照的集合把处理平方和分解为 a−1a-1 个独立的单自由度分量。因此,对正交对照所作的检验是相互独立的。

为一组处理选择正交对照系数有许多方式。通常,试验本身的性质应当提示哪些比较是值得关注的。例如,若有 a=3a=3 个处理,其中处理 1 是对照,处理 2 和处理 3 是试验者关注的因子的实际水平,那么适当的正交对照可以是:

处理正交对照系数
1(对照)-20
2(水平 1)1-1
3(水平 2)11

注意系数为 ci=−2,1,1c_{i} = -2, 1, 1 的对照 1 把该因子的平均效应与对照相比较,而系数为 di=0,−1,1d_{i} = 0, -1, 1 的对照 2 则比较该因子的两个水平。

一般地,对照(或正交对照)方法对所谓的预先计划的比较(preplanned comparisons)很有用。也就是说,对照是在实施试验和考察数据之前就确定好的。原因是:如果在考察数据之后才选择比较,大多数试验者都会构造对应于所观测到的较大均值差异的检验。这些较大差异可能来自真实效应的存在,也可能来自随机误差。如果试验者总是挑最大的差异来比较,就会放大检验的第 I 类错误,因为在所选择的比较中,观测差异由误差造成的比例很可能会异常高。考察数据以挑选可能关注的比较,通常称为数据窥探(data snooping)。下一节讨论的用于所有比较的 Scheffé 方法允许数据窥探。

例 3.6

考虑例 3.1 的等离子体刻蚀试验。共有四个处理均值,处理之间有 3 个自由度。假设在实施试验之前就确定了下面这组处理均值之间的比较(以及相应的对照):

假设对照
H0:μ1=μ2H_{0}: \mu_{1} = \mu_{2}C1=y‾1.−y‾2.C_{1} = \overline{y}_{1.}-\overline{y}_{2.}
H0:μ1+μ2=μ3+μ4H_{0}: \mu_{1}+\mu_{2} = \mu_{3}+\mu_{4}C2=y‾1.+y‾2.−y‾3.−y‾4.C_{2} = \overline{y}_{1.}+\overline{y}_{2.}-\overline{y}_{3.}-\overline{y}_{4.}
H0:μ3=μ4H_{0}: \mu_{3} = \mu_{4}C3=y‾3.−y‾4.C_{3} = \overline{y}_{3.}-\overline{y}_{4.}

注意这些对照系数是正交的。利用表 3.4 中的数据,我们求得各对照的数值以及平方和如下:

C1=+1(551.2)−1(587.4)=−36.2C_{1} = +1(551.2)-1(587.4) = -36.2
SSC1=(−36.2)215(2)=3276.10SS_{C_{1}} = \frac{(-36.2)^{2}}{\frac{1}{5}(2)} = 3276.10
C2=+1(551.2)+1(587.4)−1(625.4)−1(707.0)=−193.8C_{2} = \begin{array}{l} +1(551.2)+1(587.4) \\ -1(625.4)-1(707.0) \end{array} = -193.8
SSC2=(−193.8)215(4)=46,948.05SS_{C_{2}} = \frac{(-193.8)^{2}}{\frac{1}{5}(4)} = 46{,}948.05
C3=+1(625.4)−1(707.0)=−81.6C_{3} = +1(625.4)-1(707.0) = -81.6
SSC3=(−81.6)215(2)=16,646.40SS_{C_{3}} = \frac{(-81.6)^{2}}{\frac{1}{5}(2)} = 16{,}646.40

这些对照平方和完全分解了处理平方和。对这些正交对照的检验通常并入方差分析,如表 3.11 所示。由 PP 值我们得出结论:功率设置的水平 1 与 2 之间、以及水平 3 与 4 之间的平均刻蚀速率存在显著差异;且在 α=0.05\alpha=0.05 水平下,水平 1 和 2 的平均确实与水平 3 和 4 的平均有显著差异。

表 3.11 等离子体刻蚀试验的方差分析

变异来源平方和自由度均方F0F_{0}PP 值
功率设置66,870.55322,290.1866.80< 0.001
正交对照
C1:μ1=μ2C_{1}: \mu_{1} = \mu_{2}(3276.10)13276.109.82< 0.01
C2:μ1+μ2=μ3+μ4C_{2}: \mu_{1}+\mu_{2} = \mu_{3}+\mu_{4}(46,948.05)146,948.05140.69< 0.001
C3:μ3=μ4C_{3}: \mu_{3} = \mu_{4}(16,646.40)116,646.4049.88< 0.001
误差5,339.2016333.70
总计72,209.7519

3.5.6 比较所有对照的 Scheffé 方法

在许多情形下,试验者可能事先并不知道希望比较哪些对照,或者关注的比较可能多于 a−1a-1 个。在许多探索性试验中,只有在对数据作初步考察之后才能发现关注的比较。Scheffé(1953)提出了一种比较处理均值之间任意和全部可能对照的方法。在 Scheffé 方法中,对任何可能的比较,第 I 类错误至多为 α\alpha。

假设已确定了一组 mm 个关于处理均值的对照

Γu=c1uμ1+c2uμ2+⋯+cauμau=1,2,…,m(3.31)\Gamma_{u} = c_{1u}\mu_{1}+c_{2u}\mu_{2}+\cdots+c_{au}\mu_{a} \quad u = 1, 2, \ldots, m \tag{3.31}

相应的处理平均的对照为

Cu=c1uy‾1.+c2uy‾2.+⋯+cauy‾a.u=1,2,…,m(3.32)C_{u} = c_{1u}\overline{y}_{1.}+c_{2u}\overline{y}_{2.}+\cdots+c_{au}\overline{y}_{a.} \quad u = 1, 2, \ldots, m \tag{3.32}

该对照的标准误为

SCu=MSE∑i=1a(ciu2/ni)(3.33)S_{C_{u}} = \sqrt{MS_{E}\sum_{i=1}^{a} (c_{iu}^{2}/n_{i})} \tag{3.33}

其中 nin_{i} 是第 ii 个处理中的观测值个数。可以证明,CuC_{u} 应当与之比较的临界值为

Sα,u=SCu(a−1)Fα,a−1,N−a(3.34)S_{\alpha,u} = S_{C_{u}}\sqrt{(a-1)F_{\alpha,a-1,N-a}} \tag{3.34}

要检验对照 Γu\Gamma_{u} 与零有显著差异这一假设,就把 CuC_{u} 与临界值比较。若 ∣Cu∣>Sα,u|C_{u}| > S_{\alpha,u},则拒绝对照 Γu\Gamma_{u} 等于零这一假设。

Scheffé 程序也可以用来构造处理均值之间所有可能对照的置信区间。所得到的区间,即 Cu−Sα,u≤Γu≤Cu+Sα,uC_{u}-S_{\alpha,u} \leq \Gamma_{u} \leq C_{u}+S_{\alpha,u},是同时置信区间,因为所有这些区间同时成立的概率至少为 1−α1-\alpha。

为说明这一程序,考虑例 3.1 中的数据,假设关注的对照为

Γ1=μ1+μ2−μ3−μ4\Gamma_{1} = \mu_{1}+\mu_{2}-\mu_{3}-\mu_{4}

和

Γ2=μ1−μ4\Gamma_{2} = \mu_{1}-\mu_{4}

这些对照的数值为

C1=y‾1.+y‾2.−y‾3.−y‾4.=551.2+587.4−625.4−707.0=−193.80\begin{aligned} C_{1} &= \overline{y}_{1.}+\overline{y}_{2.}-\overline{y}_{3.}-\overline{y}_{4.} \\ &= 551.2+587.4-625.4-707.0 = -193.80 \end{aligned}

和

C2=y‾1.−y‾4.=551.2−707.0=−155.8\begin{aligned} C_{2} &= \overline{y}_{1.}-\overline{y}_{4.} \\ &= 551.2-707.0 = -155.8 \end{aligned}

由式 3.33 求得标准误为

SC1=MSE∑i=15(ci12/ni)=333.70(1+1+1+1)/5=16.34S_{C_{1}} = \sqrt{MS_{E}\sum_{i=1}^{5} (c_{i1}^{2}/n_{i})} = \sqrt{333.70(1+1+1+1)/5} = 16.34

和

SC2=MSE∑i=15(ci22/ni)=333.70(1+1)/5=11.55S_{C_{2}} = \sqrt{MS_{E}\sum_{i=1}^{5} (c_{i2}^{2}/n_{i})} = \sqrt{333.70(1+1)/5} = 11.55

由式 3.34,1% 的临界值为

S0.01,1=SC1(a−1)F0.01,a−1,N−a=16.343(5.29)=65.09S_{0.01,1} = S_{C_{1}}\sqrt{(a-1)F_{0.01,a-1,N-a}} = 16.34\sqrt{3(5.29)} = 65.09

和

S0.01,2=SC2(a−1)F0.01,a−1,N−a=11.553(5.29)=45.97S_{0.01,2} = S_{C_{2}}\sqrt{(a-1)F_{0.01,a-1,N-a}} = 11.55\sqrt{3(5.29)} = 45.97

因为 ∣C1∣>S0.01,1|C_{1}| > S_{0.01,1},我们得出结论:对照 Γ1=μ1+μ2−μ3−μ4\Gamma_{1} = \mu_{1}+\mu_{2}-\mu_{3}-\mu_{4} 不等于零;也就是说,功率设置 1 和 2 作为一个整体的平均刻蚀速率,不同于功率设置 3 和 4 作为一个整体的平均刻蚀速率。此外,因为 ∣C2∣>S0.01,2|C_{2}| > S_{0.01,2},我们得出结论:对照 Γ2=μ1−μ4\Gamma_{2} = \mu_{1}-\mu_{4} 不等于零,即处理 1 与处理 4 的平均刻蚀速率存在显著差异。

3.5.7 处理均值对的比较

在许多实际情形中,我们只希望比较各对均值。我们常常可以通过检验所有处理均值对之间的差异来确定哪些均值不同。因此,我们关注的是形如 Γ=μi−μj\Gamma = \mu_{i}-\mu_{j}(对所有 i≠ji \neq j)的对照。尽管上一节所述的 Scheffé 方法可以方便地应用于这一问题,但它并不是这类比较中最灵敏的程序。下面我们转向专门为所有 aa 个总体均值之间的两两比较而设计的方法。

假设我们关注 aa 个处理均值的所有对都比较,希望检验的原假设是 H0:μi=μjH_{0}: \mu_{i} = \mu_{j}(对所有 i≠ji \neq j)。这个问题有许多可用的程序,下面介绍两种流行的比较方法。

Tukey 检验。 假设在一次拒绝了处理均值相等这一原假设的方差分析之后,我们希望检验所有两两均值比较:

H0:μi=μjH1:μi≠μj\begin{array}{l} H_{0}: \mu_{i} = \mu_{j} \\ H_{1}: \mu_{i} \neq \mu_{j} \end{array}

对所有 i≠ji \neq j。Tukey(1953)提出了一个检验这些假设的程序:样本量相等时总显著性水平恰好为 α\alpha,样本量不等时至多为 α\alpha。他的程序也可以用来构造所有均值对之差的置信区间。对这些区间而言,样本量相等时同时置信水平为 100(1−α)100(1-\alpha) 个百分点,样本量不等时至少为 100(1−α)100(1-\alpha) 个百分点。换句话说,Tukey 程序把试验误差率或“族”错误率控制在所选水平 α\alpha 上。当关注点集中在均值对上时,这是一个极好的数据窥探程序。

Tukey 程序使用学生化极差统计量(studentized range statistic)的分布

q=y‾max⁡−y‾min⁡MSE/nq = \frac{\overline{y}_{\max}-\overline{y}_{\min}}{\sqrt{MS_{E}/n}}

其中 y‾max⁡\overline{y}_{\max} 和 y‾min⁡\overline{y}_{\min} 分别是一组 pp 个样本均值中的最大者和最小者。附录表 V 给出了 qα(p,f)q_{\alpha}(p,f) 的值,即 qq 的上侧 α\alpha 分位点,其中 ff 是与 MSEMS_{E} 相关联的自由度个数。对等样本量,若某两个均值的样本差异绝对值超过

Tα=qα(a,f)MSEn(3.35)T_{\alpha} = q_{\alpha}(a,f)\sqrt{\frac{MS_{E}}{n}} \tag{3.35}

Tukey 检验就判定这两个均值显著不同。等价地,我们可以按如下方式构造所有均值对的 100(1−α)100(1-\alpha) 百分置信区间:

y‾i.−y‾j.−qα(a,f)MSEn≤μi−μj≤y‾i.−y‾j.+qα(a,f)MSEn,  i≠j.(3.36)\begin{aligned} &\overline{y}_{i.}-\overline{y}_{j.}-q_{\alpha}(a,f)\sqrt{\frac{MS_{E}}{n}} \leq \mu_{i}-\mu_{j} \\ &\qquad \leq \overline{y}_{i.}-\overline{y}_{j.}+q_{\alpha}(a,f)\sqrt{\frac{MS_{E}}{n}}, \; i \neq j. \end{aligned} \tag{3.36}

当样本量不相等时,式 3.35 和式 3.36 分别变为

Tα=qα(a,f)2MSE(1ni+1nj)(3.37)T_{\alpha} = \frac{q_{\alpha}(a,f)}{\sqrt{2}}\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{j}}\right)} \tag{3.37}

和

y‾i.−y‾j.−qα(a,f)2MSE(1ni+1nj)≤μi−μj≤y‾i.−y‾j.+qα(a,f)2MSE(1ni+1nj),  i≠j(3.38)\begin{aligned} &\overline{y}_{i.}-\overline{y}_{j.}-\frac{q_{\alpha}(a,f)}{\sqrt{2}}\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{j}}\right)} \leq \mu_{i}-\mu_{j} \\ &\qquad \leq \overline{y}_{i.}-\overline{y}_{j.}+\frac{q_{\alpha}(a,f)}{\sqrt{2}}\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{j}}\right)}, \; i \neq j \end{aligned} \tag{3.38}

样本量不等的版本有时称为 Tukey–Kramer 程序。

式 3.36 中 Tukey 置信区间的推导对等样本量而言很直接。对学生化极差统计量 qq,我们有

P(max⁡(y‾i.−μi)−min⁡(y‾i.−μi)MSE/n≤qα(a,f))=1−αP\left(\frac{\max(\overline{y}_{i.}-\mu_{i})-\min(\overline{y}_{i.}-\mu_{i})}{\sqrt{MS_{E}/n}} \leq q_{\alpha}(a,f)\right) = 1-\alpha

若 max⁡(y‾i.−μi)−min⁡(y‾i.−μi)\max(\overline{y}_{i.}-\mu_{i})-\min(\overline{y}_{i.}-\mu_{i}) 小于或等于 qα(a,f)MSE/nq_{\alpha}(a,f)\sqrt{MS_{E}/n},则对每一对均值都必有 ∣(y‾i.−μi)−(y‾j.−μj)∣≤qα(a,f)MSE/n|(\overline{y}_{i.}-\mu_{i})-(\overline{y}_{j.}-\mu_{j})| \leq q_{\alpha}(a,f)\sqrt{MS_{E}/n}。因此

P(−qα(a,f)MSEn≤y‾i.−y‾j.−(μi−μj)≤qα(a,f)MSEn)=1−αP\left(-q_{\alpha}(a,f)\sqrt{\frac{MS_{E}}{n}} \leq \overline{y}_{i.}-\overline{y}_{j.}-(\mu_{i}-\mu_{j}) \leq q_{\alpha}(a,f)\sqrt{\frac{MS_{E}}{n}}\right) = 1-\alpha

把这一表达式整理,将 μi−μj\mu_{i}-\mu_{j} 分离到不等式中间,就得到式 3.38 给出的那组 100(1−α)100(1-\alpha) 百分同时置信区间。

例 3.7

为说明 Tukey 检验,我们使用例 3.1 中等离子体刻蚀试验的数据。取 α=0.05\alpha=0.05,误差自由度为 f=16f=16,附录表 V 给出 q0.05(4,16)=4.05q_{0.05}(4,16)=4.05。因此由式 3.35,

T0.05=q0.05(4,16)MSEn=4.05333.705=33.09T_{0.05} = q_{0.05}(4,16)\sqrt{\frac{MS_{E}}{n}} = 4.05\sqrt{\frac{333.70}{5}} = 33.09

于是,任何两个处理平均的绝对差超过 33.09,就意味着相应的这对总体均值显著不同。四个处理平均是

y‾1.=551.2y‾2.=587.4y‾3.=625.4y‾4.=707.0\begin{array}{ll} \overline{y}_{1.} = 551.2 & \overline{y}_{2.} = 587.4 \\ \overline{y}_{3.} = 625.4 & \overline{y}_{4.} = 707.0 \end{array}

平均之差为

y‾1.−y‾2.=551.2−587.4=−36.20∗\overline{y}_{1.}-\overline{y}_{2.} = 551.2-587.4 = -36.20^{*}
y‾1.−y‾3.=551.2−625.4=−74.20∗\overline{y}_{1.}-\overline{y}_{3.} = 551.2-625.4 = -74.20^{*}
y‾1.−y‾4.=551.2−707.0=−155.8∗\overline{y}_{1.}-\overline{y}_{4.} = 551.2-707.0 = -155.8^{*}
y‾2.−y‾3.=587.4−625.4=−38.0∗\overline{y}_{2.}-\overline{y}_{3.} = 587.4-625.4 = -38.0^{*}
y‾2.−y‾4.=587.4−707.0=−119.6∗\overline{y}_{2.}-\overline{y}_{4.} = 587.4-707.0 = -119.6^{*}
y‾3.−y‾4.=625.4−707.0=−81.60∗\overline{y}_{3.}-\overline{y}_{4.} = 625.4-707.0 = -81.60^{*}

带星号的数值表示显著不同的均值对。注意 Tukey 程序表明所有均值对都不同。因此,每个功率设置产生的平均刻蚀速率都与其他任一功率设置下的平均刻蚀速率不同。

在使用任何均值两两检验程序时,我们偶尔会发现方差分析的总 FF 检验显著,但均值的两两比较却没有揭示出任何显著差异。出现这种情况是因为 FF 检验同时考虑涉及处理均值的所有可能对照,而不只是两两比较。也就是说,在当前数据中,显著的对照可能不是 μi−μj\mu_{i}-\mu_{j} 的形式。

Fisher 最小显著差(LSD)法。 Fisher 比较所有均值对的方法控制每次单个两两比较的错误率 α\alpha,但不控制试验误差率或族错误率。该程序使用 tt 统计量检验 H0:μi=μjH_{0}: \mu_{i} = \mu_{j}:

t0=y‾i.−y‾j.MSE(1ni+1nj)(3.39)t_{0} = \frac{\overline{y}_{i.}-\overline{y}_{j.}}{\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{j}}\right)}} \tag{3.39}

假设是双侧备择假设,若 ∣y‾i.−y‾j.∣>tα/2,N−aMSE(1/ni+1/nj)|\overline{y}_{i.}-\overline{y}_{j.}| > t_{\alpha/2,N-a}\sqrt{MS_{E}(1/n_{i}+1/n_{j})},则判定均值 μi\mu_{i} 与 μj\mu_{j} 显著不同。量

LSD=tα/2,N−aMSE(1ni+1nj)(3.40)\mathrm{LSD} = t_{\alpha/2,N-a}\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{j}}\right)} \tag{3.40}

称为最小显著差。如果设计是平衡的,n1=n2=⋯=na=nn_{1}=n_{2}=\cdots=n_{a}=n,则

LSD=tα/2,N−a2MSEn(3.41)\mathrm{LSD} = t_{\alpha/2,N-a}\sqrt{\frac{2MS_{E}}{n}} \tag{3.41}

使用 Fisher LSD 程序时,我们只需把每一对平均之间观测到的差异与相应的 LSD 比较。若 ∣y‾i.−y‾j.∣>LSD|\overline{y}_{i.}-\overline{y}_{j.}| > \mathrm{LSD},我们就得出结论:总体均值 μi\mu_{i} 与 μj\mu_{j} 不同。也可使用式 3.39 的 tt 统计量。

例 3.8

为说明这一程序,如果使用例 3.1 试验的数据,α=0.05\alpha = 0.05 时的 LSD 为

LSD=t.025,162MSEn=2.1202(333.70)5=24.49\mathrm{LSD} = t_{.025,16}\sqrt{\frac{2MS_{E}}{n}} = 2.120\sqrt{\frac{2(333.70)}{5}} = 24.49

于是,任何两个处理平均的绝对差超过 24.49,就意味着相应的这对总体均值显著不同。平均之差为

y‾1.−y‾2.=551.2−587.4=−36.2∗\overline{y}_{1.}-\overline{y}_{2.} = 551.2-587.4 = -36.2^{*}
y‾1.−y‾3.=551.2−625.4=−74.2∗\overline{y}_{1.}-\overline{y}_{3.} = 551.2-625.4 = -74.2^{*}
y‾1.−y‾4.=551.2−707.0=−155.8∗\overline{y}_{1.}-\overline{y}_{4.} = 551.2-707.0 = -155.8^{*}
y‾2.−y‾3.=587.4−625.4=−38.0∗\overline{y}_{2.}-\overline{y}_{3.} = 587.4-625.4 = -38.0^{*}
y‾2.−y‾4.=587.4−707.0=−119.6∗\overline{y}_{2.}-\overline{y}_{4.} = 587.4-707.0 = -119.6^{*}
y‾3.−y‾4.=625.4−707.0=−81.6∗\overline{y}_{3.}-\overline{y}_{4.} = 625.4-707.0 = -81.6^{*}

带星号的数值表示显著不同的均值对。显然,所有均值对都显著不同。

注意使用这一方法可能使总的 α\alpha 风险明显放大。具体地说,随着处理数 aa 增大,试验误差率或族第 I 类错误率(至少犯一次第 I 类错误的试验次数与试验总次数之比)会变得很大。

我该用哪种两两比较方法? 此时一个合乎逻辑的问题当然是:我应当使用这些程序中的哪一个?遗憾的是,这个问题没有明确的答案,而且专业统计学家常常对各种程序的实用性持不同意见。Carmer 和 Swanson(1973)对若干多重比较程序(包括这里未讨论的其他程序)作了 Monte Carlo 模拟研究。他们报告说,最小显著差法如果只在方差分析的 FF 检验于 5% 水平显著之后才使用,那么它是检出均值真实差异的一种非常有效的检验。然而,这一方法不控制试验误差率。由于 Tukey 方法确实控制总体错误率,许多统计学家更愿意使用它。

如上所述,还有其他若干多重比较程序。关于这些方法的文献,见 O’Neill 和 Wetherill(1971)、Miller(1977)以及 Nelson(1989)。Miller(1991)和 Hsu(1996)的著作也值得推荐。

3.5.8 处理均值与对照的比较

在许多试验中,其中一个处理是对照,分析者关注的是把其余 a−1a-1 个处理均值各自与对照比较。因此只需作 a−1a-1 个比较。Dunnett(1964)提出了进行这些比较的一个程序。假设处理 aa 是对照,我们希望检验假设

H0:μi=μaH1:μi≠μa\begin{array}{l} H_{0}: \mu_{i} = \mu_{a} \\ H_{1}: \mu_{i} \neq \mu_{a} \end{array}

其中 i=1,2,…,a−1i = 1, 2, \ldots, a-1。Dunnett 程序是对通常 tt 检验的一种修改。对每个假设,我们计算所观测到的样本均值之差

∣y‾i.−y‾a.∣i=1,2,…,a−1|\overline{y}_{i.}-\overline{y}_{a.}| \quad i = 1, 2, \ldots, a-1

若

∣yˉi.−yˉa.∣>dα(a−1,f)MSE(1ni+1na)(3.42)\left|\bar{y}_{i.}-\bar{y}_{a.}\right| > d_{\alpha}(a-1,f)\sqrt{MS_{E}\left(\frac{1}{n_{i}}+\frac{1}{n_{a}}\right)} \tag{3.42}

则以第 I 类错误率 α\alpha 拒绝原假设 H0:μi=μaH_{0}: \mu_{i} = \mu_{a},其中常数 dα(a−1,f)d_{\alpha}(a-1,f) 见附录表 VI。(双侧和单侧检验都可以进行。)注意 α\alpha 是与全部 a−1a-1 个检验相关联的联合显著性水平。

例 3.9

为说明 Dunnett 检验,考虑例 3.1 的试验,把处理 4 视为对照。本例中 a=4a=4、a−1=3a-1=3、f=16f=16、ni=n=5n_{i}=n=5。在 5% 水平下,由附录表 VI 查得 d0.05(3,16)=2.59d_{0.05}(3,16)=2.59。因此临界差为

d0.05(3,16)2MSEn=2.592(333.70)5=29.92d_{0.05}(3,16)\sqrt{\frac{2MS_{E}}{n}} = 2.59\sqrt{\frac{2(333.70)}{5}} = 29.92

(注意这是平衡设计下式 3.42 的化简形式。)于是,任何与对照的绝对差超过 29.92 的处理均值都将被判定为显著不同。所观测到的差为

1 对 4:y‾1.−y‾4.=551.2−707.0=−155.81 \text{ 对 } 4: \overline{y}_{1.}-\overline{y}_{4.} = 551.2-707.0 = -155.8
2 对 4:y‾2.−y‾4.=587.4−707.0=−119.62 \text{ 对 } 4: \overline{y}_{2.}-\overline{y}_{4.} = 587.4-707.0 = -119.6
3 对 4:y‾3.−y‾4.=625.4−707.0=−81.63 \text{ 对 } 4: \overline{y}_{3.}-\overline{y}_{4.} = 625.4-707.0 = -81.6

注意所有差异都显著。因此我们会得出结论:所有功率设置都与对照不同。

在处理与对照的比较中,一个好的做法是让对照处理取比其他处理(设为 nn)更多的观测值(设为 nan_{a}),并假定其余 a−1a-1 个处理的观测值个数相等。比值 na/nn_{a}/n 应取为约等于处理总数的平方根,即取 na/n=an_{a}/n = \sqrt{a}。

Footnotes
  1. 原文此处及其后的图 3.11 图题中写作 330.70/5=8.13\sqrt{330.70/5}=8.13,但例 3.1 方差分析表中 MSE=333.70MS_{E}=333.70,且计算机输出给出的处理均值标准误为 333.70/5=8.17\sqrt{333.70/5}=8.17。此处 330.70 应为原文笔误,译文按原文译出。——译者注