Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

2.5 关于均值差的推断:配对比较设计

2.5.1 配对比较问题

在一些简单比较试验中,通过在被配成对的试验材料内部进行比较,可以极大地提高精度。例如,考虑一台硬度试验机:它用一个尖头以已知的力压入金属试样,通过测量尖头造成的压痕深度来确定试样的硬度。这台机器有两种可用的尖头,虽然两种尖头所做测量的精度(变异)似乎相同,但有人怀疑其中一种尖头给出的平均硬度读数与另一种不同。

试验可以这样进行:随机选取若干金属试样(例如 20 个),其中一半用尖头 1 测试,另一半用尖头 2 测试,试样分配给尖头的具体方案随机确定。由于这是一个完全随机化设计,可以用 2.4 节所述的 tt 检验来比较两个样本的平均硬度。

表 2.5 正态分布均值的检验,方差未知

假设检验统计量固定显著性水平的拒绝准则PP 值
H0:μ=μ0H_{0}: \mu = \mu_{0}
H1:μ≠μ0H_{1}: \mu \neq \mu_{0}∣t0∣>tα/2,n−1\vert t_{0}\vert > t_{\alpha/2,n-1}t0t_{0} 以上与 −t0-t_{0} 以下的概率之和
H0:μ=μ0H_{0}: \mu = \mu_{0}
H1:μ<μ0H_{1}: \mu < \mu_{0}t0=yˉ−μ0S/nt_{0} = \dfrac{\bar{y}-\mu_{0}}{S/\sqrt{n}}t0<−tα,n−1t_{0} < -t_{\alpha,n-1}t0t_{0} 以下的概率
H0:μ=μ0H_{0}: \mu = \mu_{0}
H1:μ>μ0H_{1}: \mu > \mu_{0}t0>tα,n−1t_{0} > t_{\alpha,n-1}t0t_{0} 以上的概率
若 σ12=σ22\sigma_{1}^{2} = \sigma_{2}^{2}
H0:μ1=μ2H_{0}: \mu_{1} = \mu_{2}
H1:μ1≠μ2H_{1}: \mu_{1} \neq \mu_{2}t0=yˉ1−yˉ2Sp1n1+1n2t_{0} = \dfrac{\bar{y}_{1}-\bar{y}_{2}}{S_{p}\sqrt{\frac{1}{n_{1}}+\frac{1}{n_{2}}}}∣t0∣>tα/2,v\vert t_{0}\vert > t_{\alpha/2,v}t0t_{0} 以上与 −t0-t_{0} 以下的概率之和
v=n1+n2−2v = n_{1}+n_{2}-2
若 σ12≠σ22\sigma_{1}^{2} \neq \sigma_{2}^{2}
H0:μ1=μ2H_{0}: \mu_{1} = \mu_{2}
H1:μ1<μ2H_{1}: \mu_{1} < \mu_{2}t0=yˉ1−yˉ2S12n1+S22n2t_{0} = \dfrac{\bar{y}_{1}-\bar{y}_{2}}{\sqrt{\frac{S_{1}^{2}}{n_{1}}+\frac{S_{2}^{2}}{n_{2}}}}t0<−tα,vt_{0} < -t_{\alpha,v}t0t_{0} 以下的概率
H0:μ1=μ2H_{0}: \mu_{1} = \mu_{2}
H1:μ1>μ2H_{1}: \mu_{1} > \mu_{2}v=(S12n1+S22n2)2(S12/n1)2n1−1+(S22/n2)2n2−1v = \dfrac{\left(\frac{S_{1}^{2}}{n_{1}}+\frac{S_{2}^{2}}{n_{2}}\right)^{2}}{\frac{(S_{1}^{2}/n_{1})^{2}}{n_{1}-1}+\frac{(S_{2}^{2}/n_{2})^{2}}{n_{2}-1}}t0>tα,vt_{0} > t_{\alpha,v}t0t_{0} 以上的概率

稍加思考就会发现,对于这个问题,完全随机化设计有一个严重的缺点。假设这些金属试样是从不同炉次生产的、或者在其他方面并不完全均匀(而这一点可能影响硬度)的不同棒材上切下来的。试样之间的这种非齐同性会增加硬度测量的变异,并倾向于抬高试验误差,从而使两种尖头之间的真实差异更难检出。

为了防止这种可能,考虑另一种试验设计。假设每个试样都足够大,可以在其上做两次硬度测定。这一替代设计就是把每个试样分成两部分,然后随机地把一种尖头分配给每个试样的一半,把另一种尖头分配给剩下的一半;对某个特定试样,两种尖头测试的先后顺序也随机确定。按这一设计用 10 个试样做试验,得到的数据(已编码)见表 2.6。

表 2.6 硬度试验的数据

试样尖头 1尖头 2
176
233
335
443
588
632
724
899
954
1045

我们可以写出描述这一试验数据的统计模型:

yij=μi+βj+εij{i=1,2j=1,2,…,10(2.39)y_{ij} = \mu_{i}+\beta_{j}+\varepsilon_{ij} \quad \left\{ \begin{array}{l} i = 1, 2 \\ j = 1, 2, \ldots, 10 \end{array} \right. \tag{2.39}

其中 yijy_{ij} 是尖头 ii 在第 jj 个试样上的硬度观测值,μi\mu_{i} 是第 ii 种尖头的真实平均硬度,βj\beta_{j} 是第 jj 个试样对硬度的影响,εij\varepsilon_{ij} 是均值为零、方差为 σi2\sigma_{i}^{2} 的随机试验误差。也就是说,σ12\sigma_{1}^{2} 是尖头 1 硬度测量的方差,σ22\sigma_{2}^{2} 是尖头 2 硬度测量的方差。

注意,如果我们计算第 jj 个配对差(paired difference)

dj=y1j−y2jj=1,2,…,10(2.40)d_{j} = y_{1j}-y_{2j} \quad j = 1, 2, \ldots, 10 \tag{2.40}

则该差的期望值为

μd=E(dj)=E(y1j−y2j)=E(y1j)−E(y2j)=μ1+βj−(μ2+βj)=μ1−μ2\begin{aligned} \mu_{d} &= E(d_{j}) \\ &= E(y_{1j}-y_{2j}) \\ &= E(y_{1j})-E(y_{2j}) \\ &= \mu_{1}+\beta_{j}-(\mu_{2}+\beta_{j}) \\ &= \mu_{1}-\mu_{2} \end{aligned}

也就是说,我们可以通过对差值均值 μd\mu_{d} 作推断,来对两种尖头的平均硬度读数之差 μ1−μ2\mu_{1}-\mu_{2} 作推断。注意当观测值以这种方式配对后,试样的可加效应 βj\beta_{j} 就消掉了。

检验 H0:μ1=μ2H_{0}: \mu_{1}=\mu_{2} 等价于检验

H0:μd=0H1:μd≠0\begin{array}{l} H_{0}: \mu_{d} = 0 \\ H_{1}: \mu_{d} \neq 0 \end{array}

这是一个单样本 tt 检验。该假设的检验统计量为

t0=d‾Sd/n(2.41)t_{0} = \frac{\overline{d}}{S_{d}/\sqrt{n}} \tag{2.41}

其中

d‾=1n∑j=1ndj(2.42)\overline{d} = \frac{1}{n}\sum_{j=1}^{n} d_{j} \tag{2.42}

是差值的样本均值,而

Sd=[∑j=1n(dj−d‾)2n−1]1/2=[∑j=1ndj2−1n(∑j=1ndj)2n−1]1/2(2.43)S_{d} = \left[\frac{\sum_{j=1}^{n} (d_{j}-\overline{d})^{2}}{n-1}\right]^{1/2} = \left[\frac{\sum_{j=1}^{n} d_{j}^{2}-\frac{1}{n}\left(\sum_{j=1}^{n} d_{j}\right)^{2}}{n-1}\right]^{1/2} \tag{2.43}

是差值的样本标准差。若 ∣t0∣>tα/2,n−1|t_{0}|>t_{\alpha/2,n-1} 则拒绝 H0:μd=0H_{0}:\mu_{d}=0。也可以使用 PP 值方法。由于来自两个因子水平的观测值是在每个试验单元上“配对”的,这一程序通常称为配对 tt 检验(paired tt-test)。

对表 2.6 中的数据,我们得到

d1=7−6=1d6=3−2=1d2=3−3=0d7=2−4=−2d3=3−5=−2d8=9−9=0d4=4−3=1d9=5−4=1d5=8−8=0d10=4−5=−1\begin{array}{ll} d_{1} = 7-6 = 1 & d_{6} = 3-2 = 1 \\ d_{2} = 3-3 = 0 & d_{7} = 2-4 = -2 \\ d_{3} = 3-5 = -2 & d_{8} = 9-9 = 0 \\ d_{4} = 4-3 = 1 & d_{9} = 5-4 = 1 \\ d_{5} = 8-8 = 0 & d_{10} = 4-5 = -1 \end{array}

因此

d‾=1n∑j=1ndj=110(−1)=−0.10\overline{d} = \frac{1}{n}\sum_{j=1}^{n} d_{j} = \frac{1}{10}(-1) = -0.10
Sd=[∑j=1ndj2−1n(∑j=1ndj)2n−1]1/2=[13−110(−1)210−1]1/2=1.20S_{d} = \left[\frac{\sum_{j=1}^{n} d_{j}^{2}-\frac{1}{n}\left(\sum_{j=1}^{n} d_{j}\right)^{2}}{n-1}\right]^{1/2} = \left[\frac{13-\frac{1}{10}(-1)^{2}}{10-1}\right]^{1/2} = 1.20

假设我们取 α=0.05\alpha=0.05。为作出决策,我们计算 t0t_{0},若 ∣t0∣>t0.025,9=2.262|t_{0}|>t_{0.025,9}=2.262 则拒绝 H0H_{0}。配对 tt 检验统计量的计算值为

t0=d‾Sd/n=−0.101.20/10=−0.26t_{0} = \frac{\overline{d}}{S_{d}/\sqrt{n}} = \frac{-0.10}{1.20/\sqrt{10}} = -0.26

由于 ∣t0∣=0.26≱t0.025,9=2.262|t_{0}|=0.26 \not\geq t_{0.025,9}=2.262,我们不能拒绝假设 H0:μd=0H_{0}: \mu_{d}=0。也就是说,没有证据表明两种尖头给出不同的硬度读数。图 2.15 给出了自由度为 9 的 t0t_{0} 分布(本检验的参考分布),并标出了 t0t_{0} 的值相对于临界域的位置。

表 2.7 给出了用 Minitab 配对 tt 检验程序解决该问题时的计算机输出。注意该检验的 PP 值为 P≃0.80P \simeq 0.80,这意味着我们在任何合理的显著性水平下都不能拒绝原假设。

2.5.2 配对比较设计的优点

这一试验实际采用的设计称为配对比较设计(paired comparison design),它体现了 1.3 节讨论的区组化原则。实际上,它是一种更一般设计类型的特例,即随机区组设计(randomized block design)。术语区组(block)指的是一个相对齐同的试验单元(在我们的情形中,金属试样就是区组),区组代表对完全随机化的一种限制,因为处理组合只在区组内部随机化。我们将在第 4 章讨论这类设计。在第 4 章中,该设计的数学模型(式 2.39)会写成略有不同的形式。

图 2.15 硬度试验问题的参考分布(自由度为 9 的 tt 分布)

表 2.7 硬度试验例子的 Minitab 配对 tt 检验结果

Paired T for Tip 1-Tip 2
NMeanStd. Dev.SE Mean
Tip 1104.8002.3940.757
Tip 2104.9002.2340.706
Difference10-0.1001.1970.379
95% CI for mean difference: (-0.956, 0.756) t-Test of mean difference = 0 (vs not = 0): T-Value = -0.26 P-Value = 0.798

在结束这个试验的讨论之前,有几点需要说明。注意,虽然取了 2n=2(10)=202n=2(10)=20 个观测值,但 tt 统计量只有 n−1=9n-1=9 个自由度可用。(我们知道 tt 的自由度越大,检验就越灵敏。)通过区组化或配对,我们实际上“损失”了 n−1n-1 个自由度,但我们希望通过消除一个额外的变异来源(试样之间的差异)而更好地了解情况。

我们可以通过比较差值的标准差 SdS_{d} 与合并标准差 SpS_{p} 来了解配对设计所产生信息的质量,其中 SpS_{p} 是试验以完全随机化方式实施、并得到表 2.6 数据时所会得到的值。[1] 把表 2.6 中的数据当作两个独立样本,由式 2.25 算得合并标准差 Sp=2.32S_{p}=2.32。把这一值与 Sd=1.20S_{d}=1.20 相比较,可见区组化或配对把变异的估计降低了将近 50%。

一般来说,当我们本该区组化(或配对)却没有这样做时,SpS_{p} 总会大于 SdS_{d}。这很容易形式化地证明。如果我们把观测值配对,就容易证明在式 2.39 的模型下 Sd2S_{d}^{2} 是差值 djd_{j} 方差的无偏估计量,因为计算差值时区组效应(βj\beta_{j})被消掉了。然而,如果我们不做区组化(或配对),而把观测值当作两个独立样本处理,那么在式 2.39 的模型下 Sp2S_{p}^{2} 就不是 σ2\sigma^{2} 的无偏估计量。事实上,假定两个总体方差相等,有

E(Sp2)=σ2+∑j=1nβj2E(S_{p}^{2}) = \sigma^{2}+\sum_{j=1}^{n} \beta_{j}^{2}

也就是说,区组效应 βj\beta_{j} 抬高了方差估计。这就是区组化可以作为一种降噪设计技术的原因。

我们也可以用 μ1−μ2\mu_{1}-\mu_{2} 的置信区间来表达这一试验的结果。使用配对数据,μ1−μ2\mu_{1}-\mu_{2} 的 95% 置信区间为

d‾±t0.025,9Sd/n−0.10±(2.262)(1.20)/10−0.10±0.86\begin{array}{c} \overline{d} \pm t_{0.025,9} S_{d}/\sqrt{n} \\ -0.10 \pm (2.262)(1.20)/\sqrt{10} \\ -0.10 \pm 0.86 \end{array}

反之,使用合并的(即独立的)分析,μ1−μ2\mu_{1}-\mu_{2} 的 95% 置信区间为

y‾1−y‾2±t0.025,18Sp1n1+1n24.80−4.90±(2.101)(2.32)110+110−0.10±2.18\begin{array}{c} \overline{y}_{1}-\overline{y}_{2} \pm t_{0.025,18} S_{p}\sqrt{\frac{1}{n_{1}}+\frac{1}{n_{2}}} \\ 4.80-4.90 \pm (2.101)(2.32)\sqrt{\frac{1}{10}+\frac{1}{10}} \\ -0.10 \pm 2.18 \end{array}

基于配对分析的置信区间比基于独立分析的置信区间窄得多。这再次说明了区组化的降噪特性。

区组化并不总是最好的设计策略。如果区组内变异与区组间变异相同,那么无论采用哪种设计,y‾1−y‾2\overline{y}_{1}-\overline{y}_{2} 的方差都一样。实际上在这种情况下区组化是一个糟糕的设计选择,因为区组化会导致损失 n−1n-1 个自由度,从而实际上使 μ1−μ2\mu_{1}-\mu_{2} 的置信区间更宽。关于区组化的进一步讨论见第 4 章。

Footnotes
  1. 原文此处写作“表 2.5”,但表 2.5 是均值检验的汇总表,硬度试验的数据在表 2.6,故按表 2.6 译出。——译者注