第 7 章补充材料
S7.1 区组设计中的误差项 ¶ 正如在任何随机完全区组设计中一样,当我们在区组中运行带有重复的因子试验时,我们实际上假定了处理与区组之间不存在交互作用。在只有一个设计因子的随机完全区组设计(第 4 章)中,误差项实际上就是处理与区组之间的交互作用。因子设计也是如此。为说明这一点,考虑教材中表 7.2 的方差分析。该设计是一个在三个完全区组中运行的 22 因子试验,每个区组对应试验的一次重复。误差有 6 个自由度:其中 2 个自由度是区组与因子 A 的交互作用,2 个自由度是区组与因子 B 的交互作用,另外 2 个自由度是区组与 AB 交互作用的交互作用。为了使这里的误差项真正代表随机误差,我们必须假定区组与设计因子之间不存在交互作用。
S7.2 区组设计的预测方程 ¶ 考虑例 7.2 中 ABCD 被混杂的两区组 24 因子设计的预测方程。由于区组化不影响该试验的效应估计,该方程与未作区组化的设计(例 6.2)所得到的方程完全相同。该预测方程为
y ^ = 70.06 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 \hat{y} = 70.06 + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4} y ^ = 70.06 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 在不知道区组效应的情况下,该方程可用于预测未来的观测值。然而,在刚刚完成的这次试验中,我们知道存在很强的区组效应——事实上区组效应计算为
区组效应 = y ‾ 区组 1 − y ‾ 区组 2 = − 18.625 \text{区组效应} = \overline{y}_{\text{区组}1} - \overline{y}_{\text{区组}2} = -18.625 区组效应 = y 区组 1 − y 区组 2 = − 18.625 这意味着两个区组之间的平均响应之差为 −18.625。如果我们希望得到区组 1 和区组 2 的正确拟合值,就应该在预测方程中对此加以补偿。为每个区组分别定义一个单独的区组效应便可做到这一点,其中区组 1 效应 = − 9.3125 = -9.3125 = − 9.3125 、区组 2 效应 = 9.3125 = 9.3125 = 9.3125 。这些区组效应应分别加到每个区组预测方程的截距上。因此预测方程为
y ^ 区组 1 = 70.06 + 区组 1 效应 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 70.06 + ( − 9.3125 ) + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 60.7475 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 \begin{array}{r l}
\hat{y}_{\text{区组}_{1}} & = 70.06 + \text{区组}_{1}\text{效应} + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4} \\
& = 70.06 + (-9.3125) + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4} \\
& = 60.7475 + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4}
\end{array} y ^ 区组 1 = 70.06 + 区组 1 效应 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 70.06 + ( − 9.3125 ) + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 60.7475 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 以及
y ^ 区组 2 = 70.06 + 区组 2 效应 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 70.06 + ( 9.3125 ) + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 79.3725 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 \begin{array}{r l}
\hat{y}_{\text{区组}_{2}} & = 70.06 + \text{区组}_{2}\text{效应} + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4} \\
& = 70.06 + (9.3125) + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4} \\
& = 79.3725 + 10.8125x_{1} + 4.9375x_{3} + 7.3125x_{4} - 9.0625x_{1}x_{3} + 8.3125x_{1}x_{4}
\end{array} y ^ 区组 2 = 70.06 + 区组 2 效应 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 70.06 + ( 9.3125 ) + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 = 79.3725 + 10.8125 x 1 + 4.9375 x 3 + 7.3125 x 4 − 9.0625 x 1 x 3 + 8.3125 x 1 x 4 S7.3 运行顺序很重要 ¶ 区组化实质上讲的就是试验的运行顺序。具体而言,我们把试验安排在区组中运行,是为了抵御已知且可控的干扰因子的影响。然而在许多试验情形中,即使并不存在明显的干扰因子,把试验安排在区组中运行仍是个好主意。当试验需要跨越若干个时间段(天、班次、周等)才能完成时,这一点尤为重要。
为说明这一点,假设我们正在实施 24 因子设计的单次重复。该试验按运行顺序如表 2 所示。现在假设试验者遭遇不幸:在完成前 8 次试验之后,已不可能把整个试验做完。那么,能否用前 8 次运行构成某个有用的试验设计呢?
表 2 一个 24 因子试验
标准顺序 运行顺序 区组 因子 A 因子 B 因子 C 因子 D 2 1 区组 1 1 −1 −1 −1 12 2 区组 1 1 1 −1 1 10 3 区组 1 1 −1 −1 1 15 4 区组 1 −1 1 1 1 14 5 区组 1 1 −1 1 1 4 6 区组 1 1 1 −1 −1 7 7 区组 1 −1 1 1 −1 3 8 区组 1 −1 1 −1 −1 5 9 区组 1 −1 −1 1 −1 8 10 区组 1 1 1 1 −1 11 11 区组 1 −1 1 −1 1 16 12 区组 1 1 1 1 1 1 13 区组 1 −1 −1 −1 −1 9 14 区组 1 −1 −1 −1 1 6 15 区组 1 1 −1 1 −1 13 16 区组 1 −1 −1 1 1
结果表明,此情形下的答案是“不能”。当然仍然可以做些分析,但那基本上只是对前 8 次试验的响应数据拟合一个回归模型。假设我们拟合一个包含截距项和四个主效应的回归模型。当事情出了岔子时,通常最好是让目标简单一些,充分利用手头已有的数据。结果表明,在该模型中我们实际得到的是如下各量的估计:
[ 截距 ] = 截距 − A B + C D − A B C D [ A ] = A + A B − B C − A B C + A C D − B C D [ B ] = B + A B − B C − A B C [ C ] = C − A B C + A C D − B C D [ D ] = D − A B D − A C D + B C D \begin{array}{r l}
& [\text{截距}] = \text{截距} - \mathrm{AB} + \mathrm{CD} - \mathrm{ABCD} \\
& [\mathrm{A}] = \mathrm{A} + \mathrm{AB} - \mathrm{BC} - \mathrm{ABC} + \mathrm{ACD} - \mathrm{BCD} \\
& [\mathrm{B}] = \mathrm{B} + \mathrm{AB} - \mathrm{BC} - \mathrm{ABC} \\
& [\mathrm{C}] = \mathrm{C} - \mathrm{ABC} + \mathrm{ACD} - \mathrm{BCD} \\
& [\mathrm{D}] = \mathrm{D} - \mathrm{ABD} - \mathrm{ACD} + \mathrm{BCD}
\end{array} [ 截距 ] = 截距 − AB + CD − ABCD [ A ] = A + AB − BC − ABC + ACD − BCD [ B ] = B + AB − BC − ABC [ C ] = C − ABC + ACD − BCD [ D ] = D − ABD − ACD + BCD 现在假设我们认为可以放心地忽略三因子和四因子交互作用。然而,即使作了这些假定,我们的截距项仍与两个二因子交互作用“云混”或“混淆”在一起,而因子 A 和 B 的主效应也与另外两个二因子交互作用“混淆”在一起。在下一章中,我们会把这里观察到的现象称为效应的别名 (aliasing,这才是其正式名称)。第 8 章的补充材料给出了推导因子效应别名的一般方法。Design-Expert 软件包也可以利用 Design Evaluation(设计评价)功能来生成别名。注意,在我们的例子中,未按原计划完成试验确实严重扰乱了结果的解释。
假设试验者并没有把全部 16 次运行完全随机化,而是按通常的做法选择让 ABCD 交互作用与区组混杂,从而把这个 24 设计安排成两个各含 8 次运行的区组。此时如果只能实施前 8 次运行,那么由这 8 次运行得到的截距和主因子效应估计为
[ 截距 ] = 截距 [ A ] = A + B C D [ B ] = B + A C D [ C ] = C + A B D [ D ] = D + A B C \begin{array}{r l}
& [\text{截距}] = \text{截距} \\
& [\mathrm{A}] = \mathrm{A} + \mathrm{BCD} \\
& [\mathrm{B}] = \mathrm{B} + \mathrm{ACD} \\
& [\mathrm{C}] = \mathrm{C} + \mathrm{ABD} \\
& [\mathrm{D}] = \mathrm{D} + \mathrm{ABC}
\end{array} [ 截距 ] = 截距 [ A ] = A + BCD [ B ] = B + ACD [ C ] = C + ABD [ D ] = D + ABC 如果我们假定三因子交互作用可以忽略,那么由前 8 次运行就能得到全部四个主效应的可靠估计。原因在于该设计的每个区组都构成 24 因子的一个半分数,而这个半分数可以在不受任何二因子交互作用混杂的情况下估计出四个主效应。这一特定设计(即 24 的半分数)将在第 8 章中相当详细地讨论。
这个例子说明了仔细考虑运行顺序的重要性,即使试验者显然并不关心干扰变量和区组化。请记住:
如果试验过程中某件事有可能出错,那么它很可能真的会出错。审慎的试验者在设计自己的试验时会把这一点考虑在内。
一般来说,如果一个 2 k 2^{k} 2 k 因子设计被构造成两个区组,而其中一个区组丢失、被毁或从未运行,那么剩下的 2 k / 2 = 2 k − 1 2^{k}/2 = 2^{k-1} 2 k /2 = 2 k − 1 次运行总是构成原设计的一个半分数。几乎总可以从这样的试验中学到一些有用的东西。
把这个一般想法再推进一步。假设我们最初把 16 次运行的 24 因子试验安排在四个各含 4 次运行的区组中。使用教材中本章的标准方法所得到的设计就是表 3 中的试验。现在假设由于某种原因,我们只能实施该试验的前 8 次试验。容易验证,表 3 中的前 8 次试验并不构成由 ABCD 交互作用与区组混杂所产生的、通常的那种 8 次运行区组。因此,表 3 中的前 8 次运行不是 24 的“标准”半分数。
一个合乎逻辑的问题是:“用这 8 次运行我们能做些什么?”如前所述,假设试验者决定集中估计主效应。如果我们只用表 3 的前 8 次运行,并且只集中估计四个主效应,那么结果表明我们真正估计的是
[ 截距 ] = 截距 − A C D [ A ] = A − C D [ B ] = B − A B C D [ C ] = C − A D [ D ] = D − A C \begin{array}{r l}
& [\text{截距}] = \text{截距} - \mathrm{ACD} \\
& [\mathrm{A}] = \mathrm{A} - \mathrm{CD} \\
& [\mathrm{B}] = \mathrm{B} - \mathrm{ABCD} \\
& [\mathrm{C}] = \mathrm{C} - \mathrm{AD} \\
& [\mathrm{D}] = \mathrm{D} - \mathrm{AC}
\end{array} [ 截距 ] = 截距 − ACD [ A ] = A − CD [ B ] = B − ABCD [ C ] = C − AD [ D ] = D − AC 同样,即使假定所有二阶以上的交互作用都可以忽略,我们的主效应估计仍然与二因子交互作用互为别名。
表 3 一个安排在四个区组中的 24 因子试验
标准顺序 运行顺序 区组 因子 A 因子 B 因子 C 因子 D 10 1 区组 1 1 −1 −1 1 15 2 区组 1 −1 1 1 1 3 3 区组 1 −1 1 −1 −1 6 4 区组 1 1 −1 1 −1 12 5 区组 2 1 1 −1 1 8 6 区组 2 1 1 1 −1 13 7 区组 2 −1 −1 1 1 1 8 区组 2 −1 −1 −1 −1 11 9 区组 3 −1 1 −1 1 2 10 区组 3 1 −1 −1 −1 7 11 区组 3 −1 1 1 −1 14 12 区组 3 1 −1 1 1 16 13 区组 4 1 1 1 1 5 14 区组 4 −1 −1 1 −1 9 15 区组 4 −1 −1 −1 1 4 16 区组 4 1 1 −1 −1
如果我们能获得原 16 次运行中的 12 次(即表 3 的前三个区组),那么我们可以估计
[ 截距 ] = 截距 − 0.333 A B − 0.333 A C D − 0.333 B C D [ A ] = A − A B C D [ B ] = B − A B C D [ C ] = C − A B C [ D ] = D − A B D [ A C ] = A C − A B D [ A D ] = A D − A B C [ B C ] = B C − A B D [ B D ] = B D − A B C [ C D ] = C D − A B C D \begin{array}{r l}
& [\text{截距}] = \text{截距} - 0.333\mathrm{AB} - 0.333\mathrm{ACD} - 0.333\mathrm{BCD} \\
& [\mathrm{A}] = \mathrm{A} - \mathrm{ABCD} \\
& [\mathrm{B}] = \mathrm{B} - \mathrm{ABCD} \\
& [\mathrm{C}] = \mathrm{C} - \mathrm{ABC} \\
& [\mathrm{D}] = \mathrm{D} - \mathrm{ABD} \\
& [\mathrm{AC}] = \mathrm{AC} - \mathrm{ABD} \\
& [\mathrm{AD}] = \mathrm{AD} - \mathrm{ABC} \\
& [\mathrm{BC}] = \mathrm{BC} - \mathrm{ABD} \\
& [\mathrm{BD}] = \mathrm{BD} - \mathrm{ABC} \\
& [\mathrm{CD}] = \mathrm{CD} - \mathrm{ABCD}
\end{array} [ 截距 ] = 截距 − 0.333 AB − 0.333 ACD − 0.333 BCD [ A ] = A − ABCD [ B ] = B − ABCD [ C ] = C − ABC [ D ] = D − ABD [ AC ] = AC − ABD [ AD ] = AD − ABC [ BC ] = BC − ABD [ BD ] = BD − ABC [ CD ] = CD − ABCD 如果我们能忽略三因子和四因子交互作用,就可以得到全部四个主效应以及六个二因子交互作用中五个的良好估计。再一次说明,把试验安排在区组中并据此实施被证明是个好主意,尽管事先并未预期存在任何干扰因子。最后我们指出,可以把表 3 中四个区组里的三个组合起来,得到一个 12 次运行的试验,它比上面说明的那个略好一些。这实际上称为 24 的 3 / 4 3/4 3/4 分数,即一种非正规分数因子设计。这些设计在第 8 章的习题中简要提及。