Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

1.3 基本原则

如果要最高效地实施像例 1.1 至例 1.6 中描述的那类试验,就必须采用科学的方法来计划试验。试验设计的统计学方法(statistical design of experiments)指的是这样一个规划试验的过程:使适当的数据得以采集,并用统计方法加以分析,从而得到有效而客观的结论。如果我们希望从数据中得出有意义的结论,那么试验设计的统计方法就是必需的。当问题涉及受试验误差影响的数据时,统计方法是唯一客观的分析途径。因此,任何试验问题都有两个方面:试验的设计与数据的统计分析。这两个主题密切相关,因为分析方法直接取决于所采用的设计。本书将讨论这两个主题。

试验设计的三个基本原则是随机化(randomization)、重复(replication)和区组化(blocking)。有时我们在这三个原则之外再加上因子原则。随机化是在试验设计中运用统计方法的基石。所谓随机化,是指试验材料的分配以及试验中各次运行的实施顺序都是随机确定的。统计方法要求观测值(或误差)是相互独立分布的随机变量,随机化通常能使这一假定成立。通过适当地随机化试验,还有助于把可能存在的额外因子的效应“平均掉”。例如,假设硬度试验中的试件厚度略有不同,而淬火介质的效果可能受试件厚度影响。如果所有接受油淬的试件都比接受盐水淬的试件厚,我们就可能在试验结果中引入系统性偏倚。这种偏倚会使其中一种淬火介质处于不利地位,从而使我们的结果失效。把试件随机分配给各淬火介质可以缓解这一问题。

计算机软件被广泛用于帮助试验者选择和构造试验设计。这些程序常常以随机顺序给出设计中的各次运行,这种随机顺序由随机数发生器产生。即使有这样的计算机程序,通常仍然需要为试验分派试验材料单元(例如上面硬度例子中的试件)、操作人员、量具或测量装置等。

有时试验者会遇到难以对试验的某一方面进行随机化的情形。例如在化工过程中,温度可能是很难改变的变量,我们可能希望它改变得比其他因子水平的变化更少。在这类试验中,完全随机化是困难的,因为那会增加时间和成本。有一些统计设计方法可以处理随机化受到限制的情形,其中一些方法将在后续章节中讨论(尤其参见第 14 章)。

所谓重复,是指对每个因子组合进行独立的重复运行。在 1.1 节讨论的冶金试验中,重复就是用一个试件做油淬处理、再用一个试件做盐水淬处理。因此,如果每种淬火介质处理五个试件,我们就说得到了五次重复。这 10 个观测值都应按随机顺序进行。重复有两个重要性质。第一,它使试验者能够估计试验误差。这一误差估计成为判断数据中观察到的差异是否真的具有统计显著性的基本度量单位。第二,如果用样本均值(y‾\overline{y})来估计试验中某个因子水平的真实平均响应,重复能使试验者对该参数作出更精确的估计。例如,若 σ2\sigma^{2} 是单个观测值的方差、共有 nn 次重复,则样本均值的方差为

σy‾2=σ2n\sigma_{\overline{y}}^{2} = \frac{\sigma^{2}}{n}

其实际含义是:如果我们只有 n=1n = 1 次重复,并观测到 y1=145y_{1} = 145(油淬)和 y2=147y_{2} = 147(盐水淬),那么我们大概无法对淬火介质的效应作出令人满意的推断——也就是说,观察到的差异可能只是试验误差造成的。关键在于,没有重复,我们就无从知道这两个观测值为何不同。另一方面,如果 nn 相当大、试验误差足够小,并且我们观测到样本均值 y‾1<y‾2\overline{y}_{1} < \overline{y}_{2},那么我们就有相当大把握断定:对这种特定的铝合金,盐水淬火比油淬火能产生更高的硬度。

试验中的运行被随机化之后,常常会出现连续两次(或多次)运行在某些因子上水平完全相同的情形。例如,假设试验中有三个因子:压力、温度和时间。当试验运行被随机化后,我们得到如下结果:

运行编号压力 (psi)温度 (°C)时间 (min)
ii3010030
i+1i+13012545
i+2i+24012545

注意,在运行 ii 与 i+1i+1 之间,压力水平完全相同;在运行 i+1i+1 与 i+2i+2 之间,温度和时间两个水平都完全相同。要得到真正的重复,试验者需要在运行 ii 与 i+1i+1 之间把“压力旋钮”拧到一个中间设置,然后在运行 i+1i+1 时再把压力调回 30 psi。类似地,在运行 i+1i+1 与 i+2i+2 之间应先把温度和时间调到中间水平,然后再设定为运行 i+2i+2 的设计水平。试验误差的一部分,就是与达到并保持因子水平相关的变异。

重复与重复测量(repeated measurements)之间有一个重要区别。例如,假设在一片硅片上进行单片刻蚀的等离子体刻蚀工艺,并对这片硅片上的某个关键尺寸(critical dimension,CD)测量三次。这三次测量不是重复,而是重复测量的一种形式;此时三次重复测量中观察到的变异直接反映了测量系统或量具的固有变异,也可能反映了该关键尺寸在硅片上不同测量位置处的变异。再举一例:假设在半导体制造中的一次试验里,把四片硅片同时放入氧化炉,在特定的气体流量和时间下进行处理,然后测量每片硅片的氧化层厚度。同样,这四片硅片的测量值不是重复,而是重复测量;此时它们反映的是硅片之间的差异以及该次炉内运行中其他变异来源。而重复反映的则是运行之间的变异来源以及(可能的)运行内部的变异来源。

区组化是一种设计技术,用于提高对所关注因子之间比较的精度。区组化常用来减小或消除由干扰因子(nuisance factor)传递过来的变异,干扰因子即可能影响试验响应、但我们并不直接感兴趣的因子。例如,化工过程中的一次试验可能需要两批原料才能完成全部所需的运行。然而,由于供应商之间的差异,两批原料之间可能存在差别;如果我们并不特别关心这一效应,就会把原料批次看作一个干扰因子。一般来说,一个区组(block)是一组相对齐同的试验条件。在化工过程的例子中,每一批原料构成一个区组,因为可以预期批内变异小于批间变异。与这个例子一样,通常干扰因子的每一个水平就是一个区组。然后试验者把统计设计中的观测值分成若干组,每组在一个区组中运行。本书多处详细讨论区组化,包括第 4、5、7~9、11 和 13 章。2.5.1 节给出了一个说明区组化原理的简单例子。

试验设计的三个基本原则——随机化、重复和区组化——是每个试验的组成部分。本书将反复说明并强调它们。