Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

1.4 设计试验的准则

要在设计和分析试验时运用统计方法,参与试验的每个人都必须事先清楚地知道究竟要研究什么、数据将如何采集,并且至少定性地了解这些数据将如何分析。推荐的流程大纲见表 1.1。下面我们对这一大纲作简要讨论,并对其中一些要点加以展开。更详细的内容参见 Coleman 和 Montgomery(1993)及其中的参考文献。本章的补充材料也很有用。

表 1.1 设计试验的准则

步骤阶段
1. 识别并陈述问题试验前计划(步骤 1~3)
2. 选择响应变量 a
3. 选择因子、水平与范围 a
4. 选择试验设计
5. 实施试验
6. 统计分析数据
7. 结论与建议

a 在实践中,步骤 2 和步骤 3 常常同时进行,或按相反的顺序进行。

  1. 识别并陈述问题。 这看起来似乎是显而易见的一点,但在实践中,无论是认识到存在一个需要做试验的问题,还是给出一个清晰且被普遍接受的问题陈述,往往都不简单。必须把关于试验目标的所有想法都梳理清楚。通常,重要的是征求所有相关方的意见:工程、质量保证、制造、营销、管理层、客户以及操作人员(他们通常很有见地,却常常被忽视)。因此,推荐采用团队方式来设计试验。

    通常有帮助的做法是列出试验将要解决的具体问题或疑问的清单。清楚地陈述问题,往往对更好地理解所研究的现象并最终解决问题大有裨益。

    还必须牢记试验的总体目标。开展试验有若干大类原因,而每类试验都会产生各自需要回答的具体问题清单。开展试验的一些(但绝不是全部)原因包括:

    • 因子筛选或表征。 当系统或过程是新的时,了解哪些因子对所关注的响应影响最大通常很重要。这类情形下往往有很多因子,这通常说明试验者对系统了解不多,因此若想从系统中高效地获得期望的性能,筛选就是必不可少的。当面对新系统或新技术时,筛选试验极为重要,这样可以避免把宝贵的资源浪费在最佳猜测法和 OFAT 方法上。

    • 最优化。 在系统得到表征、并且我们相当有把握已找出重要因子之后,下一个目标通常是最优化,即找出能使响应达到理想值的重要因子的设置或水平。例如,如果对某个化工过程的筛选试验确定时间和温度是两个最重要的因子,那么最优化试验的目标可能是找出使收率最大的时间和温度水平,或者是在把某个对客户至关重要的产品特性保持在规范之内的前提下使收率最大。最优化试验通常是筛选试验的后续。筛选试验能给出重要因子的最优设置,那是极不寻常的。

    • 验证。 在验证试验中,试验者通常试图确认系统运行或表现的方式与某种理论或过去经验一致。例如,如果理论或经验表明某种新材料与当前使用的材料等效,并且这种新材料是理想的(也许更便宜,或者在某些方面更易于使用),那么就要做一次验证试验,确认以新材料替代后,会影响产品使用的产品特性没有发生变化。另一个常导致验证试验的情形是:根据在中试厂或开发现场做试验得到的结果,把一个新的制造工艺推向满规模生产——也就是说,开发工作中确定的那些因子及其设置是否适合满规模工艺?

    • 发现。 在发现试验中,试验者通常试图弄清楚当我们探索新材料、新因子或新的因子范围时会发生什么。发现试验往往涉及对若干(也许是很多)因子的筛选。在制药行业,科学家不断开展发现试验,以寻找能有效治疗疾病的新材料或材料组合。

    • 稳健性。 这类试验常常回答这样的问题:在什么条件下所关注的响应变量会严重退化?或者什么条件会导致响应变量出现不可接受的变异?这类问题的一个变体是:如何设置系统中我们能控制的因子,以使来自我们无法很好控制的因子的变异传入响应最少?我们将在第 12 章讨论一些这类试验。

    显然,试验中要解决的具体问题与总体目标直接相关。问题表述的一个重要方面是认识到:一个大型的综合试验不大可能令人满意地回答关键问题。单个综合试验要求试验者知道许多问题的答案,而一旦判断有误,结果就会令人失望。这会导致时间、材料和其他资源的浪费,甚至可能永远无法令人满意地回答最初的研究问题。采用序贯方式,做一系列较小的试验,每个试验都有明确的目标(例如因子筛选),往往是更好的策略。

  2. 选择响应变量。 在选择响应变量时,试验者应当确信该变量确实能提供关于所研究过程的有用信息。最常见的情况是,被测特性的平均值或标准差(或两者)将作为响应变量。多个响应并不罕见。试验者必须决定每个响应如何测量,并处理诸如测量系统如何校准、以及在试验过程中如何保持该校准等问题。量具或测量系统的能力(即测量误差)也是一个重要因子。如果量具能力不足,试验就只能检测出相对较大的因子效应,或者可能需要增加重复次数。在量具能力较差的某些情形下,试验者可能决定对每个试验单元测量若干次,并用重复测量的平均值作为观测到的响应。在实施试验之前,明确与所关注响应的定义及其测量方式有关的问题,通常至关重要。有时也会用设计好的试验来研究和改进测量系统的性能,例子见第 13 章。

  3. 选择因子、水平与范围。(如表 1.1 所注,步骤 2 和步骤 3 常常同时进行,或按相反的顺序进行。)在考虑可能影响过程或系统表现的因子时,试验者通常会把这些因子分为潜在设计因子和干扰因子两类。潜在设计因子是试验者可能希望在试验中改变的因子。我们常常发现潜在设计因子很多,对它们作进一步的分类是有帮助的。一些有用的分类是设计因子、保持恒定的因子和允许变化的因子。设计因子是试验中实际选定用于研究的因子。保持恒定的因子是可能对响应有一定影响,但在当前试验中并不受关注、因而将被固定在某一特定水平的变量。例如,在半导体行业的刻蚀试验中,可能存在一种为该试验所用特定等离子体刻蚀设备所独有的效应。然而,这个因子在试验中很难改变,因此试验者可能决定全部试验运行都在某一台特定的(理想的“典型”)刻蚀机上进行。这样,这个因子就被保持恒定。作为允许变化的因子的例子:试验单元——即设计因子所施加的“材料”——通常是不齐同的,但我们常常忽略这种单元之间的变异,而依靠随机化来平衡任何材料或试验单元的效应。我们通常假定保持恒定的因子和允许变化的因子的效应都相对较小。

    另一方面,干扰因子可能有很大效应、必须加以考虑,但在当前试验的背景下我们可能并不关心它们。干扰因子通常分为可控制、不可控制和噪声因子。可控干扰因子是其水平可由试验者设定的干扰因子。例如,试验者可以在试验时选择不同的原料批次或不同的星期几。前一节讨论的区组化原则,在处理可控干扰因子时常常很有用。如果某个干扰因子在试验中不可控,但可以测量,那么就常常可以用一种称为协方差分析(analysis of covariance)的分析方法来补偿它的效应。例如,过程环境中的相对湿度可能影响过程表现;如果湿度无法控制,它或许可以测量并作为一个协变量来处理。当一个在过程中自然、不可控地变化的因子可以为试验之目的加以控制时,我们常称之为噪声因子(noise factor)。在这类情形下,我们的目标通常是找出可控设计因子的设置,使从噪声因子传递来的变异最小。这有时称为过程稳健性研究或稳健设计问题。区组化、协方差分析和过程稳健性研究将在本书后面讨论。

    一旦试验者选定了设计因子,还必须选择这些因子的变化范围以及各次运行所取的具体水平。还必须考虑如何在期望值上控制这些因子、以及如何测量它们。例如在波峰焊试验中,工程师已界定出 12 个可能影响焊接缺陷出现的变量。试验者还必须为每个变量确定一个感兴趣的区域(即每个因子的变化范围),并决定每个变量取多少个水平。这需要过程知识。这种过程知识通常是实践经验与理论理解的结合。重要的是考察所有可能重要的因子,而不要过分受过去经验的影响,特别是在试验的早期阶段,或者当过程还很不成熟的时候。

    当试验的目标是因子筛选或过程表征时,通常最好让因子水平数保持较少。一般来说,在因子筛选研究中两个水平就很有效。选择感兴趣的区域也很重要。在因子筛选中,感兴趣的区域应相对较大——也就是说,因子变化的范围应当较宽。随着我们对哪些变量重要、哪些水平能给出最好结果了解得越来越多,后续试验中感兴趣的区域通常会变得更窄。

图 1.10 刻蚀过程试验的因果图

因果图(cause-and-effect diagram)是整理试验前计划阶段所产生的一些信息的有用技术。图 1.10 是在计划一次试验时为解决半导体制造中某台刻蚀设备上遇到的硅片带电(wafer charging,硅片上电荷的累积)问题而构造的因果图。因果图也称为鱼骨图,因为所关注的“结果”或响应变量画在该图的脊线上,而潜在的原因或设计因子则组织成一系列鱼骨刺。因果图使用传统的测量、材料、人员、环境、方法、机器这几类原因来组织信息和潜在设计因子。注意,有些具体原因可能直接对应到将纳入试验的一个设计因子(例如砂轮转速、气体流量和真空度),另一些则代表需要进一步研究才能变成设计因子的潜在领域(例如操作人员不遵守规程),还有一些可能对应到试验期间将保持恒定或加以区组化的因子(例如温度和相对湿度)。图 1.11 是研究若干因子对某台计算机数控(computer-numerical-controlled,CNC)机床上加工的涡轮叶片影响的试验的因果图。该试验有三个响应变量:叶片型面、叶片表面光洁度以及成品叶片表面光洁度缺陷。图中把原因分为若干类:可从中选择试验设计因子的可控因子;其效应很可能由随机化来平衡的不可控因子;可能加以区组化的干扰因子;以及试验时可能保持恒定的因子。试验者构造若干张不同的因果图来辅助和指导试验前计划,这并不罕见。关于 CNC 机床试验的更多信息以及试验前计划中有用的图形方法的进一步讨论,参见本章补充材料。

图 1.11 CNC 机床试验的因果图

我们再次强调,在步骤 1 至步骤 3 中充分汇集各种观点和过程信息是何等重要。我们把这一过程称为试验前计划(pre-experimental planning)。Coleman 和 Montgomery(1993)提供了一些可用于试验前计划的工作表。更详细的说明以及使用这些工作表的例子也见本章补充材料。在很多情况下,一个人不太可能拥有把这件事做好所需的全部知识。因此,我们极力主张以团队协作的方式来计划试验。你的成功在很大程度上取决于试验前计划做得有多好。

  1. 选择试验设计。 如果上述试验前计划活动做得正确,这一步就相对容易。设计的选择涉及考虑样本量(重复次数)、为试验安排合适的运行顺序,以及确定是否涉及区组化或其他随机化限制。本书讨论若干较重要的试验设计类型,最终可以作为针对各种问题选择合适试验设计的指南。

    还有一些交互式统计软件包支持这一试验设计阶段。试验者可以输入关于因子数、水平和范围的信息,这些程序要么给出若干可选设计供考虑,要么推荐某个特定设计。(在多数情况下,我们通常更愿意看到若干备选方案,而不是完全依赖计算机的推荐。)大多数软件包还会提供一些诊断信息,说明每个设计的表现如何。这对于评价试验的不同设计备选方案很有用。这些程序通常还会提供一个工作表(其中各次运行的顺序已随机化)用于实施试验。

    设计的选择还涉及思考和选定一个初步的经验模型来描述结果。模型只是响应与重要设计因子之间的定量关系(方程)。在许多情况下,低阶多项式模型是合适的。两个变量的一阶模型是

    y=β0+β1x1+β2x2+εy = \beta_{0}+\beta_{1}x_{1}+\beta_{2}x_{2}+\varepsilon

    其中 yy 是响应,xx 是设计因子,β\beta 是待由试验数据估计的未知参数,ε\varepsilon 是随机误差项,用以刻画所研究系统中试验误差的影响。一阶模型有时也称为主效应模型。一阶模型在筛选试验或表征试验中被广泛使用。一阶模型的一种常见扩展是加入一个交互项,例如

    y=β0+β1x1+β2x2+β12x1x2+εy = \beta_{0}+\beta_{1}x_{1}+\beta_{2}x_{2}+\beta_{12}x_{1}x_{2}+\varepsilon

    其中交叉乘积项 x1x2x_{1}x_{2} 表示设计因子之间的二因子交互作用。由于因子之间的交互作用相当普遍,带交互作用的一阶模型被广泛使用。若有需要,在多于两个因子的试验中还可以加入更高阶的交互作用。另一个被广泛使用的模型是二阶模型

    y=β0+β1x1+β2x2+β12x1x2+β11x12+β22x22+εy = \beta_{0}+\beta_{1}x_{1}+\beta_{2}x_{2}+\beta_{12}x_{1}x_{2}+\beta_{11}x_{1}^{2}+\beta_{22}x_{2}^{2}+\varepsilon

    二阶模型常用于最优化试验。

    在选择设计时,牢记试验目标很重要。在许多工程试验中,我们一开始就知道某些因子水平会导致响应取不同的值。因此,我们关心的是找出哪些因子造成了这种差异,并估计响应变化的幅度。在另一些情况下,我们可能更关心验证一致性。例如,可能要比较两种生产条件 A 和 B,A 是现行标准,B 是更经济的替代方案。这时试验者感兴趣的是证明两种条件之间(比如说)收率没有差异。

  2. 实施试验。 在实施试验时,必须仔细监控过程,确保一切都按计划进行。这一阶段的试验程序错误通常会破坏试验的有效性。我遇到过的最常见错误之一,是实施试验的人员在某些运行中没有把变量设定到正确的水平。应当指定专人在每次运行之前检查因子设置。为防止此类错误而事先做好计划,对取得成功至关重要。在复杂的制造或研发环境中实施一次设计好的试验,其后勤和计划方面的工作很容易被低估。

    Coleman 和 Montgomery(1993)建议,在实施试验之前先做几次试运行或中试运行往往是有帮助的。这些运行可以提供关于试验材料一致性的信息,检查测量系统,初步了解试验误差,并有机会演练整体的试验技术。如有必要,这也提供了重新审视步骤 1~4 中所作决定的机会。

  3. 统计分析数据。 应当使用统计方法分析数据,使结果和结论具有客观性,而不是凭主观判断。如果试验设计正确、并按设计实施,所需的统计方法并不复杂。有许多优秀的软件包可用来辅助数据分析,步骤 4 中用来选择设计的许多程序也提供了与统计分析直接无缝衔接的接口。我们常常发现,简单的图形方法在数据分析和解释中起着重要作用。由于试验者想回答的许多问题都可以纳入假设检验的框架,假设检验和置信区间估计方法在分析设计好的试验的数据时非常有用。把许多试验的结果用经验模型来表示通常也很有帮助,经验模型即由数据导出的、表达响应与重要设计因子之间关系的方程。残差分析和模型适合性检验也是重要的分析技术。这些内容我们将在后面详细讨论。

    请记住,统计方法不能证明某个(某些)因子具有某种特定效应,它们只能就结果的可靠性和有效性给出指导。运用得当的统计方法不能从试验上证明任何事情,但能让我们度量结论中可能的误差,或者给一个陈述附上置信水平。统计方法的主要优点在于,它们为决策过程增加了客观性。统计技术与良好的工程或过程知识以及常识相结合,通常会得出可靠的结论。

  4. 结论与建议。 数据分析完成后,试验者必须就结果得出实际的结论,并建议应采取的行动方案。图形方法在这一阶段常常很有用,特别是在向他人展示结果时。还应进行后续运行和验证性测试,以确认试验得出的结论。

    在整个过程中,重要的是牢记试验是学习过程的重要组成部分:我们初步提出关于某个系统的假设,通过试验考察这些假设,并在此基础上提出新的假设,如此往复。这表明试验是迭代的。在研究开始时设计一个单一、庞大、综合的试验,通常是一个重大错误。一次成功的试验需要了解重要因子、这些因子的变化范围、应采用的适当水平数,以及这些变量和响应的恰当测量单位。一般来说,我们并不能完全知道这些问题的答案,但会在做的过程中逐步了解。随着试验计划的推进,我们常常剔除一些输入变量、加入另一些变量、改变某些因子的探索区域,或者增加新的响应变量。

    因此,我们通常是序贯地做试验;作为一条一般规则,不应把可用资源中超过约 25% 的部分投入第一个试验。这样才能确保有足够的资源进行验证运行,并最终实现试验的最终目标。

    最后,重要的是认识到所有试验都是设计好的试验,关键问题在于它们设计得好不好。良好的试验前计划通常会带来一次成功的好试验。不做这样的计划则通常会浪费时间、金钱和其他资源,而且常常得到糟糕或令人失望的结果。