Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

3.7 确定样本量

在任何试验设计问题中,一个关键决策都是样本量的选择,即确定要做的重复次数。一般地,如果试验者希望检出小的效应,就需要比希望检出大的效应更多的重复。本节讨论确定样本量的若干途径。尽管我们的讨论集中于单因子设计,但大多数方法都可以用于更复杂的试验情形。

3.7.1 操作特性曲线与功效曲线

回忆一下,操作特性(operating characteristic,OC)曲线是对特定样本量,把统计检验的第 II 类错误概率 β\beta 对反映原假设不成立程度的某个参数所作的图。作为替代,功效曲线把功效或 1−β1-\beta 对该参数作图。功效曲线和(或)OC 曲线可以用软件构造,有助于指导试验者选择重复次数,使设计对处理之间重要的潜在差异足够灵敏。

我们考虑各处理样本量相等时固定效应模型的第 II 类错误概率,即

β=1−P{拒绝 H0∣H0 为假}=1−P{F0>Fα,a−1,N−a∣H0 为假}(3.43)\begin{aligned} \beta &= 1-P\{\text{拒绝 } H_{0} \mid H_{0} \text{ 为假}\} \\ &= 1-P\{F_{0} > F_{\alpha,a-1,N-a} \mid H_{0} \text{ 为假}\} \end{aligned} \tag{3.43}

要计算式 3.43 中的概率陈述,我们需要知道原假设为假时检验统计量 F0F_{0} 的分布。可以证明,若 H0H_{0} 为假,则统计量 F0=MS处理/MSEF_{0} = MS_{\text{处理}}/MS_{E} 服从非中心 FF 分布,自由度分别为 a−1a-1 和 N−aN-a,非中心参数为 δ\delta。若 δ=0\delta=0,非中心 FF 分布就退化为通常的(中心)FF 分布。

我们将说明 JMP 中实现的样本量确定方法。考虑例 3.1 中描述的等离子体刻蚀试验。假设试验者希望在真实处理均值为

μ1=575, μ2=600, μ3=650, 和 μ4=675\mu_{1} = 575,\ \mu_{2} = 600,\ \mu_{3} = 650,\ \text{和}\ \mu_{4} = 675

时,以至少 0.9 的概率(功效 = 0.9)拒绝原假设[1]。试验者认为刻蚀速率的标准差不会大于 σ=25\sigma = 25 Å/min。比较若干均值的 JMP 功效与样本量平台的输入和输出见下:

右图是功效对总样本量的图形。该图表明,要获得超过 0.90 的功效至少需要四次重复。

这种确定样本量方法的一个潜在问题是:可能难以选定一组应当据以决定样本量的处理均值。另一种做法是选择这样的样本量:只要任意两个处理均值之差超过某个指定值,就应当拒绝原假设。

Minitab 就采用这种途径为单因子方差分析进行功效计算并求出样本量。考虑下面的显示:

Power and Sample Size
One-way ANOVA
Alpha = 0.01  Assumed standard deviation = 25
Number of Levels = 4

                 Sample   Maximum
SS Means   Size    Power  Difference
  2812.5       5   0.804838      75

The sample size is for each level.
Power and Sample Size
One-way ANOVA
Alpha = 0.01  Assumed standard deviation = 25
Number of Levels = 4

                              Sample   Target          Maximum
SS Means   Size    Power   Actual Power   Difference
  2812.5       6      0.9       0.915384          75

The sample size is for each level.

在上半部分中,我们请 Minitab 在最大处理均值差为 75 时计算 n=5n=5 次重复的功效。下半部分则是试验者要求样本量达到至少 0.90 的目标功效时的输出。

3.7.2 置信区间估计法

这一途径假定试验者希望用置信区间表达最终结果,并愿意事先规定这些置信区间要有多少宽度。例如,假设在例 3.1 的等离子体刻蚀试验中,我们希望任意两个功率设置的平均刻蚀速率之差的 95% 置信区间为 ±30\pm 30 Å/min,而 σ\sigma 的先验估计为 25。那么由式 3.13,置信区间的精度为

±tα/2,N−a2MSEn\pm t_{\alpha/2,N-a}\sqrt{\frac{2MS_{E}}{n}}

假设我们先试 n=5n=5 次重复。那么用 σ2=(25)2=625\sigma^{2}=(25)^{2}=625 作为 MSEMS_{E} 的估计,置信区间的精度变为

±2.1202(625)5=±33.52\pm 2.120\sqrt{\frac{2(625)}{5}} = \pm 33.52

不满足要求。试 n=6n=6 得

±2.0862(625)6=±30.11\pm 2.086\sqrt{\frac{2(625)}{6}} = \pm 30.11

试 n=7n=7 得

±2.0642(625)7=±27.58\pm 2.064\sqrt{\frac{2(625)}{7}} = \pm 27.58

显然,n=7n=7 是能达到所需精度的最小样本量。

上面例子中所引用的显著性水平只适用于一个置信区间。然而,如果试验者希望事先规定一组置信区间并对其作联合(即同时)置信陈述,也可以使用同样的总体思路(参见 3.3.3 节关于同时置信区间的讨论)。此外,置信区间也可以针对比上面所示的两两比较更一般的处理均值对照来构造。

Footnotes
  1. 原文此处末一个均值印作 μ1=675\mu_{1}=675,按上下文应为 μ4=675\mu_{4}=675。——译者注