如果真实存在差异(或相关性或关联性),你也可能无法发现它。这取决于你实验的功效。
正常理解统计功效对于准确解读统计结果至关重要,本文将解释与功效相关的核心概念。
关键概念:统计功效
检验的“功效”究竟意味着什么?
在执行实验时,你通常感兴趣的是测量某种效应:药物处理组的蛋白质浓度是否与对照组不同;敲除株的中位生存时间是否比野生型更长;不同处理组之间的基因表达是否存在差异。
你的实验使用来自不同总体的样本来收集数据并执行统计分析。其思路是,如果你所寻找的效应在总体中真实存在,那么(有希望)能在你的样本中观察到它。然而,总体内存在变异性,不能总是确信你所选定的样本能够让你检测到目标效应。
简而言之,使用经典假设检验方法的分析从零假设(无效应)和备择假设(有效应)出发。在上述场景中,我们假设效应确实存在于总体中。但仅凭偶然性,从你所选样本中生成的数据可能并未反应出该效应。换句话说,你的数据可能产生一个大于0.05(或你用作统计阈值的任何α值)的P值。因此,你不会拒绝零假设(既无效应),尽管效应在你所抽样的总体中确实存在!
检验的“功效”是指当零假设为假时,你能够拒绝它的概率。换句话说,功效就是当你要寻找的效应在总体中存在时,你能够拒绝零假设的概率。再回想我们的例子:我们一开始就指出效应再总体中确实存在,但由于总体内的变异性以及从中随机抽样,我们可能能够也可能无法观察到该效应。功效告诉我们观察到该效应的概率,它取决于许多因素,包括总体中效应的大小、从总体中抽取的样本量,以及总体内部的变异性。
理解功效的另一种方式:运行无限次实验
假设我们使用t检验来比较两个均值,且两个总体的均值确实相差某个特定的量。我们开始从两个感兴趣的总体中收集样本,测量样本均值,执行t检验,并得到一个P值。由于我们所抽样总体的变异性,这个P值可能大于α(通常为0.05),也可能小于α。
但现在假设我们从总体中选取新的样本并再次运行检验。由于变异性和抽样,样本值会略有不同,t检验也会产生不同的结果。从这个新检验中我们会得到不同的P值,它同样可能大于或小于α。
现在假设我们不断地重复这个过程。一些计算出的P值会小于α,我们会拒绝零假设,而另一些计算出的P值会大于α,我们则不会拒绝零假设。我们一开始就指出总体均值存在差异,因此如果我们运行相同的实验(使用从相同总体中抽取的相同大小的样本),那么我们会得到一定比例的实验,其P值小于我们的阈值。如果这个实验被无限次地重复,那么P值小于阈值的实验所占的百分比就是该实验的功效。
请注意,这在现实生活中无法实现,原因有几点:
关于功效(和β)的更多技术定义
通常,当你从总体中抽取样本时,你的目标是从中确定某个统计量(均值、标准差等)。另一种统计量可能是两个样本均值之差。还有一种统计量可能是样本均值之差除以两个样本的合并标准差。这最后一种统计量实际上就是t检验中使用的t统计量。
无论你计算的是什么统计量,由于你是从更大的总体中抽取样本,且该总体存在变异性,因此该统计量会有一系列可能的值。如果你抽取许多不同的样本,几乎可以肯定你会得到许多不同的统计量值。该统计量可能取值的分布由所谓的“抽样分布”给出。当查看统计量以确定不同总体之间是否存在预测的效应时,该统计量可能取值的分布也在很大程度上取决于该效应是否真实存在。
幸运的是,只要有足够关于总体和预测效应的信息,就可以构建假设效应存在和假设效应不存在时的统计量抽样分布。让我们来看一个t统计量的示例:
蓝色曲线是假设不存在效应时的抽样分布。注意该分布以零为中心,如果不存在效应,这是合理的。然而,由于总体的变异性以及从中抽取样本的事实,即使不存在效应,仍有可能获得大于或小于零的t统计量。
红色曲线是假设特定预测效应确实存在时的抽样分布。在这种情况下,分布中心大约在2.5左右。这是因为如果预测效应存在,计算出的t统计量更有可能远离零(但也不排除为零的可能性)。
当你通过从这些总体中抽取样本并计算t统计量来执行实验时,你会将该t统计量与“临界值”进行比较,以确定你获得的结果是否具有统计学显著性。这可以通过这些曲线直观地展示。以下是零假设的抽样分布(蓝色曲线,不存在效应)以及临界t值(垂直线):
阴影区域表示在零假设为真时,获得大于临界值的t统计量值的概率。在本例中,阴影区域占该曲线下总面积的5%。这代表了α的概念,即当零假设实际上为真时拒绝它的概率。如果你使用不同的α,你将获得不同的临界值,并且阴影区域覆盖的曲线面积也会不同。
以类似的方式,临界值可以与红色曲线结合使用:
在本例中,阴影区域表示在备择假设为真时,获得小于临界值的t统计量值的概率。此处阴影区域占该曲线下总面积的20%。这代表了β的概念,即当零假设为假时未能拒绝它的概率(Ⅱ类错误)。换句话说,就是当效应实际存在时未能检测到它的概率。
你可能注意到α(发生Ⅰ类错误的概率)比β(发生Ⅱ类错误的概率)小4倍,这些都是非常常见的取值。一种理解方式是,使用这些值意味着避免Ⅰ类错误(假阳性)的重要性是避免Ⅱ类错误(假阴性)的4倍。
功效实际上直接来源于β:
功效=1-β
因此,在上面的例子中,β为0.20时,功效等于0.8或80%。与α取0.05一样,这只是一个常用的功效值,并非严格的要求。最终,在设计实验时,你作为研究者需要自行决定希望达到的功效值。下一节将对此进行更详细的讨论。
将上述图像和信息整合在一起,我们可以得到:
我需要多大的功效?
功效是指在你所抽样的总体中,假设所研究的效应真实存在时,你的实验能够得出“统计学显著”结果的机会。你需要多大的功效?以下指南可能有所帮助:
理解统计功效的类比
在地下室寻找工具
统计功效的概念有点难以捉摸。这里有一个类比或许能帮到你(感谢John Hartung,纽约州立大学布鲁克林健康科学中心)。
你让孩子去地下室找个工具。他回来说“那儿没有”。你怎么判断?工具到底在不在那里?没有办法完全确定。
所以我们用概率来表达答案。你真正想问的问题是:“工具在地下室的概率是多少?”但这个问题在不了解先验概率并运用贝叶斯思维的情况下是无法真正回答的。我们暂且不谈这个,而是换一个略有不同的问题:“如果工具真的在地下室,孩子找到它的几率有多达?”
答案取决于以下几个问题的答案:
因此,如果他在一个整洁的地下室里花很长时间寻找一个大工具,那么工具若在那里,他找到的可能性就很高。所以你可以对他的结论(工具不在那里)相当有信心。但如果他在一个杂乱的地下室里花很短时间寻找一个小工具,那么“工具不在那里”的结论实际上并没有多大意义。
样本量与功效的类比
那么这与计算已完成实验的功效有何关系呢?关于找工具的问题,类似于询问已完成实验的功效。功效就是回答这个问题:如果某个效应(特定大小)确实发生,那么特定规模的实验发现“统计学显著”结果的机会有多大?
如果你使用大样本量,在一个标准差很小的系统中寻找大效应,那么如果该效应存在,你获得“统计学显著效应”的可能性就很高。因此,你可以相当确信“无统计学显著效应”的结论。但如果你使用小样本量,在一个标准差很大的系统中寻找小效应,那么“无统计学显著效应”的发现实际上并没有太大帮助。
Ⅰ类、Ⅱ类(以及Ⅲ类)错误
Ⅰ类与Ⅱ类错误
当你就某个效应是否具有统计学显著性做出结论时,你可能在两个方面出错:
0类与Ⅲ类错误
此外,你还可以定义另外两种错误:
使用功效评估“不显著”的结果
示例数据
Motulsky等人研究了高血压患者血小板上的α2-肾上腺素能受体数量是否发生了改变(Clinical Science 64: 265-272, 1983)。有许多理由认为自主神经受体数量在高血压中可能发生改变。我们研究血小板是因为它们可以从血样中轻松获得。结果如下所示:
| 变量 | 高血压组 | 对照组 |
| 受试者数量 | 18 | 17 |
| 受体平均数(每个细胞的受体数) | 257 | 263 |
| 标准差 | 59.4 | 86.6 |
两组均值几乎相同,因此t检验自然计算出了非常高的P值。我们得出结论:高血压患者与对照组相比,血小板上的α2受体数量没有统计学显著差异。在40多年前发表这项研究时,我们没有进一步深入分析。
这些阴性数据可以通过置信区间或功效分析来解读。这两种方法是等价的,只是思考数据的两种不同方式。
使用置信区间解读不显著的结果
所有结果都应附有置信区间,以显示你确定感兴趣差异(比值等)的精确程度。在我们的示例中,组间均值差异的95%置信区间从-45延伸到57个受体/血小板。一旦我们接受t检验分析的假设,我们可以95%确信该区间包含了两组平均受体数之间的真实差异。要正确看待这一点,你需要知道每个血小板受体数的平均值约为260。
置信区间的解读必须在科学背景中进行。一下是解读该置信区间的两种截然不同的方法:
两种说法都是合理的。这完全取决于你如何解读20%的变化。统计计算只能计算概率。你需要将这些置于科学背景中。与功效计算一样,不同的科学家可能会对相同的结果做出不同的解读。
使用功效分析解读不显著的结果
这项研究在发现差异(如果存在的话)方面的功效如何?答案取决于真实差异有多大。以下是以图形形式呈现的结果。
所有研究检测“大”差异的功效都很高,而检测“小”差异的功效则较低,因此功效图都具有相同的形状。解读该图取决于将结果置于科学背景中。以下是对结果的两种不同解读:
如你所见,对功效的解读取决于你认为检测到多大差异才具有科学或实际的重要性。不同的人可能会合理地得出不同的结论。请注意,查阅一项研究检测我们实际观察到的差异的功效是毫无帮助的。这是一个常见的误解。
比较两种方法
置信区间和功效分析基于相同的假设,因此结果只是看待同一事物的不同方式。对已完成的研究进行功效分析并不会获得额外信息,但功效分析可以帮助你正确看待结果。
功效分析方法基于心中有一个备择假设。然后你可以问,如果你的备择假设为真,实际使用的样本量的实验得出统计学显著结果的概率是多少。
如果你的目标仅仅是理解你的结果,那么置信区间方法就足够了。如果你的目标是批评他人的研究,或规划未来类似的研究,那么同时进行功效分析可能会有所帮助。
参考文献
Motulsky HJ, O’ Connor DT, Insel PA. Plateletalpha 2-adrenergic receptors in treated and untreated essential hypertension.Clin Sci(Lond). 1983 Mar; 64(3): 265-72.
建议:不要基于实际观察到的差异计算功效
事后功效分析几乎没有用处
有些程序在t检验和其他统计比较的结果中报告功效值。Prism不这样做,本节解释了原因。[size=14.6667px]
永远无法回答“这个实验设计的功效是多少”这个问题。这个问题根本没有意义。相反,你必须问“这个实验设计检测特定大小效应的功效是多少”。效应量可以是两个均值之间的差异、相对风险或其他衡量处理效应的指标。
你应该为哪个效应量计算功效?你应该寻找多大的差异?这些不是统计问题,而是科学问题。只有在科学地思考数据时,进行功效分析才有意义。计算研究设计检测你关心的最小效应的功效是有意义的。或者,计算研究找到由先前研究确定的效应量的功效也是有意义的。
在计算统计比较时,有些程序通过报告检测该特定实验中实际观测到的效应量(或差异、相对风险等)的功效来增强其结果。该结果有时被称为观察功效,该过程有时被称为事后功效分析或回顾性功效分析。
许多(也许是大多数)统计学家(我同意他们的观点)认为这些计算是无用且具有误导性的。如果你的研究得出结论认为差异没有统计学显著性,那么根据定义,它检测实际观察到的效应的功效非常低。通过这种计算你学不到任何新东西。计算研究检测在科学或临床上值得检测的差异的功效可能是有用的。但计算研究检测实际观察到的差异(或效应)的功效则没有价值。
观察功效与P值直接相关
Hoenig和Helsey(2001)指出,观察功效可以根据观察到的P值以及你选择的α值(通常为0.05)计算出来。当P值为0.05时(假设你将统计显著性定义为P<0.05,因此将α设为0.05),那么功效必须为50%。如果P值小于0.05,则观察功效小于50%。观察功效不传达任何新信息。下图(来自Helsey, 2001)显示了当α设为0.05时,非配对t检验的P值与观察功效之间的关系。
参考文献
SN Goodman和JA Berlin,《规划实验时使用预测置信区间与解释结果时滥用功效》,Annals Internal Medicine 121: 200-206, 1994。
Hoenig JM, Heisey DM,《功效的滥用》,The American Statistician。2001年2月1日,55(1): 19-24。doi: 10.1198/000313001300339897。
Lenth, R. V.(2001)《有效样本量确定的一些实用指南》,The American Statistician, 55, 187-193。
M Levine和MHH Ensom,《事后功效分析:一个时代已过的想法》,Pharmacotherapy 21: 405-409, 2001。
Thomas, L,《回顾性功效分析》,Conservation Biology Vol. 11(1997), No. 1, pages 276-280。
扫码加好友,拉您进群



收藏
