全部版块 我的主页
› 论坛 › 计量经济学与统计论坛 五区 › 计量经济学与统计软件
3991 0
2026-07-13

如果真实存在差异(或相关性或关联性),你也可能无法发现它。这取决于你实验的功效。

正常理解统计功效对于准确解读统计结果至关重要,本文将解释与功效相关的核心概念。




关键概念:统计功效

检验的“功效”究竟意味着什么?

在执行实验时,你通常感兴趣的是测量某种效应:药物处理组的蛋白质浓度是否与对照组不同;敲除株的中位生存时间是否比野生型更长;不同处理组之间的基因表达是否存在差异。


你的实验使用来自不同总体的样本来收集数据并执行统计分析。其思路是,如果你所寻找的效应在总体中真实存在,那么(有希望)能在你的样本中观察到它。然而,总体内存在变异性,不能总是确信你所选定的样本能够让你检测到目标效应。

简而言之,使用经典假设检验方法的分析从零假设(无效应)和备择假设(有效应)出发。在上述场景中,我们假设效应确实存在于总体中。但仅凭偶然性,从你所选样本中生成的数据可能并未反应出该效应。换句话说,你的数据可能产生一个大于0.05(或你用作统计阈值的任何α值)的P值。因此,你不会拒绝零假设(既无效应),尽管效应在你所抽样的总体中确实存在!

检验的“功效”是指当零假设为假时,你能够拒绝它的概率。换句话说,功效就是当你要寻找的效应在总体中存在时,你能够拒绝零假设的概率。再回想我们的例子:我们一开始就指出效应再总体中确实存在,但由于总体内的变异性以及从中随机抽样,我们可能能够也可能无法观察到该效应。功效告诉我们观察到该效应的概率,它取决于许多因素,包括总体中效应的大小、从总体中抽取的样本量,以及总体内部的变异性。


理解功效的另一种方式:运行无限次实验

假设我们使用t检验来比较两个均值,且两个总体的均值确实相差某个特定的量。我们开始从两个感兴趣的总体中收集样本,测量样本均值,执行t检验,并得到一个P值。由于我们所抽样总体的变异性,这个P值可能大于α(通常为0.05),也可能小于α。

但现在假设我们从总体中选取新的样本并再次运行检验。由于变异性和抽样,样本值会略有不同,t检验也会产生不同的结果。从这个新检验中我们会得到不同的P值,它同样可能大于或小于α。

现在假设我们不断地重复这个过程。一些计算出的P值会小于α,我们会拒绝零假设,而另一些计算出的P值会大于α,我们则不会拒绝零假设。我们一开始就指出总体均值存在差异,因此如果我们运行相同的实验(使用从相同总体中抽取的相同大小的样本),那么我们会得到一定比例的实验,其P值小于我们的阈值。如果这个实验被无限次地重复,那么P值小于阈值的实验所占的百分比就是该实验的功效。


请注意,这在现实生活中无法实现,原因有几点:

  • 我们没有时间或资源来执行无限次实验
  • 更重要的是,我们不知道我们所抽样的总体中是否真的存在该效应。如果我们已经知道存在某种效应,那么进行这些实验就没有多大意义了


关于功效(和β)的更多技术定义

通常,当你从总体中抽取样本时,你的目标是从中确定某个统计量(均值、标准差等)。另一种统计量可能是两个样本均值之差。还有一种统计量可能是样本均值之差除以两个样本的合并标准差。这最后一种统计量实际上就是t检验中使用的t统计量。

无论你计算的是什么统计量,由于你是从更大的总体中抽取样本,且该总体存在变异性,因此该统计量会有一系列可能的值。如果你抽取许多不同的样本,几乎可以肯定你会得到许多不同的统计量值。该统计量可能取值的分布由所谓的“抽样分布”给出。当查看统计量以确定不同总体之间是否存在预测的效应时,该统计量可能取值的分布也在很大程度上取决于该效应是否真实存在。


幸运的是,只要有足够关于总体和预测效应的信息,就可以构建假设效应存在和假设效应不存在时的统计量抽样分布。让我们来看一个t统计量的示例:


1.png


蓝色曲线是假设不存在效应时的抽样分布。注意该分布以零为中心,如果不存在效应,这是合理的。然而,由于总体的变异性以及从中抽取样本的事实,即使不存在效应,仍有可能获得大于或小于零的t统计量。

红色曲线是假设特定预测效应确实存在时的抽样分布。在这种情况下,分布中心大约在2.5左右。这是因为如果预测效应存在,计算出的t统计量更有可能远离零(但也不排除为零的可能性)。


当你通过从这些总体中抽取样本并计算t统计量来执行实验时,你会将该t统计量与“临界值”进行比较,以确定你获得的结果是否具有统计学显著性。这可以通过这些曲线直观地展示。以下是零假设的抽样分布(蓝色曲线,不存在效应)以及临界t值(垂直线):


2.png


阴影区域表示在零假设为真时,获得大于临界值的t统计量值的概率。在本例中,阴影区域占该曲线下总面积的5%。这代表了α的概念,即当零假设实际上为真时拒绝它的概率。如果你使用不同的α,你将获得不同的临界值,并且阴影区域覆盖的曲线面积也会不同。


以类似的方式,临界值可以与红色曲线结合使用:


3.png


在本例中,阴影区域表示在备择假设为真时,获得小于临界值的t统计量值的概率。此处阴影区域占该曲线下总面积的20%。这代表了β的概念,即当零假设为假时未能拒绝它的概率(Ⅱ类错误)。换句话说,就是当效应实际存在时未能检测到它的概率。

你可能注意到α(发生Ⅰ类错误的概率)比β(发生Ⅱ类错误的概率)小4倍,这些都是非常常见的取值。一种理解方式是,使用这些值意味着避免Ⅰ类错误(假阳性)的重要性是避免Ⅱ类错误(假阴性)的4倍。

功效实际上直接来源于β:

功效=1-β

因此,在上面的例子中,β为0.20时,功效等于0.8或80%。与α取0.05一样,这只是一个常用的功效值,并非严格的要求。最终,在设计实验时,你作为研究者需要自行决定希望达到的功效值。下一节将对此进行更详细的讨论。

将上述图像和信息整合在一起,我们可以得到:


4.png


  • α(Ⅰ类错误率):发生Ⅰ类错误的概率(当零假设为真时决绝它,即“假阳性”),通常设为0.05或5%
  • β(Ⅱ类错误率):发生Ⅱ类错误的概率(当零假设为假时未能拒绝它,即“假阴性”),通常设为0.2或20%
  • 功效(1-β):当零假设为假时(即效应真实存在时)拒绝零假设的概率,通常设为0.8或80%



我需要多大的功效?


功效是指在你所抽样的总体中,假设所研究的效应真实存在时,你的实验能够得出“统计学显著”结果的机会。你需要多大的功效?以下指南可能有所帮助:


  • 如果一项实验的检验功效低于50%,那么你只有在半数实验中才能检测到目标效应(如果它存在的话)。具有如此低功效的研究实际上帮助不大,而且(可能更糟)不太可能被重复出来
  • 许多研究者选择样本量以获得80%的功效。这是随意设定的,但被广泛使用
  • 理想情况下,你对可接受功效的选择应取决于犯Ⅱ类错误的后果





理解统计功效的类比

在地下室寻找工具

统计功效的概念有点难以捉摸。这里有一个类比或许能帮到你(感谢John Hartung,纽约州立大学布鲁克林健康科学中心)。


你让孩子去地下室找个工具。他回来说“那儿没有”。你怎么判断?工具到底在不在那里?没有办法完全确定。

所以我们用概率来表达答案。你真正想问的问题是:“工具在地下室的概率是多少?”但这个问题在不了解先验概率并运用贝叶斯思维的情况下是无法真正回答的。我们暂且不谈这个,而是换一个略有不同的问题:“如果工具真的在地下室,孩子找到它的几率有多达?”

答案取决于以下几个问题的答案:


  • 他找了多长时间? - 如果他找了很长时间,他更有可能找到工具
  • 工具有多大? - 找到一把雪铲比找到修眼镜用的小螺丝刀要容易
  • 地下室有多乱? - 如果地下室一团糟,他找到工具的可能性就比地下室井井有条时要低


因此,如果他在一个整洁的地下室里花很长时间寻找一个大工具,那么工具若在那里,他找到的可能性就很高。所以你可以对他的结论(工具不在那里)相当有信心。但如果他在一个杂乱的地下室里花很短时间寻找一个小工具,那么“工具不在那里”的结论实际上并没有多大意义。


样本量与功效的类比


那么这与计算已完成实验的功效有何关系呢?关于找工具的问题,类似于询问已完成实验的功效。功效就是回答这个问题:如果某个效应(特定大小)确实发生,那么特定规模的实验发现“统计学显著”结果的机会有多大?


  • 在地下室寻找的时间类似于样本量。你收集的数据越多,发现效应的功效就越高
  • 工具的大小类似于你要寻找的效应量。发现大效应的功效总是比发现小效应要高
  • 地下室的杂乱程度类似于你数据的标准差。如果数据非常分散,你发现效应的功效就会更低



如果你使用大样本量,在一个标准差很小的系统中寻找大效应,那么如果该效应存在,你获得“统计学显著效应”的可能性就很高。因此,你可以相当确信“无统计学显著效应”的结论。但如果你使用小样本量,在一个标准差很大的系统中寻找小效应,那么“无统计学显著效应”的发现实际上并没有太大帮助。




Ⅰ类、Ⅱ类(以及Ⅲ类)错误

Ⅰ类与Ⅱ类错误

当你就某个效应是否具有统计学显著性做出结论时,你可能在两个方面出错:


  • 当总体上确实没有差异(关联、相关……)时,但由于随机抽样使你的数据显示出统计学显著的差异(关联、相关……),你就犯了Ⅰ类错误。你得出两组确实不同(有关联、相关)的结论是错误的
  • 当总体上确实存在差异(关联、相关)时,但由于随机抽样使你的数据未能显示统计学显著的差异,你就犯了Ⅱ类错误。因此,你得出两组实际上没有差异的结论是错误的



0类与Ⅲ类错误

此外,你还可以定义另外两种错误:


  • 当你得到了正确的答案,但问错了问题时,你就犯了0类错误!这有时被称为Ⅲ类错误,尽管该术语通常有不同定义(见下文)
  • 当你正确地得出两组在统计学上存在差异的结论,但对差异的方向判断错误时,你就犯了Ⅲ类错误。假设某种处理确实增加了某个变量,但你不知道这一点。当你进行实验以查明真相时,随机抽样恰好使对照组的值非常高,而处理组的值很低。这意味着处理组的均值(平均而言)更低,且低到足以使差异具有统计学显著性。你将正确地拒绝“无差异”的零假设,并正确地得出处理显著改变了结果的结论。但你得出的结论是处理降低了平均值,而实际上处理(平均而言,但在你的受试者中并非如此)是增加了该值。Ⅲ类错误非常罕见,因为它们只有在随机偶然性导致你从实际较高的组中收集到低值,而从实际较低的组中收集到高值时才会发生





使用功效评估“不显著”的结果

示例数据

Motulsky等人研究了高血压患者血小板上的α2-肾上腺素能受体数量是否发生了改变(Clinical Science 64: 265-272, 1983)。有许多理由认为自主神经受体数量在高血压中可能发生改变。我们研究血小板是因为它们可以从血样中轻松获得。结果如下所示:


  

变量

  
  

高血压组

  
  

对照组

  
  

受试者数量

  

18

17

  

受体平均数(每个细胞的受体数)

  

257

263

  

标准差

  

59.4

86.6


两组均值几乎相同,因此t检验自然计算出了非常高的P值。我们得出结论:高血压患者与对照组相比,血小板上的α2受体数量没有统计学显著差异。在40多年前发表这项研究时,我们没有进一步深入分析。


这些阴性数据可以通过置信区间或功效分析来解读。这两种方法是等价的,只是思考数据的两种不同方式。


使用置信区间解读不显著的结果

所有结果都应附有置信区间,以显示你确定感兴趣差异(比值等)的精确程度。在我们的示例中,组间均值差异的95%置信区间从-45延伸到57个受体/血小板。一旦我们接受t检验分析的假设,我们可以95%确信该区间包含了两组平均受体数之间的真实差异。要正确看待这一点,你需要知道每个血小板受体数的平均值约为260。


置信区间的解读必须在科学背景中进行。一下是解读该置信区间的两种截然不同的方法:


  • 该置信区间包含了任一侧发生20%变化的可能性。20%的变化是巨大的。在如此宽的置信区间下,数据是不确定的。可能是没有变化,可能是大幅减少,也可能是大幅增加
  • 该置信区间告诉我们真实差异不太可能在任一侧超过20%。由于我们只关注50%的变化,我们可以得出结论:任何差异充其量只有20%左右,这在生物学上是微不足道的。这是可靠的阴性结果



两种说法都是合理的。这完全取决于你如何解读20%的变化。统计计算只能计算概率。你需要将这些置于科学背景中。与功效计算一样,不同的科学家可能会对相同的结果做出不同的解读。

使用功效分析解读不显著的结果


这项研究在发现差异(如果存在的话)方面的功效如何?答案取决于真实差异有多大。以下是以图形形式呈现的结果。


5.gif


所有研究检测“大”差异的功效都很高,而检测“小”差异的功效则较低,因此功效图都具有相同的形状。解读该图取决于将结果置于科学背景中。以下是对结果的两种不同解读:


  • 我们真正关心的是心脏、肾脏、大脑和血管中的受体,而不是血小板中的受体(后者更容易获取)。因此,只有当差异达到50%时,我们才会继续深入这些结果(做更多研究)。每个血小板的平均受体数约为260,因此只有当差异超过其一半,即130时,我们才会对这些结果产生真正的兴趣。从上图可以看出,这项研究检测130个受体/血小板差异的功效极高。换句话说,如果差异真的那么大,这项研究(考虑到其样本量和变异性)几乎肯定能发现统计学显著的差异。因此,这项研究提供了令人信服的阴性结果
  • 嘿,这可是高血压。没有什么是简单的。没有哪种效应是大的。我们必须抓住每一个可能的线索。如果能发现50%的差异固然很好(见上文),但实际上,鉴于高血压的异质性,我们不能期望找到如此大的差异。即使差异只有20%,我们仍然想做后续实验。由于每个血小板的平均受体数约为260,这意味着我们想要发现大约50个受体/血小板的差异。从图中(或表中)可以看出,这项实验发现50个受体/细胞差异的功效大约只有50%。这意味着即使真的存在如此大的差异,这个特定的实验(考虑到其样本量和离散程度)也只有50%的机会发现统计学显著的结果。在如此低的功效下,我们实际上无法从这项实验中得出太多结论。持这种论点的审稿人或编辑可以有说服力地认为,发表这种检测生物学上有趣结果的功效如此之低的阴性数据是没有意义的



如你所见,对功效的解读取决于你认为检测到多大差异才具有科学或实际的重要性。不同的人可能会合理地得出不同的结论。请注意,查阅一项研究检测我们实际观察到的差异的功效是毫无帮助的。这是一个常见的误解。


比较两种方法

置信区间和功效分析基于相同的假设,因此结果只是看待同一事物的不同方式。对已完成的研究进行功效分析并不会获得额外信息,但功效分析可以帮助你正确看待结果。

功效分析方法基于心中有一个备择假设。然后你可以问,如果你的备择假设为真,实际使用的样本量的实验得出统计学显著结果的概率是多少。

如果你的目标仅仅是理解你的结果,那么置信区间方法就足够了。如果你的目标是批评他人的研究,或规划未来类似的研究,那么同时进行功效分析可能会有所帮助。

参考文献


Motulsky HJ, O’ Connor DT, Insel PA. Plateletalpha 2-adrenergic receptors in treated and untreated essential hypertension.Clin Sci(Lond). 1983 Mar; 64(3): 265-72.




建议:不要基于实际观察到的差异计算功效

事后功效分析几乎没有用处

有些程序在t检验和其他统计比较的结果中报告功效值。Prism不这样做,本节解释了原因。[size=14.6667px]

永远无法回答“这个实验设计的功效是多少”这个问题。这个问题根本没有意义。相反,你必须问“这个实验设计检测特定大小效应的功效是多少”。效应量可以是两个均值之间的差异、相对风险或其他衡量处理效应的指标。

你应该为哪个效应量计算功效?你应该寻找多大的差异?这些不是统计问题,而是科学问题。只有在科学地思考数据时,进行功效分析才有意义。计算研究设计检测你关心的最小效应的功效是有意义的。或者,计算研究找到由先前研究确定的效应量的功效也是有意义的。

在计算统计比较时,有些程序通过报告检测该特定实验中实际观测到的效应量(或差异、相对风险等)的功效来增强其结果。该结果有时被称为观察功效,该过程有时被称为事后功效分析或回顾性功效分析。


许多(也许是大多数)统计学家(我同意他们的观点)认为这些计算是无用且具有误导性的。如果你的研究得出结论认为差异没有统计学显著性,那么根据定义,它检测实际观察到的效应的功效非常低。通过这种计算你学不到任何新东西。计算研究检测在科学或临床上值得检测的差异的功效可能是有用的。但计算研究检测实际观察到的差异(或效应)的功效则没有价值。

观察功效与P值直接相关

Hoenig和Helsey(2001)指出,观察功效可以根据观察到的P值以及你选择的α值(通常为0.05)计算出来。当P值为0.05时(假设你将统计显著性定义为P<0.05,因此将α设为0.05),那么功效必须为50%。如果P值小于0.05,则观察功效小于50%。观察功效不传达任何新信息。下图(来自Helsey, 2001)显示了当α设为0.05时,非配对t检验的P值与观察功效之间的关系。


6.gif


参考文献

SN Goodman和JA Berlin,《规划实验时使用预测置信区间与解释结果时滥用功效》,Annals Internal Medicine 121: 200-206, 1994。

Hoenig JM, Heisey DM,《功效的滥用》,The American Statistician。2001年2月1日,55(1): 19-24。doi: 10.1198/000313001300339897。

Lenth, R. V.(2001)《有效样本量确定的一些实用指南》,The American Statistician, 55, 187-193。

M Levine和MHH Ensom,《事后功效分析:一个时代已过的想法》,Pharmacotherapy 21: 405-409, 2001。


Thomas, L,《回顾性功效分析》,Conservation Biology Vol. 11(1997), No. 1, pages 276-280。


二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

相关推荐
栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群