返回 2026-07-22
📝 其他

Kuiper Q-Q图:这些数据相同吗?Kuiper Q-Q plot: are these the same?

在比较两组数据的分布差异时,传统的统计方法可能难以直观展现变化。文章介绍了Kuiper Q-Q图作为一种可视化工具,用于判断两组数据是否来自同一分布。通过一个儿童治疗评分的案例,展示了该图表如何揭示实验组比参考组具有更大的分数波动。Kuiper Q-Q图提供了一种比标准Q-Q图更敏感的分布尾部差异检测手段。

kqr

当我们试图直观理解分布函数的差异时,我们发现接受某种处理的儿童在分数上的变异比参考组更大。

然而,我们无法判断这种差异是否大到足以作为决策的有效指南。这可能只是小样本量造成的人为假象。

总结

如果你已经熟悉这套流程,只需将数据粘贴到工具中,然后继续你的工作即可。我真希望我早早就做出了这个工具!该工具会显示一个 q-q 图用于视觉比较,计算 Kuiper 检验统计量,并提供一个方便的显著性阈值参考表。

它允许你在多个理论参考分布之间进行选择。或者,你可以输入自己的参考分布,可以是确切已知的经验分布函数,也可以是带有内在不确定性的参考样本。支持的理论参考分布附带用于模型选择的 aic 值。

如果以上内容对你来说毫无意义,请继续阅读。

分布相似性检验

生活中的许多定量问题都具有相同的大致形态:

  • 我们有一些可能比较特殊的数据。
  • 我们知道这类数据通常遵循某种分布。
  • 我们想知道这些可能特殊的数据是属于普通情况,还是在某种程度上确实具有特殊性。
  • 我们通常对总体情况有很好的了解——这是一个我们确切知道的参考分布(在我们的例子中,即总体的一般得分情况)。然后,我们有一组较小的数据点——一个样本——我们认为它可能在某些方面比较特殊(在我们的例子中,即处理组的得分),但我们并不确定。为了更加确定,我们想进行某种检验,以告诉我们样本是否真的特殊。如果检验失败,我们将假设我们的样本是参考分布的一个小规模体现。

    这样的检验就像一个带有两个插槽和一个灯泡的黑盒。我们将参考分布放入大插槽中。将我们的样本滑入较小的插槽中。然后盒子会嗡嗡响一小会儿,当它安静下来时,可能会发生以下两种情况之一。要么

  • 灯泡亮了!在这种情况下,盒子以很高的确定性判定,样本并非来自参考分布11 好吧,这是一个频率派检验,所以严格来说,盒子判定的是:如果从参考分布中重复抽取相似大小的样本,在超过 95% 的情况下,检验统计量不会那么极端。但频率派的置信区间通常接近贝叶斯后验可信区间,所以我打算忽略这个差异。Albers、Kiers 和 Ravenwaaij 在 2018 年提出的论点是常被引用的辩护;或者
  • 灯泡保持熄灭,在这种情况下,盒子无法区分样本和参考分布。
  • 需要注意的是,在第二种情况下,盒子并没有声称样本来自参考分布。这是无法证明的,因为它可能来自某种差异极其细微、在有限数据下无法检测到的事物。灯泡保持熄灭仅仅意味着样本与参考分布的差异不足以将它们区分开来。这可能是因为它们相同,或者因为它们非常相似但不完全相同,但也可能是因为样本太小,即使差异相当大,也无法确定这种差异。

    假阳性和假阴性

    由于事物的随机性,这样的测试有时会显示错误的结果。它可能会在样本并不特殊时指出其特殊(假阳性;第一类错误)。它也可能在样本确实特殊时未能指出其特殊(假阴性;第二类错误)。

    由于第一类错误和第二类错误之间存在权衡,我们无法将两类错误的目标都设定得很低。相反,我们将第一类错误(即低假阳性率)的目标设定得很低,然后在该约束条件下寻找假阴性尽可能低的测试。我们关注假阳性的原因在于,在声称样本特殊之前,我们希望有相当的把握,因此我们优先考虑降低假阳性的发生率。

    在科学研究中,选择一种每使用20次出现一次假阳性的测试是非常常见的,但合适的阈值选择取决于结论所支撑的决策。为了便于讨论,假设我们希望第一类错误率为10%——即每十次应用中出现一次假阳性。

    然后,在具有该假阳性率的测试中,我们寻找第二类错误率尽可能低的测试,或者用统计学术语来说,寻找高统计功效的测试。测试的统计功效是指其成功检测出样本特殊性的能力,即使这种特殊性非常微弱而难以察觉。

    然而,还有第三个问题。为了快速而粗糙的决策,我们需要一种广泛适用的测试。这种需求与对高功效测试的需求相矛盾,因为适用范围较窄的测试通常功效更高,但需要更多地考虑其适用条件。我们不想在选择测试前还要去翻阅统计学书籍,因此我们坚持使用广泛适用的测试;只要样本是随机的,无论数据来自哪里,我们几乎都可以使用这些测试。这些测试的功效会较低,但为了保持测试的简单易用,我们愿意做出这种权衡。

    这就为我们用来区分样本与参考分布的黑盒设定了三个优先事项:

  • 低假阳性率。目标是10%,但理想情况下这应该是一个我们可以调节的旋钮。这是最重要的,因为我们希望对结论有一定的信心。
  • 广泛适用的测试。我们应该尽可能少地去思考放入黑盒的是哪种样本和参考分布。
  • 高功效的测试。这与上述两个优先事项相矛盾,因此我们不得不接受功效低于理想水平的情况,但我们仍会在现有约束条件下追求尽可能高的功效。
  • 在进入可用测试的“动物园”之前,我们应该做一个小小的技术绕道。

    检验统计量与显著性阈值

    了解这些测试的基本工作原理是很有用的,所以让我们把黑盒稍微打开一点往里看。里面很暗,所以我们只能大致看清内部的结构。

    正如我们所说,测试接收参考分布和一个样本。由此,测试计算出检验统计量。“检验统计量”这个名字听起来非常正式和具体,但实际上对于如何计算检验统计量并没有任何规定。你能想到的任何涉及参考分布和样本的数学运算都是可以的。

    对检验统计量的唯一要求是,在所需的置信水平下,其计算值必须已知,并且针对所有可能的参考分布和样本量在某处制成了表格。这是最神奇、也最困难的部分。想出各种计算检验统计量的方法很容易;但要证明它们能转化为对任何输入都正确的置信水平,就难得多了。

    但是,一旦我们完成了寻找正确计算的艰苦工作,黑盒就可以为输入计算检验统计量,然后在那些表格中查找它。在此基础上,检验可以指示样本是否特殊。

    候选检验

    无论好坏,符合我们标准的检验并不多。

  • Kolmogorov–Smirnov 检验简单且非常流行。该检验统计量是通过取样本所隐含的分布与参考分布之间的最大差异,并按样本中的数值数量进行缩放来计算的。有许多表格可用于将此值与适当的置信阈值进行比较。
  • Cramér–von Mises 和 Anderson–Darling 检验都是某类检验中流行的特例。在这类检验中,检验统计量是根据所有样本值计算的,而不仅仅是最大差异。这使得这些检验严格来说比 Kolmogorov–Smirnov 更强大,但计算也更复杂。Cramér–von Mises 统计量对样本的所有部分赋予相同的权重,而 Anderson–Darling 检验则从样本的尾部获取更多的统计量值。这使得 Anderson–Darling 在许多情况下更强大,但同样,计算也稍微复杂一些。
  • 这三种检验都有一个缺点:它们在旋转下不具有不变性。这意味着,如果感兴趣的测量具有循环分布(例如一天中的小时数、风向、色彩空间中的色调、图像中的边缘方向等),那么这些检验可能会检测到实际上并不存在的虚假差异,而这些差异仅仅是由于旋转的偶然性造成的。例如,如果某事经常在午夜左右发生,这些检验会将其视为“在一天开始时”发生和“在一天结束时”分别发生,而不是将其视为恰好跨越截止点的一整块事件。幸运的是,有些检验在旋转下是不变的。

  • Kuiper 检验类似于 Kolmogorov–Smirnov 检验,不同之处在于其检验统计量基于与参考分布两个方向上的最大偏差之和。这使得 Kuiper 检验比 Kolmogorov–Smirnov 更强大,而且不知何故,它也使其在旋转下不变。这特别巧妙,因为旋转不变性通常会由于更具一般性而牺牲一些功效。但在这种情况下,我们同时获得了旋转不变性和更大的功效。Kuiper 检验只稍微复杂一点,在其他方面是对 Kolmogorov–Smirnov 检验的严格改进。
  • Watson U² 检验是对 Cramér–von Mises 类检验的调整,使其具有旋转不变性。这意味着 Watson U² 检验比 Kuiper 检验更强大,但执行起来也更复杂。
  • 我认为 Kuiper 检验在功效、对周期性和非周期性分布的适用性以及简洁性之间找到了一个绝佳的平衡点。接下来我们将使用它。我对该检验的实现基于 Stephens 的修改44 Use of the Kolmogorov–Smirnov, Cramér–von Mises, and related statistics without extensive tables; Stephens; Journal of the Royal Statistical Society; 1970. 过程,主要是因为介绍它的那篇论文恰好是一份很好且简洁的参考资料。

    q-q 图

    回想一下那个让我们感到困惑的图。我们有一条灰色的参考分布,并在其上叠加了一个经过处理的样本。处理后的样本看起来像是来自不同的分布,但真的是这样吗?

    我们可以想象拉伸、扭曲和挤压这个图,使得灰色的参考线变成一条笔直的对角线。我对上面的图截了图,在 Gimp 中打开它,拉伸了某些部分并压缩了其他部分,直到灰线几乎变成了一条笔直的对角线。

    显然,我并不擅长这个。幸运的是,我们可以让计算机来完成这种转换。其结果就是所谓的 q-q 图,因为样本的分位数是相对于参考分布的分位数来绘制的。

    q-q 图比原始分布稍微难解释一些,主要是因为它牺牲了关于测量尺度的信息。但在比较分布时,q-q 图的效果和原始分布一样好,只是经过了扭曲,以便从参考分布的视角来观察。

    事实上,这正是 q-q 图在目测差异时如此有用的原因:我们不需要同时跟踪两个分布,而是可以专注于样本与固定对角线之间的关系。q-q 图也很方便获取执行 Kuiper 检验所需的数据:我们只需记录对角线下方和上方的最大距离即可。

    更多示例

    如果你还没有被说服,这里还有一些我们可能想要执行此类检验的例子。

  • 我们注意到,社交聚会上人们的生日似乎集中在年底,而不是像普通人群预期的那样大致均匀分布。也许那只是随机的偶然,或者有某种因素在起作用,筛选出了年底出生的人。55 这实际上是制作这里所介绍工具的动机案例。我当时没有办法在移动中测试这个假设,所以后来回家后我做了一个。是的,我在派对上就是这么有趣。
  • 我们记录了软件服务中事件之间的时间间隔。如果这些时间可以从指数分布中得出,那就意味着事件的发生是相互独立的。这对我们选择如何处理它们有着巨大的影响。66 但我关心的原因是为了一个预测竞赛。
  • 有人说提交大小呈对数正态分布。我们可以从例如 nginx 获取一些提交大小,并测试它们是否符合对数正态分布。
  • 从之前的一篇文章中,我们得到了最高法院大法官退休时的年龄。我们推测它们服从 Weibull 分布,但看看 Kuiper 检验是否同意会很有帮助。
  • 我们发现了一些数据,我们认为它们对应于台湾领空每日侵犯次数的双周最大值。如果确实如此,它们应该能很好地拟合 Fréchet 或 Gumbel 分布。如果不是,我们看到的可能并不是我们以为的数据。
  • 那么,我们可以验证一下。

    生日

    如果我们将生日记录为它们发生的(带小数的)一年中的月份,就可以将其粘贴到这个 Kuiper Q-Q 图工具中。对于参考分布,我们选择 0 到 12 之间的均匀分布。我们在 Q-Q 图上看到,生日样本低于参考对角线,这表明生日确实集中在年末。

    然而,Kuiper 检验统计量返回值为 1.46,小于 1.620,因此在 10% 的显著性水平下不显著。这意味着仅凭随机概率就能产生这种生日分布。

    事件间隔

    我们计算每个事件之间的天数,并将它们粘贴到同一个工具中。正如最低的 AIC 值所示,指数分布是最佳拟合。对于指数分布,Kuiper 检验统计量也远未达到显著水平。看来这些软件事件是随机发生的,彼此之间没有关联。

    提交大小

    我们统计了 nginx 仓库最近一些提交中增加和删除的行数。我们将它们粘贴到工具中。对数正态分布是最佳拟合,且偏离程度不显著。看来提交大小服从对数正态分布。

    领空侵犯

    我们再次将其粘贴到工具中。Fréchet 是最佳拟合,检验统计量显示仅有轻微偏离。有趣的是,Fréchet 比 Gumbel 拟合得更好——这表明领空侵犯具有肥尾特征。

    人员得分

    最后,我们来处理最初想做的事情。虽然现在稍微复杂了一点,因为我们拥有的参考分布不是理论分布;它是来自国家收集的人口统计原始数据。不过,在将样本粘贴到工具中后,它允许我们通过“分位数”(Quantiles)选项卡粘贴特定的参考分布。

    看看这个!偏离显然是显著的。Kuiper 检验统计量为 2.79,仅凭随机概率出现这种情况是极其罕见的。因此,我们可以有把握地得出结论,该处理确实对个人的得分产生了影响。这种影响是好是坏需要更细致的判断——请记住,这种差异意味着获得极差分数的可能性更大,但获得好分数的可能性也更大。

    让连续分布检验变得简单

    我使用 Kuiper Q-Q 图工具已经有一段时间了,它经常派上用场。毕竟,这是我发现自己想要执行的第二常见的假设检验。

    我经常需要的另一种检验实际上是一样的,只是值是离散的。事实证明,以一种简单、通用且仍然可用的方式创建该工具会稍微更具挑战性。也许下次再说吧。

    需要完整排版与评论请前往来源站点阅读。