足球数据:异常值 vs 异常现象

异常值和异常现象之间的区别可能看起来是语义上的,但它改变了我们解释球员表现的方式。

足球数据:异常值 vs 异常现象
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

你知道我多年来低估了什么吗?足球领域的沟通。无论是在足球组织内部、在社交媒体上,还是与同行交流。你所有想法的关键在于沟通,更具体地说是语言。如果你在体育实体的所有部门都说同一种足球语言,那么犯错的空间就会更小。

本着这种精神,还存在这样的情况:两个不同的词语/定义被随意使用,仿佛它们是同一回事。这正是我今天想谈论的。异常值和异常现象之间的区别。

1、数据

我使用的数据是汇总数据。这些数据包含我自己为2026赛季J2/J3联赛制定的指标,基于Opta的原始事件数据构建。通过创建自己的指标,我有更多自由来观察我想看的东西,但总是存在出错的可能性。这些数据创建于2026年8月15日。

我将查看出场时间超过450分钟、位置为中锋/前锋的球员。此外,我创建了一个标准,要求他们在禁区内触球比例超过60%,且80%的射门应来自该区域。这是用原始事件数据完成的。

2、理论一:异常值

异常值是显著偏离数据集中大多数数据点的值,与中心值簇相距甚远。它们可能是由数据变异性、实验误差或数据集中自然发生的不常见现象引起的。基于四分位距(IQR)或与均值的偏差(即标准差)的统计方法用于识别异常值。

在数据集中,异常值定义为位于第一或第三四分位数1.5倍IQR之外,或与均值相差3个标准差之外的值。这些极端值可能会扭曲分析并产生错误的统计结论,从而影响机器学习模型的准确性。

异常值需要仔细处理,因为它们可能表示值得进一步调查的重要异常现象,或者仅仅是收集错误数据的结果。根据具体情况,可以消除、更改或使用特定技术进行算法处理,以最小化其影响。总之,异常值是数据分析中至关重要的组成部分,需要准确识别和妥善处理,以确保获得的结果可靠。

2.1 同质和异质异常值

同质异常值是偏离整个数据集但彼此相似的数据点。它们形成一个具有相似特征的组,表明它们可能代表与主数据簇不同的但内部一致的模式或趋势。例如,在人类身高数据集中,一群非常高的篮球运动员就是同质异常值。这些异常值可能表明数据中存在遵循不同分布但内部一致的子群体。

来源:Winning with Analytics, 2023

异质异常值则是个别的数据点,它们独自突出,与其他异常值没有明显的模式或相似性。每个异质异常值在偏离数据集方面都是独特的。以身高为例,普通人群数据集中单个非常高的人就是异质异常值。这些异常值可能是由于数据输入错误、测量异常或罕见事件造成的。

来源:Winning with Analytics, 2023

3、理论二:异常现象

异常现象是数据集中与通常预期显著不同的观察、模式或行为。它们代表不遵循数据中大多数结构或行为的异常情况。异常现象可能是由于测量误差、意外情况、底层流程变化或自然发生的罕见事件引起的。它们的存在可以提供关于数据集行为和结构的重要信息。

3.1 局部异常现象

局部异常现象是与特定相似观察组相比表现异常的观察,而不是与整个数据集相比。它们通过在每个观察周围定义局部邻域并确定其特征是否与附近或可比观察显著不同来识别。

3.2 上下文异常现象

上下文异常现象是由于发生时的特定环境而变得异常的观察。它们的异常性质不能仅从观察值本身确定,因为相同的值在一个上下文中可能是预期的,在另一个上下文中可能是意外的。

上下文异常检测将观察的上下文与其行为分开。上下文可以由时间、位置、类别、角色、环境或情况等变量组成。首先在该特定上下文中建立预期行为,然后将实际观察与该预期进行比较。偏离通常预期的程度越大,表明异常现象越强。

3.3 多变量异常现象

多变量异常现象发生在多个变量组合出现异常模式时。单个变量不一定包含异常值。相反,是它们特定的关系或组合使观察变得异常。

3.4 条件异常现象

条件异常现象是在给定特定已知条件的情况下行为异常的观察。它们的识别基于在考虑影响结果的变量后,估计合理预期应该是什么。

4、区别

异常值是与数据集中大多数值在统计上距离较远的观察。通常根据变量的分布来识别,使用四分位距(IQR)、标准差或z分数等方法。因此,主要考虑的是统计极端性:一个观察被认为是异常值,因为其数值离数据的中心集中区域异常遥远。因此,异常值检测通常基于相对清晰的统计阈值。

相比之下,异常现象是行为与通常预期不同的观察或模式。异常观察不一定包含极端的数值。它的异常性质可能来自其上下文、与其他变量的关系、其局部环境或它所具有的特征组合。因此,异常检测侧重于识别意外行为或模式,通常使用统计模型或机器学习技术来确定什么构成正常行为,然后测量偏离程度。

因此,根本区别在于异常值关注统计距离,而异常现象关注意外行为。一个极端值可以完全可解释,因此提供的异常信息很少,而一个明显普通的值在考虑其上下文或与其他变量的关系后可能变得异常。异常值分析主要问 "这个观察有多极端?",而异常检测问 "考虑到我们通常的预期,这个观察有多异常?"

5、球探一:异常值

如前所述,我正在寻找出场时间超过900分钟、禁区内触球比例60%、禁区内射门比例80%的前锋。首先,我将展示分布图,以显示有多少球员符合该标准。

现在我必须先纠正一些事情。没有球员的禁区内触球比例达到60%。远低于此。我将阈值改为15%,这给我留下了21名符合该阈值的球员。

继续看这21名球员,我们看到有13名球员符合禁区内射门比例80%的阈值。我将X轴从50%开始,因为没有球员低于60%。这是为了视觉清晰。

现在我有了我的球员;我想比较两个特定指标:每90分钟射门次数 vs 射门转化率。这将允许我展示被选中的被认为是真正禁区威胁的球员的射门与转化率的比较。

让我们看看异常值:

在这个散点图中,我们看到两个指标的比较。异常值被标记了不同的颜色。这就是我们所说的异质异常值。它们是每个特定指标的异常值。Jennings和Patric在每90分钟射门次数方面最佳,而Kobayashi和Rakao在射门转化率方面最佳。

两个轴都使用13名球员转换为z分数(与群体平均值的标准差):

  • zx = 球员每90分钟射门次数与群体平均值的距离,以标准差表示
  • zy = 球员转化率与群体平均值的距离,以标准差表示

然后两个独立的、方向特定的规则决定颜色:

  • 高效终结者(珊瑚色):zy > 1.2 — 仅转化率异常高,无论他们射门多少。包括Kobayashi和Takao。
  • 高产量、低回报(铁锈色):zx > 1.2zy < 0 — 射门远高于平均水平且转化率低于平均水平。包括Jennings和Patric。
  • 未被任一规则捕获的球员保持灰色("核心")。

那么,如果我们选择不看我们特定的禁区、标准,会是什么样子?

转到下一个散点图:

在上面的散点图中,你看到相同的球员对抗相同的指标。然而,异常值不是作为异质计算的,而是作为同质计算的。它们被计算为好像都由一个数据指标组成,而不是混合的。这意味着异常值略有不同。

这里的异常值是Kobayashi、Hidaka、Jenning和Patric。Hidaka是一个新的异常值,而Takao根据这个指标不是异常值。

相同的两个z分数(zxzy),但它们不是检查方向,而是组合成一个单一的数字——从群体中心到该点的直线距离:

z_combined = √(zx² + zy²)

如果z_combined > 1.5,球员被标记为异常值;否则,他们显示为灰色。这将"异常值"视为一个统一的类别——它只回答球员有多远,而不回答哪个方向。这就是为什么它是同质的:每个被标记的球员都获得相同的颜色,即使Kobayashi(极端转化率)和Jennings(极端产量)是因相反原因而成为异常值。

然而,我不满意。这些筛选条件太严格了。让我们看看所有中锋。

109名中锋(出场时间≥450分钟)中的18名以异质异常值的方式被标记。这是每个指标集的异常值分布。你可以看到左上角的高效终结者和右下角的高产量、低回报。

看同质异常值,我们看到一些不同的情况。14名球员被选为异常值,他们都被计算为距离均值2个标准差。

6、球探二:异常现象

我们不需要重新筛选禁区内射门和禁区内触球,因为我们已经有了。然而,我们现在是在寻找异常现象。

与分别针对两个轴评估每个球员不同,此图表衡量马氏距离:在考虑每90分钟射门次数和转化率之间的实际协方差后,球员与群体质心的距离(两者在这里有轻微的负相关,r = -0.18)。

在实践中,这意味着边界不是围绕平均值的简单框或十字准线,而是遵循数据真实形状的倾斜椭圆:一个球员可能在两个指标上都单独表现平平,但如果他们的射门量和终结的组合打破了群体其余部分遵循的模式,仍然可以被视为异常现象;相反,一个球员可能在一个轴上看起来极端,但一旦考虑了这种相关性,仍然可能表现平平。边界设置在两个自由度的90百分位卡方阈值处,显示为图上的虚线椭圆。

在这个群体的13名禁区型中锋中,只有两名位于其外部:K. Kobayashi,他的转化率远高于他适度射门量所预测的水平;C. Jennings,他的射门量远高于他适度转化率所预测的水平。其他三名球员(Patric、H. Hidaka和R. Takao)在此分析的早期使用更简单的z分数测试时看起来异常,但一旦考虑了两个指标之间的相关性,这三人都变得与群体整体关系预测一致。

但13个太少了;让我们回到起点,看看所有中锋:

109名中锋(出场时间≥450分钟)中有6个异常现象:K. Kobayashi和Y. Naito(低射门量但高转化率)、R. Takao(中等射门量但效率高)、Kim Tae-Won和C. Jennings(极高射门量但转化率适中)、Y. Ono(0%转化率)。注意这里的椭圆几乎是圆形的而不是倾斜的,在整个人群中每90分钟射门次数和转化率几乎不相关(r = -0.04),这与13人禁区型子集不同。这是95%的卡方边界。

7、结束语

异常值和异常现象之间的区别可能看起来是语义上的,但它改变了我们解释球员表现的方式。异常值是在一个或多个指标上相对于群体极端。异常现象是在考虑上下文和这些指标之间的关系后,相对于预期模式的异常。

这种区别在球探中很重要。异常检测可以快速识别具有出色射门量或转化率的球员,但它不能解释为什么他们极端。异常检测增加了一层,通过突出那些特征组合不符合群体通常行为的球员。这两个标签都不自动意味着球员是好、坏甚至真正不同。它只是告诉我们哪里值得进一步调查。


原文链接:Football Language Matters Outliers vs Anomalies

汇智网翻译整理,转载请标明出处