使用各种模型的总体思路也可以在贝叶斯统计和机器学习的交叉领域(贝叶斯非参数学)中找到(例如,Orbanz 和 Teh 2010,Hjort 等人 2010)。与其从一开始就指定一组有限的分布(统计分析应根据数据从中进行选择),不如让数据面对可能的分布的潜在无限维空间。然后,将所考虑的分布集与所获得的数据相关:模型的复杂性随着样本的增加而增加。结果是一个预测系统,它执行在线模型选择,同时对模型的后验进行贝叶斯调节。
5.2 没有模型的统计
还有一些统计方法通过专门关注数据并部署其结构,或者通过从特定的模型选择中进行概括来避免使用特定模型。其中一些技术正确地定位于描述性统计:它们不涉及数据的推断,而仅用于以特定方式描述数据;主成分分析就是一个主要例子。其他技术确实可以从数据中得出归纳结论,而无需明确采用模型,或者通过依赖与技术应用领域相关的其他假设,或者通过以不同的方式采用约束。不幸的是,不依赖于显式模型选择的统计方法在统计哲学中没有引起太多关注,而数据驱动的方法在科学研究中越来越受欢迎。我们将在这里简要讨论其中一些方法。
5.2.1 数据缩减技术
一组方法,对于许多统计学家来说非常重要,旨在减少数据。通常,样本数据非常丰富,例如,由多维空间中的一组点组成。统计分析的第一步可能是自动对数据进行聚类或标记,或者找出数据中的显着变异性,以减少分析本身的计算负担。
主成分分析(PCA)技术就是为后一个目的而设计的(Jolliffe 2002)。给定空间中的一组点,它会找出点变化较大的向量集。例如,考虑参数化为 (x,y) 的平面中的两个点:点 (0,0) 和 (1,1)。在 x 方向和 y 方向上的变化均为 1,但在对角线上变化最大,即
√
2
对角线上的向量称为数据的主成分。在更丰富的数据结构中,并使用点之间变化的更通用的度量,我们可以以类似的方式找到第一个分量。此外,我们可以在减去最后找到的组件的变化后,通过将数据投影到垂直于该组件的平面上来重复该过程。这使我们能够建立一组重要性递减的主要组成部分。
PCA 只是旨在保持数据可管理性并查找其中模式的大量技术中的一项,该技术还包括核方法和支持向量机(例如,Vapnik 和 Kotz 2006)。就目前的目的而言,重要的是要强调这些工具不应与统计分析相混淆:它们不涉及样本空间分布的测试或评估,即使它们建立和评估数据模型。这将它们与验证性和探索性因素分析(Bartholomew 2008)等方法区分开来,后者有时被认为是 PCA 的近亲,因为两组技术都允许我们识别样本空间内的显着维度,而数据在这些维度上显示出很大的变化。
统计学家经常使用数据缩减工具来得出数据抽样分布的结论。机器学习和数据挖掘技术已经在科学领域得到了广泛的应用,我们可能期望这些技术在未来会得到均匀的使用,因为现在有大量的数据可用于科学分析。此外,最近的统计研究表明,数据缩减,特别是核方法,是现代机器学习方法的核心,尤其是深度学习神经网络(参见 Belkin 2020,Bartlett 等人 2021)。然而,在统计哲学中,关于通过这些技术得出的结论的认知状态的争论相对较少。统计哲学家最好在这里引起一些注意。
5.2.2 形式和统计学习理论
形式学习和统计学习提出了与统计相邻且部分重叠的不同归纳方法。这又是一个介于统计学、计算机科学和人工智能之间的广阔研究领域。这里仅简要提及这些方法,作为我们如何实现某些统计目标的示例,即识别数据中的稳定模式,同时在某种意义上避免选择统计模型。我们暂且不谈如何在计算机或其他认知架构中实现形式学习和统计学习。相反,我们必须简要地关注学习算法的理论。
所罗门诺夫(Solomonoff,1964)在形式学习和统计学习方面做出了开创性的工作。该设置是归纳逻辑之一,数据由 0 和 1 的字符串组成,预测器试图识别这些数据中的模式。例如,数据可能是 0101010101… 形式的字符串,挑战在于将该字符串识别为交替序列。所罗门诺夫的中心思想是,为了实现通用归纳法,必须考虑所有可能的可计算模式。然后,所罗门诺夫继续定义一个正式系统,其中确实考虑了所有模式,有效地使用贝叶斯分析,并巧妙地构造了所有可计算假设的不可计算先验。 Sterkenburg(2018)对所罗门诺夫思想的通用预测方法进行了全面的讨论。
在理论计算机科学中,概率预测方法的分析发展成为统计学习理论(Vapnik 2000)。随着机器学习作为统计方法的补充甚至替代,哲学界对这一理论的关注近年来有所增加(例如,Herrmann 2020、Sterkenburg 和 Grünwald 2021)。形式学习理论是理论计算机科学和哲学中一个与统计哲学密切相关且密切相关的研究领域(例如,Kelly 1996、Kelly et al 1997)。该方法最初涵盖非统计模式和形式语言的可计算学习(例如,Putnam 1963、Gold 1967)。近年来,形式学习理论已扩展到任何类型的假设,包括统计和因果模型的学习(参见 Genin 和 Kelly 2017)。学习理论方法的最终独特之处在于其主要关注点在于寻找真理。其他考虑因素,例如概率一致性,要么源自最优学习表现(Kelly 2007),要么被视为次要约束,甚至可能阻碍计算受限智能体的表现(Osherson 等 1988)。
6. 相关主题选集
科学哲学中有许多主题与本引理所涵盖的主题直接相关。这里提到一些核心主题,以便读者查阅百科全书中的相关引理。
与统计哲学紧密相关的一个非常重要的主题是确证理论,即描述和论证科学理论与经验证据之间关系的哲学理论。可以说,统计理论是确证理论的恰当组成部分,因为它描述和论证了统计理论与以样本形式存在的证据之间的关系。将统计程序置于证据与理论之间关系的更广泛框架中,将会很有见地。进一步来看,统计哲学是方法论这一哲学主题的一部分,方法论是关于科学是否以及如何获得知识的一般理论。如此理解,统计学是众多科学方法中的一个组成部分,包括概念形成、实验设计、操作和观察、确认、修正和理论化。
。
虽然这些主题在认识论和科学哲学中一直很重要,但科学领域的发展引发了更广泛的科学家、科学政策制定者和公众的兴趣:所谓的复制危机,即在重复先前进行的研究时,我们无法恢复社会科学和医学领域的许多发现。一些人指出,这些科学中的统计分析存在问题,例如使用误差概率来衡量研究结果的可靠性,这可能是造成这一危机的原因(例如,Ioannidis 2005),这反过来又引发了人们对统计哲学的广泛兴趣。
科学哲学中也有相当多的具体主题是用统计学来阐述的,或者与统计学密切相关。其中一个主题是测量过程,特别是基于显变量统计事实对潜变量的测量。所谓的表征测量理论(Kranz 等人,1971)依赖于统计学,尤其是因子分析,来阐明数学结构如何表征经验现象。科学哲学的另一个重要主题是因果关系(参见概率因果关系和莱辛巴赫的共同因果原则)。自莱辛巴赫(1956)以来,哲学家们就一直运用概率论来捕捉因果关系,但最近在因果关系和统计学方面的研究(例如,Spirtes 等人,2001)极大地推动了概率因果关系理论的发展。统计学再次为因果关系的概念分析提供了基础。
。
还有很多。一些特定的统计技术,例如因子分析和贝叶斯网络理论,本身就引发了概念讨论。科学哲学中的许多主题都适合用统计学来阐释,例如证据的连贯性、信息量和意外性。反过来,科学哲学中也存在着广泛的讨论,有助于正确理解统计学。其中包括关于实验和干预、偶然性概念、科学模型的性质以及理论术语的争论。欢迎读者查阅这些主题的条目,以进一步了解它们与统计哲学的关系。