Statistics and Truth: How to Use Chance
- 在终极的分析中,一切知识都是历史
- 在抽象的意义下,一切科学都是数学
- 在理性的基础上,所有的判断都是统计学
《统计与真理——怎样运用偶然性》讨论的问题是:
- 如何设计实验以便提供所要求的信息
- 如何从实验结果中获取一切有效信息
- 如何在实际中应用这些信息
人类的诸多努力都在寻求真理。然而,严格意义上的真理不可获得,我们只能寻求可接受的知识。严格地说,知识不是真理,但应尽可能运用真理。
这不是一本专业书籍。它回顾了统计学的历史及其发展中产生的诸多问题,并通过例子讲述统计思想,说明统计学如何成为一门科学,而非事实的堆砌。
不确定性、随机性与新知识的创立
正如物理学中基本粒子的运动、生物学中遗传因子和染色体的游离不定,以及社会中处于紧张状态下人们的行为一样,自然界中的不确定性是固有的。与其说这些现象遵循决定论法则,不如说它们体现了基于随机论法则的不确定性;这种不确定性已经成为自然科学、生物科学和社会科学理论发展的必要基础。
那么,人类在不确定性下如何做出决定?又如何从特定的观察数据中概括出新现象或提出新理论?这个过程涉及艺术、技术,还是科学?
直到20世纪初叶,人们才开始尝试将不确定性数量化,以回答这些问题。这一努力尚不能说已充分成功,但其成果已进入许多人类活动领域:它们带来了新的研究设想,促进了自然科学知识的发展,也改变了我们的思考方法。
随机数列展现了最大限度的不确定性(或称混沌或熵),也是研究不确定性最常用的方法。随机数列不遵循任何特殊模式,可以通过多种方法产生,包括从自然观察中获得的随机数列和人工生成的数列。
人们开发了许多利用随机性的方法,用于处理难以求得精确解答的棘手问题,并从中获得新信息、发展新思想。例如 Monte Carlo 方法、随机抽样调查以及实验设计方法。随机性还可用于解决博弈与决策理论中的一些问题。
关于随机有不少有趣的例子:
- 猴子打字机:如果我们有一只聪明的猴子,让它不断打字,在有限但相当长的时间内,它应该能打出莎士比亚的所有作品。其概率约为 。
- 赌徒误解:如果过去几天连续出生的女婴相当多,就会增加一对夫妇得到男婴的机会。但模拟或蒙特卡罗实验显示,一个稳定均匀的系统可以按一定频率呈现某些局部的不均匀性(即相关的现象在短时间内连续发生)。
- 生物周期:大多数动物种类的存活总数大致以3年为一周期。这种现象的普遍存在,使很多人相信或许已经发现自然界的一条新法则。不过,任给三个随机数的集合,中间一个数比其余两个数大的概率为三分之一。这就给出了上述问题中两个高峰年的平均时间间隔为3年。
随机性还可用于敏感问题的问卷调查。如果我们提出这样一个问题:“你吸大麻吗?”,恐怕得不到正确答案。对此,可以列出如下两个问题(其中一个问题无关紧要):
- S:你吸大麻吗?
- T:你的电话号码的末尾数是偶数吗?
随后要求被提问者投掷一枚硬币,出现正面时如实回答 S,出现反面时如实回答 T。这时,提问者并不知道被问者回答的是哪一个问题,因此该信息能够保密。根据这些答案可以作出如下估计,推算吸大麻的人所占的比例。
随机性也逐渐进入了以决定论为主导的自然科学研究。过去很长一段时间里,人们相信自然界的现象都明显带有预定的特点,其中最极端的表述可见于拉普拉斯(Laplace,1812)“数学神灵”的思想。“数学神灵”被赋予无限的数学演绎能力:如果在某一时刻知道刻画当时状态的所有量度,这个神灵就可预测未来世界将要发生的一切事件(也就是拉普拉斯妖)。
人们逐渐发现,这并不可能。由于存在测量误差,人类很难准确了解系统的初始状态。在这种情形下,初始状态的微小差别可能使对系统后续状态的预报产生极大差异。随机性进入自然科学领域后,随之出现了三个发展:
- 凯特勒(A. Quetelet,1869) 利用概率论的概念来描述社会学和生物学现象。
- 孟德尔(G. Mendel,1870) 通过简单的随机性结构(如投掷骰子),公式化了他的遗传法则。
- 玻尔兹曼(Boltzmann,1866) 对理论物理中的基本命题之一——热力学第二定律——给出了一个统计学的解释。
物理学中引入统计概念,始于处理天文学测量误差的需要。现在,随机性已经成为一个基本概念,也是表示定量法则的一种技术。
不确定性的驾驭——统计学的发展
统计学思想在远古即已存在,但作为一门学科,其历史很短。统计学的起源可以追溯到人类的原始时期,直到近代才逐渐成为实际应用中的一门重要学科。这一发展也引出一个问题:统计学究竟是什么?
有关统计学最早的记录大约可追溯到远古。甚至在算术出现以前,原始人已在树木上刻痕,以此计算家畜及其他财产。收集数据、记录信息的必要性,出现在人类放弃个体游牧生活、开始有组织的社会生活之时。古代人类必须集中所拥有的资源,以便正确分配和使用,并计划将来的需求。
术语 STATISTICS 的词根,在拉丁语中意为国家 STATUS。18 世纪中叶,德国学者艾奇纳沃(G. Achenwall)新创出的这个词,意为“由国家来收集、处理和使用数据”。国家利用统计学描述问题的现状,并指导事物未来的发展方向。
要使统计学成为有用的研究工具,国际合作必不可少。为了交流经验、制定共同标准,1853——1876年间,欧洲各国主持召开了多次(约10次)国际统计学会议。1885年,伦敦统计学会成立50周年的纪念会上提出了设立国际统计学会的建议。经过多次讨论,各方达成了设立一个永久性国际组织——国际统计学会的决议。于是,1885年6月24日,国际统计学会(International Statistical Institute,简称 ISI) 诞生了。
ISI 在过去一百年来不断扩大活动范围。在 ISI 管理之下,形成了数理统计、概率论、统计计算、抽样调查、行政统计和统计教育等分会。
如前所述,统计学词根的意义是对数据的收集和整理,并将其用于公共政策的制定。但统计学不只是数据本身,还包括研究和分析含有不确定性的数据的方法。
统计学研究含有不确定性的真理,也处理现实世界中这类情形。人们认识到,尽管由特殊到一般化规律建立起来的知识是不确定的,一旦能够度量其中的不确定性,所获得的知识即使种类不同,也是确定的。这种结构可写为如下逻辑方程:
这个基本方程描述了一种有效的风险管理方法,也使人们不再依赖神谕和算命先生。它把未来置于一个可以在当下作出明智决策的框架中:
- 如果我们不得不在不确定性的前提下做出抉择,错误就不可避免。
- 既然错误不可避免,那么按照一定规律做出抉择(形成新的具有不确定性的知识)时,最好能够知道犯错的频率(即对不确定性量度的知识)。
- 这样的知识能够用于找出制定决策的某种规律,减少盲目性,并使错误决策的频率或其产生的损失最小。
这正是统计学讨论的问题。现实世界中,我们只能通过归纳推理,基于不完全或劣质的信息作出决断;而归纳推理由给定数据作出的判断缺乏精确性。
由归纳推断导出结论的一个主要概念是不确定性的度量化,而对不确定性的量化问题一直存有争议。为此,人们还建立了各种统计研究所,研究度量不确定性的不同方法。最终形成了目前贝叶斯学派和频率学派两大统计学派。
至此,一门从数据中获取信息并作出推断的新学科产生了,“统计学”这一术语的范围也从数据自身扩展到对数据的解释。偶然性不再只是一件令人担心的事,或是一种无知的表现;它成为表达我们所拥有知识的一种合乎逻辑的方法。
统计学不只是一门科学,也是一个综合体:
- 科学:它与由某些基本原理引导、具有广泛应用意义的科学技术类似。这些技术不能套用固定模式;使用者必须根据所掌握的专门知识选择适用的技术,并在必要时加以修正。
- 工艺:它如同工业生产过程中的质量控制程序。统计学的方法论是在确保产品达到预期质量、并保持稳定性的管理系统中形成的。
- 艺术:依赖归纳推理的统计学方法论既不能完全编成条例,也并非没有争议。**不同的统计学者对同一组数据的分析处理可能得到不同的结论。**比起由统计学工具所获得的信息来说,通常实际给出的数据所含的信息量要多得多。
数据分析的原理和策略——数据的交叉检验
统计分析的形式随时代推移而变化,但“从数据中提取一切信息”或“归纳和揭示”作为统计分析的目的却一直没有改变。统计分析的方法多年来不断更迭,数据分析的发展大致如下。
通常,描述统计学和理论统计学被人们认为是统计学中方法不同的两个领域。前者的目的是在“统计描述”的意义下综合整理给定的数据集,利用各种技术来表现数据直观醒目的特征。在理论统计学中,综合整理或描述统计量要依赖于某个特定的随机模型。这些统计量的分布被用来确定在推断某些未知参数时的不确定性的范围。于是这样的方法被称为推断数据分析。
卡·皮尔森(K. Pearson)是第一位试图沟通两者的统计学家。他利用基于矩和直方图的描述分析所得到的结果来进行有关分布族的推断。也就是著名的卡方统计量和卡方检验。20~30 年代期间,费歇(Fisher) 产生了一系列异常丰富的统计思想。费歇发展了基于正态假定下对各种假设的精确的小样本检验,提出利用标准检验值表来帮助检验,通常这些统计表给出了 5% 和 1% 时的检验临界值。
20 世纪 20~30 年代,由费歇所开创的通过实验设计来收集数据的方法也有了系统的发展,这一系统发展使人们能够通过方差分析这样特定的方法来分析数据,并能对数据做出有实际意义的解释:实验设计指导如何分析数据,而数据分析显示实验设计的结构。
进入 20 世纪 40 年代后可以看到抽样调查方法的发展。这种方法是调查者依据随机选取的个体对一组问题的反应所获取的信息来收集大量的数据。保证数据的准确性和可比性是抽样调查的常见话题。
有了常见的统计推断方法,还需要一种综合处理方法:正确理解给定的数据及其缺陷和特征,再选择适合数据分析的随机概率模型或模型族。Tukey 提出了被称为 探索数据分析 EDA(Exploratory Data Analysis) 的方法,EDA 的哲学原理是了解数据的基本特征,然后运用稳健过程使数据适应可能的更广义的随机概率模型族。
整个数据分析的流程可以概括为数据收集、探索性数据分析、推断性数据分析三个部分,它们相互迭代地执行,其中数据收集包括了历史资料(及数据库)、抽样调查、实验设计三种获得方法。
数据分析的一个原则是,不使用任何没有被当前数据或过去经验证明的额外假设;此时专家意见可以作为参考。
为回答客户提出的问题而进行的数据分析,并不是统计学者仅有的工作。为了了解给定数据的性质,还需要进行更广泛的数据分析,发现所拥有的数据能回答哪些问题,并据此提出新问题、计划进一步的调查研究。统计学者常常被要求为某一数据集合的处理提供合适的统计方法(或软件程序),却没有机会对这些数据做交叉检验。如果数据具有某些特殊特征,必须在处理过程中加以考虑;还要不断监视整个过程,以决定是否需要修改原定的处理。
统计分析的目的是“从观测得到的数据中提取所有的信息”。所记录的数据中有时有某种缺陷,如存在记录误差和异常值,有时甚至可能是伪造的,一个统计学者首先应做的尝试是详细考察或交叉检验数据,以便发现可能有的缺陷并了解数据的特征。 下一步则是利用先验信息和交叉核实技术,对数据提出一个合适的随机概率模型。基于被选择的模型进行数据推断分析,包括未知参数的估计,假设检验,对未来观测值的预报以及做出决策。
加权分布——有偏数据
在此之外,设计一个抽样调查的时候并不总是存在一个合适的抽样结构来保证所发生的事件具有指定的(通常是相等的)机会成为样本。实际上,并不是所有自然界发生的事件都能能产生抽样结构。
例如,某些事件不可能被观察到,因而在记录中缺失。在这种情形下就产生了所谓的截尾样本、截断样本或不完全样本。或者,一个发生的事件仅以一定的概率能被观察到,其概率大小依赖于事件固有的性质,如它的显著性和用于观察的过程,其结果成为不等概率抽样。或者事件的发生随观察的时间或过程随机地变化,因而所记录到的实际上是修正了的事件。在统计分析中,这种变化或损伤必须进行适当的模型化。
某些事件尽管已经发生,但也许有不可观测的部分。因而所观察的分布在样本空间中的某个部分是截断的。例如,如果我们调查一只昆虫产卵个数的分布,则产卵个数为零的事件是不可观测的。此时在进行统计的概率模型分析的时候就需要考虑使用包含截断的分布。
更一般的情况是已经以一定的概率记录下某一事件的发生(或是已经包含在样本中)。也就是加权的概率分布,它也拥有一套自己的概率模型理论。
应用加权分布的一个例子,可参见人们利用不等概率抽样法或概率比例 P.P.S. 抽样法(probability proportional to size)进行的抽样调查。许多超大规模人口学调查会使用这些方法。
统计学与真理
今天,对统计学的理解、研究和实际应用已经扩展到整个自然科学、社会科学、工程技术、管理、经济、艺术和文学领域。
一般人利用统计知识(通过在报纸和消费者报告中获得的各种数据以及分析)在日常生活中做出决策,或制定将来的计划。就像读和写的能力一样,将来有一天统计的思维方法会成为有效率公民的必备能力。
- 对一个国家的政府来说,统计学是一种为达到特定的经济和社会目的用于制定长期和短期计划的工具。
- 科学研究中,就像我已提到的,通过有效设计的试验来收集数据、假设检验,未知参数的估计以及对结果的解释,对统计学都起着重要的作用。
- 工业生产中,一些简单的统计技术被用来改良和维持产品质量,以达到所期望的水平。研究开发部门进行各种实验以决定最佳配方。
- 不仅于此,商业中,统计被用来预测商品的未来需求量;医学中,试验设计的原理被用于药效的鉴定及临床检验。文学中,统计方法被用于测定一个作家的风格;法庭上,某个事件所发生的概率的统计验证,在裁决中被用来补充传统的口供和其他证据。
在制定计划时引入统计学思想,并采用能够有效分析数据、评价反馈和控制结果的统计方法,可以提高人类活动的价值。
如果有问题需要解决,应求助于统计学,而不只依赖某个专家委员会。与收集少数专家的智慧相比,统计学和统计分析能为解决问题提供更多线索。
统计学没有任何固有的对象,是一门独特的学问。统计学由解决其他领域内的问题而存在并兴旺发达。L.J. Savage 曾说:
**统计学基本上是寄生的:靠研究其他领域内的工作而生存。**这不是对统计学表示轻视,因为对许多寄主来说,如果没有寄生虫就会死。
- Title: Statistics and Truth: How to Use Chance
- Author: Hyacehila
- Created at : 2026-01-10 04:00:00
- Link: https://hyacehila.github.io//blog/2026/01/10/statistics-and-truth/
- License: This work is licensed under CC BY-NC-SA 4.0.