Sampling Survey: Sampling Design, Estimation Methods, and Data Quality

Hyacehila

抽样调查基础

关于抽样调查

抽样调查目的:从总体中抽取样本推断总体特征,也就是去获取统计学需要分析的数据,是统计分析的前一阶段工作.

在大数据时代,抽样调查的意义已经逐渐减少,转而从不稳定分布的中获取可信的结论更值得讨论,当然如果能够吸取其中的技术方法,从大数据中获取更好的抽样数据,也是有价值的工作

抽样调查将可以分析的统计数据分为两类,抽样数据和试验数据.前者是现实世界中存在的,但是需要观察来获得数据.后者则是在受控条件下,通过试验获取的数据. 前者需要利用 本文 技术获得,后者则使用 试验设计方法 获得.

和抽样调查相对的,我们还有全面调查方法,包括全面的普查 cencus 和全面的统计报表. 均是对全体展开调查.

相对与全面调查, 非全面调查包括重点调查,典型调查,抽样调查 ; 重点调查去研究那些虽然单位上较小,但是在研究现象中占比很大的单位. 典型调查依据调查者选择一些典型对象展开调查. 抽样调查 survey sampling 则是非全面调查中使用最为广泛的方法,从研究对象的全体中,按照一定规则/程序,抽取一部分样本进行调查

抽样调查可以减少花费,降低时间成本. 政府,企业等市场上的大量主体都需要通过抽样调查来获取数据,并向统计局,市场调查公司去购买相关服务.

概率与非概率抽样

非概率抽样,也称为非随机抽样,其核心是**“主观选择”**。抽样依赖于研究者的主观判断、方便性或被访者的自愿参与。总体中每个单位被抽中的概率是未知的,甚至可能为零。

主要方法包括

  • 随意抽样,选取最容易接触到的人作为样本
  • 目的/立意抽样,根据自己的专业知识和经验,判断并选择那些“最典型”或“最能提供信息”的单位.
  • 配额抽样,非概率抽样中试图“模仿”分层抽样的方法。研究者先确定样本在某些特征上的“配额”(如性别、年龄),使其比例与总体一致。
  • 志愿者抽样,根据主动选择实现
  • 滚雪球抽样,先找到少数几个符合条件的初始受访者,然后请他们推荐其他符合条件的受访者
  • 优点
    • 成本低、速度快:操作简便,适合预算和时间有限的项目。
    • 适用性广:可用于没有抽样框的总体,或进行探索性、定性研究。
    • 接触特殊群体:是研究“隐藏”人群的唯一可行方法。
  • 缺点
    • 无法推断总体:这是其根本性的、致命的弱点。
    • 高度主观性:结果容易受到研究者或参与者偏见的影响。
    • 代表性存疑:样本通常存在系统性偏差。

概率抽样,也称为随机抽样,其核心思想是“机会均等”。在抽样过程中,总体中的每一个单位都有一个已知的、非零的**被抽中的概率。

  1. 随机性原则:抽样的选择是客观的、随机的,排除了研究者的主观干扰。
  2. 可推断性:由于随机性,样本的结果可以在数学上被用来推断总体。这是概率抽样最宝贵的特性。
  3. 可计算抽样误差:我们可以用统计公式计算出样本结果与总体真实值之间可能存在的误差范围(置信区间)。
  4. 科学性强:其结果是客观、可重复验证的,是定量研究和科学调查的黄金标准。

主要包括下面的方法

  • 简单随机抽样 从总体中完全随机地抽取
  • 系统抽样 计算一个抽样间隔 随机选择一个起点 按照间隔抽取
  • 分层抽样 先将总体按某种特征分成若干个互不重叠的“层”,然后在每个层内独立进行随机抽样(通常是简单随机或系统抽样)
  • 整群抽样 将总体分成若干个“群”(如班级、社区、街道),然后随机抽取若干个“群”,并对被抽中群内的所有单位进行全面调查。
  • 多阶段抽样 混合前面的方法,将抽样分阶段进行.

基本概念

在任何抽样调查开始之前,研究者必须清晰地定义几个基本构成要素。这些概念是整个调查设计的基石,理解它们之间的区别与联系至关重要。它们分别是:总体、抽样单位、抽样框和样本。

总体是我们研究的终极目标对象集合。但在实际操作中,我们需要区分两个层面的总体: 目标总体 是我们理想中想要研究的、所有符合特定条件的单位的完整集合。它是我们希望将研究结论推广到的那个“终极群体”。研究总体实际上可以被我们抽取样本的总体。它通常是由一个具体的“抽样框”所代表的群体。

抽样单位是构成总体的、用于抽样的基本单元。它是我们从总体中“抽取”的那个东西。所有的抽样单位合在一起,必须完整地覆盖整个研究总体,且彼此之间不能有重叠(即总体中的每一个元素都只能属于一个抽样单位)。抽样单位的选择取决于研究目的,它不一定就是单个的人。

抽样框是包含了研究总体中所有抽样单位的名录、地图或任何形式的列表。它是我们进行实际抽样的“操作手册”或“地图”。完美的抽样框应该满足:完整,无冗余,无重复,准确.

样本是根据抽样方法,从抽样框中实际抽取出来的那一部分抽样单位的集合。它是我们用来进行数据分析和研究的具体对象。样本量:样本中包含的单位数量,通常用字母 n 表示。抽样比:样本量占研究总体总量的比例,计算公式为 f = n / N(其中N是研究总体的规模)

抽样调查中的总体和样本与数理统计定义完全不一样,对于数理统计,总体是无限的,具有确定的分布,但抽样调查中的总体无分布假设并且数量有限,抽样也不保证I.I.D

抽样误差与非抽样误差

在任何抽样调查中,我们通过样本来推断总体,这个推断结果与总体的真实情况之间总会存在差异。这个总差异被称为总调查误差,它由两大类构成:抽样误差非抽样误差

抽样误差是仅仅因为“我们只调查了一部分,而不是全体”而产生的误差。只有在概率抽样中,我们才能利用随机性原理来量化这种“运气 成分. 样本量越大,样本对总体的代表性就越稳定,抽样误差就越小

为了衡量一个估计的好坏,传统的统计学一般采用偏差,方差,以及均方误差MSE 来衡量一个估计.现代统计学习技术则不考虑后者.

非抽样误差是除了抽样本身之外,在调查的所有其他环节中产生的误差。这类误差更加隐蔽,且在普查和抽样调查中都可能存在。来源:调查设计、执行、数据处理等环节中的各种人为或系统性失误。无法被避免且很难被衡量.

实施步骤

第一步:明确定义调查目标与总体

核心问题:我们到底想研究什么?我们希望把结论推广到谁身上?

第二步:构建或评估抽样框

核心问题:我们手上有“地图”吗?这张“地图”有多准?

第三步:设计抽样方案

核心问题:我们该如何“抽签”?抽多少?

第四步:设计与测试调查问卷

核心问题:我们该如何提问才能得到真实、准确的信息?

第五步:实施调查并管理无回答

核心问题:如何确保调查顺利进行,并尽可能让每个人都参与?

第六步:数据整理、分析与报告

核心问题:如何从收集到的数据中得出有意义的结论?

简单随机抽样 Simple Random Sampling

SRS

简单随机抽样(Simple Random Sampling,SRS)是最基本的概率抽样方法。在该方法中:

  • 每个样本单位(无论是个体、家庭、公司等)有相同的机会被选择。即等概率的随机选择
  • 样本选择:从总体中随机抽取固定大小的样本,其中每一个可能的样本组合都有相同的选择概率
  • 无放回抽样:每个被抽中的单位不会被再次选择。 可以通过随机数的生成来实现SRS

SRS的均值,方差与标准误差

样本均值与样本方差是估算总体均值与总体方差的关键工具。 样本均值

yˉ=1ni=1nyi\bar{y} = \frac{1}{n} \sum_{i=1}^{n} y_i

样本方差

s2=1n1i=1n(yiyˉ)2s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (y_i - \bar{y})^2

简单随机抽样的一个重要特点是样本均值和样本方差无偏性,即它们的期望值分别等于总体均值和总体方差。这意味着通过抽样计算得出的均值和方差,平均而言,不会系统性地偏离总体的真实值。

标准误差是衡量样本均值离总体均值的平均偏差,样本均值的误差可以通过标准误差来量化,标准误差

S.E.(yˉ)=sn\text{S.E.}(\bar{y}) = \frac{s}{\sqrt{n}}

其中ss 是样本的标准差,nn 是样本大小,标准误差越小,意味着样本均值与总体均值越接近,因此,增大样本大小可以减少标准误差,从而提高估计的精度

置信区间(Confidence Interval, CI)

用来估计总体参数(如均值)的范围,它提供了一个区间,表示总体参数落入该区间的可能性. 基于 标准误差(S.E.) 和 样本均值,我们可以计算总体均值的置信区间

置信区间=yˉ±Z×S.E.置信区间 = \bar{y} \pm Z \times \text{S.E.}

其中:

  • yˉ\bar{y} 为样本均值。
  • ZZ 是标准正态分布的分位数,取决于所需的置信度
  • S.E.\text{S.E.} 为标准误差。

在简单随机抽样中,除了估算总体均值,我们还可以通过样本来估算总体的总量(例如,总收入、总生产量等)。对于总体总量的估算,使用以下公式

Y^=Nni=1nyi \hat{Y} = \frac{N}{n} \sum_{i=1}^{n} y_i

其中,NN 为总体大小,nn 为样本大小,yiy_i 为样本单位的观测值。

样本总量的标准误差:

S.E.(Y^)=Nn×S.E.(yˉ) \text{S.E.}(\hat{Y}) = \frac{N}{n} \times \text{S.E.}(\bar{y})

这个公式表明,总量的标准误差与样本均值的标准误差成正比。

比例估计

本章围绕抽样调查中的比例估计问题展开,重点讨论了单比例估计、多类别分析、独立样本合并和子总体分析等方法。与分层抽样不同,本章特别强调了在抽样前无法将总体区分成不同子总体的情况。这些方法在政治民调、生物统计、市场研究和生态学等领域有着广泛应用。

总体比例

在总体比例抽样中,我们关注具有某种特性的个体在总体中所占比例。若从大小为 N 的总体中抽取大小为 n 的简单随机样本,定义指示变量:

yi={1如果第 i 个单位具有目标特性0否则 y_i = \begin{cases} 1 & \text{如果第 } i \text{ 个单位具有目标特性} \\ 0 & \text{否则} \end{cases}

总体参数:

  • C=i=1NyiC = \sum_{i=1}^{N} y_i :具有该特性的单位总数
  • P=CNP = \frac{C}{N} :总体比例
  • Q=1PQ = 1 - P :不具有该特性的比例
  • S2=NN1PQS^2 = \frac{N}{N-1} PQ :总体方差

样本统计量:

  • c=i=1nyic = \sum_{i=1}^{n} y_i :样本中具有该特性的单位数
  • p=cn=yˉp = \frac{c}{n} = \bar{y} :样本比例,是 PP 的无偏估计量

抽样分布特性:

  • 样本中具有特性的单位数 cc 服从超几何分布
  • NN 很大时,超几何分布可近似为二项分布
  • pp 的方差为:Var(p)=(1nN)PQn\mathrm{Var}(p) = \left(1 - \frac{n}{N}\right) \frac{PQ}{n}

方差估计:

v^(p)=(1nN)pqn1 \hat{v}(p) = \left(1 - \frac{n}{N}\right) \frac{pq}{n-1}

标准误(standard error):

SE(p)=v^(p) \mathrm{SE}(p) = \sqrt{\hat{v}(p)}

总体比例估计的应用 : 标记重捕方法,步骤如下

  1. 首次捕获 MM 只动物,标记后放回原栖息地
  2. 经过一段时间后,再次捕获 nn 只动物
  3. 计算其中被标记的动物数量 cc 根据总体比例的估计有
p=cn 估计了总体中标记动物的比例 MN p = \frac{c}{n} \text{ 估计了总体中标记动物的比例 } \frac{M}{N}

通过等式 cn=MN\frac{c}{n} = \frac{M}{N},得到总体大小的矩估计:

N^=Mnc \hat{N} = \frac{Mn}{c}

在应用中我们会增加修正项

N^=(n+0.5)Mc+0.5 \hat{N} = \frac{(n + 0.5)M}{c + 0.5}

置信区间的计算与样本量的需求

对于总体比例 PP,当样本量足够大时,pp 的抽样分布近似服从正态分布。根据中心极限定理,可构建 1α1 - \alpha 置信区间:

Z=pPv^(p)dN(0,1) Z = \frac{p - P}{\sqrt{\hat{v}(p)}} \stackrel{d}{\approx} N(0,1)

对于 95% 置信水平:

P(1.96pPv^(p)1.96)0.95 P\left(-1.96 \leq \frac{p - P}{\sqrt{\hat{v}(p)}} \leq 1.96\right) \approx 0.95

解不等式得到置信区间:

[p1.96(1nN)pqn1,  p+1.96(1nN)pqn1] \left[ p - 1.96 \sqrt{ \left(1 - \frac{n}{N}\right) \frac{pq}{n-1} },\; p + 1.96 \sqrt{ \left(1 - \frac{n}{N}\right) \frac{pq}{n-1} } \right]

当总体很大(NN \to \infty)时,简化为:

[p1.96pqn,  p+1.96pqn] \left[ p - 1.96 \sqrt{ \frac{pq}{n} },\; p + 1.96 \sqrt{ \frac{pq}{n} } \right]

在设计调查时,需要确定适当的样本量以达到预设的估计精度。通常根据置信区间的宽度要求计算样本量。

对于 95% 置信水平,要求误差界限不超过 ee

1.96×PQne 1.96 \times \sqrt{\frac{PQ}{n}} \leq e

由于 PQ0.25PQ \leq 0.25(当 P=0.5P = 0.5 时取等号),最保守的估计为:

n(1.96)2×0.25e2 n \geq \frac{(1.96)^2 \times 0.25}{e^2}

例如,要求误差界限为 ±3%:

n(1.96)2×0.25(0.03)21067 n \geq \frac{(1.96)^2 \times 0.25}{(0.03)^2} \approx 1067

这就是为什么许多民调使用约 1100 人的样本,宣称精度为 ±3% 的原因。

当总体有限时,需要使用有限总体校正:

n=nI1+nIN n = \frac{n_I}{1 + \frac{n_I}{N}}

其中 nIn_I 是基于无限总体假设所需的样本量。

为什么我们在比例估计里才引入关于样本量的计算,因此他需要一个误差限ee 只有在比例估计中它才是比较固定的要求,其他只要置信区间的问题都可以类似的计算样本量需求,在抽样调查中,Z分布非常常见,因此给出估计均值和方差,很多就可以开始考虑置信区间和样本量的问题

多类别情况下的分析

多类别的基本分析

当总体包含 kk 个类别时(如选举中的多个候选人),每个类别在总体中占有一定比例,我们需要同时估计这些比例及其相互关系。设C1,C2,,CkC_1, C_2, \ldots, C_k 表示各类别的数量,满足 j=1kCj=N\sum_{j=1}^{k} C_j = N。样本中各类别的数量为 c1,c2,,ckc_1, c_2, \ldots, c_k,满足 j=1kcj=n\sum_{j=1}^{k} c_j = n

样本分布服从多变量超几何分布,其概率质量函数为:

p(x1,,xk)=(C1x1)(C2x2)(Ckxk)(Nn) p(x_1, \ldots, x_k) = \frac{ \binom{C_1}{x_1} \binom{C_2}{x_2} \cdots \binom{C_k}{x_k} }{ \binom{N}{n} }

jj 类的总体比例:Pj=CjNP_j = \frac{C_j}{N}

样本比例:pj=cjnp_j = \frac{c_j}{n} 样本比例就是对总体比例的估计

方差:

Var(pj)=(1nN)NN1Pj(1Pj)n \mathrm{Var}(p_j) = \left(1 - \frac{n}{N}\right) \frac{N}{N-1} \frac{P_j(1 - P_j)}{n}

NN 很大时,多变量超几何分布可近似为多项分布,方差简化为:

Var(pj)Pj(1Pj)n \mathrm{Var}(p_j) \approx \frac{P_j(1 - P_j)}{n}

方差估计:

v^(pj)=(1nN)pj(1pj)n1 \hat{v}(p_j) = \left(1 - \frac{n}{N}\right) \frac{p_j(1 - p_j)}{n-1}

对于想要估计数量而非比例的情况,可以直接使用公式

ci=Npi c_i = N p_i

他的方差为

Var(ci)=N2Var(pi)=N2(1nN)NN1Pi(1Pi)n. \mathrm{Var}(c_i) = N^2 \mathrm{Var}(p_i) = N^2 \left(1 - \frac{n}{N}\right) \frac{N}{N-1} \frac{P_i(1 - P_i)}{n}.

多类别的比例差

在多类别情况下,我们常需要估计两个类别比例之差,如两位候选人的支持率差。对于类别 iijj 比例之差:

估计量: pipj p_i - p_j

方差:

Var(pipj)=Nnn(N1)[Pi(1Pi)+Pj(1Pj)+2PiPj] \mathrm{Var}(p_i - p_j) = \frac{N - n}{n(N - 1)} \left[ P_i(1 - P_i) + P_j(1 - P_j) + 2P_i P_j \right]

方差估计:

v^(pipj)=NnN(n1)[pi(1pi)+pj(1pj)+2pipj] \hat{v}(p_i - p_j) = \frac{N - n}{N(n - 1)} \left[ p_i(1 - p_i) + p_j(1 - p_j) + 2p_i p_j \right]

多类别下的样本量

设我们希望估计第 jj 类的比例 PjP_j,要求在置信水平 1α1 - \alpha 下,估计误差不超过 ee。即:

P(pjPje)=1α P\left( |p_j - P_j| \leq e \right) = 1 - \alpha

NN 很大时,pjp_j 近似服从正态分布,我们可以使用以下不等式(我们都使用方差估计,并且假设NN很大在计算置信区间与样本量,此时可以使用正态分布假设,并且将分母的n1n-1换为nn):

zα/2Pj(1Pj)ne z_{\alpha/2} \cdot \sqrt{ \frac{P_j(1 - P_j)}{n} } \leq e

其中 zα/2z_{\alpha/2} 是标准正态分布上的上 α/2\alpha/2 分位数(如 95% 置信水平时 z0.025=1.96z_{0.025} = 1.96

解不等式得:

nzα/22Pj(1Pj)e2 n \geq \frac{ z_{\alpha/2}^2 \cdot P_j(1 - P_j) }{ e^2 }

当需要估计两个类别比例之差 PiPjP_i - P_j 时,要求误差不超过 ee,样本量计算公式为:

zα/2Var(pipj)e z_{\alpha/2} \cdot \sqrt{ \mathrm{Var}(p_i - p_j) } \leq e

NN 很大时(把分母n1n-1换为了nn):

Var(pipj)Pi(1Pi)+Pj(1Pj)+2PiPjn=Pi+Pj(PiPj)2n \mathrm{Var}(p_i - p_j) \approx \frac{ P_i(1 - P_i) + P_j(1 - P_j) + 2P_i P_j }{n} = \frac{ P_i + P_j - (P_i - P_j)^2 }{n}

因此:

nzα/22[Pi(1Pi)+Pj(1Pj)+2PiPj]e2 n \geq \frac{ z_{\alpha/2}^2 \cdot \left[ P_i(1 - P_i) + P_j(1 - P_j) + 2P_i P_j \right] }{ e^2 }

独立样本的组合

在实际研究中,经常需要合并来自多个独立调查的数据,以提高估计精度或增强结论的可靠性。假设 kk 个独立调查针对同一目标总体,研究相同的响应变量。

pip_i 为第 ii 个独立调查的样本比例,nin_i 为其样本量,合并估计量为:

P^=i=1knipii=1kni=i=1kcii=1kni \hat{P} = \frac{ \sum_{i=1}^{k} n_i p_i }{ \sum_{i=1}^{k} n_i } = \frac{ \sum_{i=1}^{k} c_i }{ \sum_{i=1}^{k} n_i }

这一估计量是合理的,因为每个调查的样本量 nin_i 不是随机的,而是由研究设计决定的。合并估计量本质上是加权平均,权重与样本量成正比。


当总体很大时,合并估计量的方差为:

Var(P^)=i=1kni2Var(pi)n2 \mathrm{Var}(\hat{P}) = \frac{ \sum_{i=1}^{k} n_i^2 \mathrm{Var}(p_i) }{ n^2 }

其中 n=i=1knin = \sum_{i=1}^{k} n_i

由于 Var(pi)PQni\mathrm{Var}(p_i) \approx \frac{PQ}{n_i},代入得:

Var(P^)i=1kni2PQnin2=PQi=1knin2=PQn \mathrm{Var}(\hat{P}) \approx \frac{ \sum_{i=1}^{k} n_i^2 \cdot \frac{PQ}{n_i} }{ n^2 } = \frac{ PQ \sum_{i=1}^{k} n_i }{ n^2 } = \frac{PQ}{n}

这表明合并样本的方差等同于一个大小为 nn 的单一样本的方差。


方差的估计为:

v^(P^)=p^q^n \hat{v}(\hat{P}) = \frac{ \hat{p} \hat{q} }{ n }

其中 p^=P^,q^=1p^\hat{p} = \hat{P} , \hat{q} = 1 - \hat{p}

子总体的估计

关于子总体问题

在抽样调查中,我们经常不仅关注总体参数,还关注总体中特定部分(子总体)的参数。例如:

  • 在人口调查中,我们可能关心不同年龄组的收入水平
  • 在农业调查中,可能需要了解不同种植方式的产量
  • 在健康调查中,可能需要分析不同性别或职业群体的疾病发生率

这类问题的关键特征是:总体由多个互不重叠的部分组成,我们对这些部分中的一个或多个感兴趣。这些感兴趣的部分被称为子总体或研究域。

子总体估计问题主要分为两种情况:

  1. 分层抽样情况:

    • 每个子总体在抽样前就已知并分开
    • 抽样可以在每个子总体内独立进行
    • 这属于分层抽样的范畴,将在后续章节讨论
  2. 事后分层情况:

    • 抽样前无法将子总体区分开
    • 先从总体抽取简单随机样本
    • 再根据样本单位的特征对样本进行分类
    • 本章重点讨论子总体大小 NjN_j 未知的情形 , 兼顾讨论已知的情况

核心区别:在分层抽样中,子总体是事先已知并分离的;而在本章讨论的情形中,子总体是在抽样后才确定的。

这种情形在实际调查中非常普遍:

  • 无法在抽样前对总体单元进行分类(如按收入水平)
  • 抽样框中缺乏子总体的标识信息
  • 事后想分析调查中未预料到的子群体
  • 调查设计时未考虑到某些子群体的分析需求

子总体的相关理论框架

设总体有 NN 个单位,包含 JJ 个互不重叠的子总体:

  • NjN_j :第 jj 个子总体的大小(未知)
  • nn :简单随机样本量
  • njn_j :样本中属于第 jj 个子总体的单位数(随机变量)
  • yijy_{ij} :第 jj 个子总体中第 ii 个单位的响应变量值
  • Yˉj=1Nji=1Njyij\bar{Y}_j = \frac{1}{N_j} \sum_{i=1}^{N_j} y_{ij} :第 jj 个子总体的均值
  • Yj=i=1NjyijY_j = \sum_{i=1}^{N_j} y_{ij} :第 jj 个子总体的总量

从总体中抽取大小为 nn 的简单随机样本后:

  • 样本中属于第 jj 个子总体的单位数 njn_j 是随机的
  • 重要性质:可以证明,这 njn_j 个单位构成从大小为 NjN_j 的总体中抽取的简单随机子样本

子总体均值与方差的估计

jj 个子总体的均值估计为:

yˉj=1nji=1njyij \bar{y}_j = \frac{1}{n_j} \sum_{i=1}^{n_j} y_{ij}

这是子总体均值 Yˉj\bar{Y}_j 的无偏估计量。即:

E(yˉj)=Yˉj E(\bar{y}_j) = \bar{Y}_j

子总体均值估计量的方差为:

Var(yˉj)=(1njNj)Sj2nj \mathrm{Var}(\bar{y}_j) = \left(1 - \frac{n_j}{N_j}\right) \frac{S_j^2}{n_j}

其中 Sj2=1Nj1i=1Nj(yijYˉj)2S_j^2 = \frac{1}{N_j - 1} \sum_{i=1}^{N_j} (y_{ij} - \bar{Y}_j)^2 是第 jj 个子总体的方差。

由于 NjN_j 未知,我们无法直接使用 nj/Njn_j / N_j 作为抽样比例。但可以证明:

E(njNj)=nN E\left( \frac{n_j}{N_j} \right) = \frac{n}{N}

这表明,尽管 nj/Njn_j / N_j 本身是随机的,但其期望值等于总体抽样比例 n/Nn / N


因此,方差的无偏估计为:

v^(yˉj)=(1nN)sj2nj \hat{v}(\bar{y}_j) = \left(1 - \frac{n}{N}\right) \frac{s_j^2}{n_j}

其中 sj2=1nj1i=1nj(yijyˉj)2s_j^2 = \frac{1}{n_j - 1} \sum_{i=1}^{n_j} (y_{ij} - \bar{y}_j)^2 是第 jj 个子总体样本的方差。

注意:这里使用总体抽样比例 n/Nn/N 而不是子总体抽样比例 nj/Njn_j / N_j,因为 NjN_j 未知,如果他已知则应该进行对应的替换

想要构建置信区间的话,仍旧使用正态分布相关的方法即可,我们现在已经给出了均值和方差的估计,直接带入就可以实现

关于总量的估计

在子总体大小 NjN_j 未知的情况下,不能简单地使用 Nj×yˉjN_j \times \bar{y}_j 作为总量估计,因为 NjN_j 未知。

为解决此问题,引入辅助变量 UiU_i

Ui={yij如果第 i 个单位属于第 j 个子总体0否则 U_i = \begin{cases} y_{ij} & \text{如果第 } i \text{ 个单位属于第 } j \text{ 个子总体} \\ 0 & \text{否则} \end{cases}

则有:

Uˉ=1Ni=1NUi=1Ni=1Njyij=PjYˉj \bar{U} = \frac{1}{N} \sum_{i=1}^{N} U_i = \frac{1}{N} \sum_{i=1}^{N_j} y_{ij} = P_j \bar{Y}_j

其中 Pj=Nj/NP_j = N_j / N 是第 jj 个子总体在总体中的比例。

基于辅助变量,子总体总量的估计为:

Y^j=Nuˉ=Nni=1njyij \hat{Y}_j = N \bar{u} = \frac{N}{n} \sum_{i=1}^{n_j} y_{ij}

这是一个无偏估计量,即:

E(Y^j)=Yj E(\hat{Y}_j) = Y_j

辅助变量 UU 的总体方差为:

Su2=1N1[i=1NUi2NUˉ2]=Nj1N1Sj2+NN1PjQjYˉj2 S_u^2 = \frac{1}{N-1} \left[ \sum_{i=1}^{N} U_i^2 - N \bar{U}^2 \right] = \frac{N_j - 1}{N - 1} S_j^2 + \frac{N}{N - 1} P_j Q_j \bar{Y}_j^2

其中 Qj=1PjQ_j = 1 - P_j

因此,总量估计量的方差为:

Var(Y^j)=N2Var(uˉ)=N2(1f)nSu2=N2(1f)n[Nj1N1Sj2+NN1PjQjYˉj2] \mathrm{Var}(\hat{Y}_j) = N^2 \mathrm{Var}(\bar{u}) = \frac{N^2(1 - f)}{n} S_u^2 \\ = \frac{N^2(1 - f)}{n} \left[ \frac{N_j - 1}{N - 1} S_j^2 + \frac{N}{N - 1} P_j Q_j \bar{Y}_j^2 \right]

其中 f=n/Nf = n/N 为抽样比。

样本方差 su2s_u^2 可以表示为:

su2=1n1i=1n(uiuˉ)2=1n1[(nj1)sj2+npjqjyˉj2] s_u^2 = \frac{1}{n-1} \sum_{i=1}^{n} (u_i - \bar{u})^2 = \frac{1}{n-1} \left[ (n_j - 1) s_j^2 + n p_j q_j \bar{y}_j^2 \right]

其中 pj=nj/n,qj=1pjp_j = n_j / n , q_j = 1 - p_j

因此,总量估计量的方差估计为:

v^(Y^j)=N2(1f)n(n1)[i=1nj(yijyˉj)2+npjqjyˉj2] \hat{v}(\hat{Y}_j) = \frac{N^2(1 - f)}{n(n-1)} \left[ \sum_{i=1}^{n_j} (y_{ij} - \bar{y}_j)^2 + n p_j q_j \bar{y}_j^2 \right]

将各个子总体的总量求和,就是整个总体的总量,方差求和就是整个总体估计的方差,关于总量的问题无需过多讨论就可以扩展到多子总体,并且其简化前的形式就可以用于已知子总体大小的情况,非常简单的就可以给出计算,我们无需给出额外的公式

子总体均值差

yy 仍为响应变量,Yˉi\bar{Y}_iYˉj\bar{Y}_j 分别为子总体 iijj 的均值。

  • 估计量yˉiyˉj\bar{y}_i - \bar{y}_j
  • 方差Var(yˉiyˉj)=(1niNi)si2ni+(1njNj)sj2nj\text{Var}(\bar{y}_i - \bar{y}_j) = \left(1 - \frac{n_i}{N_i}\right)\frac{s_i^2}{n_i} + \left(1 - \frac{n_j}{N_j}\right)\frac{s_j^2}{n_j}
  • 方差估计v(yˉiyˉj)=(1niNi)si2ni+(1njNj)sj2njv(\bar{y}_i - \bar{y}_j) = \left(1 - \frac{n_i}{N_i}\right)\frac{s_i^2}{n_i} + \left(1 - \frac{n_j}{N_j}\right)\frac{s_j^2}{n_j}

如果需要置信区间可以继续使用正态,研究样本量的情况同理

样本量的计算

估计子总体均值的样本量计算,要估计第 ii 个子总体的均值 Yˉi\bar{Y}_i,在给定允许误差 did_i 和置信水平 1α1 - \alpha 的情况下,所需样本量 nin_i 的计算公式为:

ni=Nizα/22Si2(Ni1)di2+zα/22Si2 n_i = \frac{N_i \cdot z_{\alpha/2}^2 \cdot S_i^2}{(N_i - 1)d_i^2 + z_{\alpha/2}^2 \cdot S_i^2}

其中:

  • NiN_i 是第 ii 个子总体的大小(通常未知)
  • Si2S_i^2 是第 ii 个子总体的方差(通常未知,需要预先估计)
  • zα/2z_{\alpha/2} 是标准正态分布的上 α/2\alpha/2 分位数
  • did_i 是允许的最大误差

如果想要研究比例的问题(二分类样本),只需要替换方差即可

ni=Nizα/22pi(1pi)(Ni1)di2+zα/22pi(1pi) n_i = \frac{N_i \cdot z_{\alpha/2}^2 \cdot p_i (1 - p_i)}{(N_i - 1) d_i^2 + z_{\alpha/2}^2 \cdot p_i (1 - p_i)}

对于多子总体都有误差要求的情况,可以考虑优先确定最关注的子总体,采用最小最大误差方法,如下选择总体样本量 nn,使得所有子总体估计中最大相对误差最小化:

minnmaxi(zα/2Sini1niNi) \min_{n} \max_{i} \left( \frac{z_{\alpha/2} \cdot S_i}{\sqrt{n_i}} \sqrt{1 - \frac{n_i}{N_i}} \right)

其中 nin_i 是第 ii 个子总体的样本量,与总体样本量 nn 的关系为 ni=nWin_i = n \cdot W_iWi=Ni/NW_i = N_i / N 是第 ii 个子总体的比例。

或者使用如下的实用方法

  1. 估计各子总体比例 WiW_i
  2. 为每个子总体确定所需样本量 nin_i
  3. 计算总样本量:n=i=1kniWin = \sum_{i=1}^{k} \frac{n_i}{W_i}

示例:假设总体由两个子总体组成,W1=0.7W_1 = 0.7W2=0.3W_2 = 0.3。要达到相同精度,分别需要 n1=100n_1 = 100n2=150n_2 = 150。则总样本量为:

n=1000.7+1500.3143+500=643 n = \frac{100}{0.7} + \frac{150}{0.3} \approx 143 + 500 = 643

分层抽样方法及其应用

分层抽样相关基本概念

在实际问题中,总体通常可以按照某些特征(如不同地区、不同类别、不同时间段等)被划分为若干个互不重叠的子总体,这些子总体称为”层”(strata)。当总体中存在明显的异质性时,简单的随机抽样可能导致样本缺乏代表性,从而降低估计精度。为解决这个问题,统计学家提出了分层抽样(Stratified Sampling)方法。

分层抽样的基本思想是:先将总体划分为G个互不重叠且能覆盖整个总体的层(strata),然后在每一层内独立进行抽样(通常是简单随机抽样),最后将各层的样本结果按照层权重进行合并,得到对总体参数的估计。

分层抽样当层内同质性高、层间异质性大时,显著降低估计量的方差。并且可以直接提供层的研究数据.并且在现有的形成体系下,可以更好的进行进行调查的实施工作.

给出一些分层抽样中约定的符号表示

  • NN : 总体大小
  • GG : 层数
  • NgN_g : 第gg层的大小, g=1,2,,Gg = 1, 2, \dots, G
  • N=g=1GNgN = \sum_{g=1}^{G} N_g
  • ygiy_{gi} : 第gg层中第ii个单位的响应值
  • Wg=Ng/NW_g = N_g / N : 第gg层的权重
  • Yˉg=1Ngi=1Ngygi\bar{Y}_g = \frac{1}{N_g} \sum_{i=1}^{N_g} y_{gi} : 第gg层的总体均值
  • Yg=NgYˉgY_g = N_g \bar{Y}_g : 第gg层的总体总量
  • Sg2=1Ng1i=1Ng(ygiYˉg)2S_g^2 = \frac{1}{N_g - 1} \sum_{i=1}^{N_g} (y_{gi} - \bar{Y}_g)^2 : 第gg层的总体方差
  • Yˉ=1Ng=1Gi=1Ngygi=g=1GWgYˉg\bar{Y} = \frac{1}{N} \sum_{g=1}^{G} \sum_{i=1}^{N_g} y_{gi} = \sum_{g=1}^{G} W_g \bar{Y}_g : 总体均值
  • S2=1N1g=1Gi=1Ng(ygiYˉ)2S^2 = \frac{1}{N - 1} \sum_{g=1}^{G} \sum_{i=1}^{N_g} (y_{gi} - \bar{Y})^2 : 总体方差

总体方差可以分解为:

S2=1N1[g=1G(Ng1)Sg2+g=1GNg(YˉgYˉ)2] S^2 = \frac{1}{N - 1} \left[ \sum_{g=1}^{G} (N_g - 1) S_g^2 + \sum_{g=1}^{G} N_g (\bar{Y}_g - \bar{Y})^2 \right]

上式中, 第一项是层内平方和 (SSerror), 第二项是层间平方和 (SStrt)。这反映了方差分析的原理:

Var(Y)=E[Var(YX)]+Var[E(YX)] \text{Var}(Y) = E[\text{Var}(Y|X)] + \text{Var}[E(Y|X)]

其中XX是分层变量。

我们进行分层简单随机抽样 (stratified SRSOR) 在每层中独立进行简单随机抽样 (不放回) 因此给出下面的抽样相关的数学符号.

  • ngn_g : 第gg层的样本量
  • yˉg=1ngisgygi\bar{y}_g = \frac{1}{n_g} \sum_{i \in s_g} y_{gi} : 第gg层的样本均值
  • sg2=1ng1isg(ygiyˉg)2s_g^2 = \frac{1}{n_g - 1} \sum_{i \in s_g} (y_{gi} - \bar{y}_g)^2 : 第gg层的样本方差
  • Var(yˉg)=(1ngNg)Sg2ng\text{Var}(\bar{y}_g) = \left(1 - \frac{n_g}{N_g}\right) \frac{S_g^2}{n_g} : 第gg层样本均值的方差
  • v(yˉg)=(1ngNg)sg2ngv(\bar{y}_g) = \left(1 - \frac{n_g}{N_g}\right) \frac{s_g^2}{n_g} : 上述方差的无偏估计

这这里我们只是将每一层作为SRSOR进行考虑,延续前面的相关内容直接给出结论是很容易的

分层抽样的参数估计与置信区间

分层抽样的参数估计

分层样本均值 (也是 Horvitz-Thompson 估计):

yˉst=g=1GWgyˉg \bar{y}_{st} = \sum_{g=1}^{G} W_g \bar{y}_g

该估计是无偏的, 即 E(yˉst)=YˉE(\bar{y}_{st}) = \bar{Y}

方差:

Var(yˉst)=g=1GWg2Var(yˉg)=g=1GWg2(1ngNg)Sg2ng \text{Var}(\bar{y}_{st}) = \sum_{g=1}^{G} W_g^2 \text{Var}(\bar{y}_g) = \sum_{g=1}^{G} W_g^2 \left(1 - \frac{n_g}{N_g}\right) \frac{S_g^2}{n_g}

方差的无偏估计:

v(yˉst)=g=1GWg2(1ngNg)sg2ng v(\bar{y}_{st}) = \sum_{g=1}^{G} W_g^2 \left(1 - \frac{n_g}{N_g}\right) \frac{s_g^2}{n_g}

总体总量的估计:

Y^st=Nyˉst=g=1GNgyˉg \hat{Y}_{st} = N \bar{y}_{st} = \sum_{g=1}^{G} N_g \bar{y}_g

方差:

Var(Y^st)=N2Var(yˉst)=g=1GNg2(1ngNg)Sg2ng \text{Var}(\hat{Y}_{st}) = N^2 \text{Var}(\bar{y}_{st}) = \sum_{g=1}^{G} N_g^2 \left(1 - \frac{n_g}{N_g}\right) \frac{S_g^2}{n_g}

方差的无偏估计:

v(Y^st)=N2v(yˉst)=g=1GNg2(1ngNg)sg2ng v(\hat{Y}_{st}) = N^2 v(\bar{y}_{st}) = \sum_{g=1}^{G} N_g^2 \left(1 - \frac{n_g}{N_g}\right) \frac{s_g^2}{n_g}

分层抽样的比例问题

在调查中, 当变量只取0和1两个值时 (如是否拥有某产品), 我们通常关注比例参数。 将一般响应 ygiy_{gi} 替换为二元变量, 得到:

  • YˉgPg\bar{Y}_g \to P_g , Sg2NgNg1PgQgS_g^2 \to \frac{N_g}{N_g - 1} P_g Q_g , 其中 Qg=1PgQ_g = 1 - P_g
  • yˉgpg\bar{y}_g \to p_g , sg2ngng1pgqgs_g^2 \to \frac{n_g}{n_g - 1} p_g q_g , 其中 qg=1pgq_g = 1 - p_g
  • Var(pg)=(1ngNg)NgNg1PgQgng\text{Var}(p_g) = \left(1 - \frac{n_g}{N_g}\right) \frac{N_g}{N_g - 1} \frac{P_g Q_g}{n_g}
  • v(pg)=(1ngNg)pgqgng1v(p_g) = \left(1 - \frac{n_g}{N_g}\right) \frac{p_g q_g}{n_g - 1}

总体比例:

P=g=1GWgPg P = \sum_{g=1}^{G} W_g P_g

样本估计:

pst=P^st=g=1GWgpg p_{st} = \hat{P}_{st} = \sum_{g=1}^{G} W_g p_g

方差:

Var(pst)=g=1GWg2Var(pg) \text{Var}(p_{st}) = \sum_{g=1}^{G} W_g^2 \text{Var}(p_g)

方差的无偏估计:

v(pst)=g=1GWg2v(pg) v(p_{st}) = \sum_{g=1}^{G} W_g^2 v(p_g)

分层抽样的置信区间

所有的置信区间问题最后都依靠正态分布进行解决,由于我们前面计算了估计的均值与方差,因此置信区间的估计是非常的容易的

对总体均值 Yˉ\bar{Y}100(1α)%100(1 - \alpha)\% 置信区间:

yˉst±zα/2v(yˉst) \bar{y}_{st} \pm z_{\alpha/2} \sqrt{v(\bar{y}_{st})}

对总体总量 YY100(1α)%100(1 - \alpha)\% 置信区间:

Y^st±zα/2v(Y^st) \hat{Y}_{st} \pm z_{\alpha/2} \sqrt{v(\hat{Y}_{st})}

样本量的分配

给定总样本量 n=g=1Gngn = \sum_{g=1}^{G} n_g,如何在各层间分配样本量是一个关键问题。常见的分配方法有:

比例分配 (Proportional Allocation)

比例分配: ngNgn_g \propto N_g,即

ng=Wgn=NgNn n_g = W_g n = \frac{N_g}{N} n

在比例分配下,权重都是相等的,分层样本均值的方差为:

Var(yˉst)=(1nN)1ng=1GWgSg2 \text{Var}(\bar{y}_{st}) = \left(1 - \frac{n}{N}\right) \frac{1}{n} \sum_{g=1}^{G} W_g S_g^2

与简单随机抽样相比,分层抽样的方差为 Var(yˉ)=(1nN)S2n\text{Var}(\bar{y}) = \left(1 - \frac{n}{N}\right) \frac{S^2}{n},因此当

g=1GWgSg2<S2 \sum_{g=1}^{G} W_g S_g^2 < S^2

时,分层抽样比简单随机抽样更精确,而利用方差分解的角度,这个不等式很容易得到证明,只有在层间均值差异很小的时候,他们才趋近于相等.

最优分配 (Optimal Allocation) / Neyman Allocation

当考虑抽样成本时,最优分配的目标是:在总成本 C=c0+g=1GcgngC = c_0 + \sum_{g=1}^{G} c_g n_g (其中 c0c_0 是固定成本,cgc_g 是第 gg 层单位抽样成本)约束下,最小化 Var(yˉst)\text{Var}(\bar{y}_{st})

Neyman的解决方案是:

ngNgSgcg n_g \propto \frac{N_g S_g}{\sqrt{c_g}}

具体地:

ng=nNgSg/cgj=1GNjSj/cj n_g = n \cdot \frac{N_g S_g / \sqrt{c_g}}{\sum_{j=1}^{G} N_j S_j / \sqrt{c_j}}

当所有 cgc_g 相等时,简化为:

ng=nWgSgj=1GWjSj n_g = n \cdot \frac{W_g S_g}{\sum_{j=1}^{G} W_j S_j}

此时,分层样本均值的方差为:

VNeyman=1n(g=1GWgSg)21Ng=1GWgSg2 V_{\text{Neyman}} = \frac{1}{n} \left( \sum_{g=1}^{G} W_g S_g \right)^2 - \frac{1}{N} \sum_{g=1}^{G} W_g S_g^2

与比例分配相比:

VproportionVNeyman=1ng=1GWg(Sgj=1GWjSj)20 V_{\text{proportion}} - V_{\text{Neyman}} = \frac{1}{n} \sum_{g=1}^{G} W_g \left( S_g - \sum_{j=1}^{G} W_j S_j \right)^2 \geq 0

这表明 Neyman 分配总是优于或等于比例分配。当 SgS_g 之间差异越大时,这种优势越明显,因为上式是关于 SgS_g 在权重 WgW_g 下的方差。

样本量确定

假设 NgN_gSg2S_g^2 已知,采用比例分配,要求 Var(yˉst)V\text{Var}(\bar{y}_{st}) \leq V,其中 VV 是给定的值。解不等式:

Var(yˉst)=(n1N1)g=1GWgSg2V \text{Var}(\bar{y}_{st}) = (n^{-1} - N^{-1}) \sum_{g=1}^{G} W_g S_g^2 \leq V

得:

nl=g=1GWgSg2V n_l = \frac{\sum_{g=1}^{G} W_g S_g^2}{V}

(假设 N=N = \infty 时的样本量)

对有限总体,所需样本量为:

n=nl1+nl/N n = \frac{n_l}{1 + n_l / N}

采用 Neyman 分配,要求 Var(yˉst)V\text{Var}(\bar{y}_{st}) \leq V。方差公式:

Var(yˉst)=n1(g=1GWgSg)2N1g=1GWgSg2V \text{Var}(\bar{y}_{st}) = n^{-1} \left( \sum_{g=1}^{G} W_g S_g \right)^2 - N^{-1} \sum_{g=1}^{G} W_g S_g^2 \leq V

N=N = \infty 时:

nl=(g=1GWgSg)2V n_l = \frac{\left( \sum_{g=1}^{G} W_g S_g \right)^2}{V}

对有限总体:

n=(g=1GWgSg)2V+N1g=1GWgSg2 n = \frac{\left( \sum_{g=1}^{G} W_g S_g \right)^2}{V + N^{-1} \sum_{g=1}^{G} W_g S_g^2}

比率估计与回归估计

在调查抽样中,我们通常关注总体均值或比例等参数。然而在实际应用中,还有许多其他重要的有限总体参数,如中位数收入、生活在贫困线以下人口的百分比等。本章将重点探讨两种总体均值之比的估计方法:

  • 比率估计(Ratio Estimation):利用辅助变量与目标变量之间的比例关系
  • 回归估计(Regression Estimation):利用辅助变量与目标变量之间的线性关系

这些方法在以下情况下特别有用,我们在后面会给出例子:

  • 需要估计两个总体均值的比率
  • 需要估计总体总和,但总体大小未知
  • 需要利用辅助信息提高估计精度
  • 需要调整估计量以反映人口统计特征
  • 处理无响应偏差

研究比率参数

比例的估计

考虑一个有限总体,其中每个抽样单位有两个响应变量 xxyy

  • XXYY:分别表示总体中 xxyy 的均值
  • 比率参数:R=YXR = \frac{Y}{X}

在简单随机抽样无放回(SRSOR)中,样本大小为 nn。对 RR 的估计是:

R^=yˉxˉ \hat{R} = \frac{\bar{y}}{\bar{x}}

比率估计量的方差

比率估计量 R^\hat{R} 的方差近似为:

V(R^)=(1nN)Sd2nXˉ2 V(\hat{R}) = \left(1 - \frac{n}{N}\right) \frac{S_d^2}{n\bar{X}^2}

其中 Sd2=Sy2+R2Sx22RSxyS_d^2 = S_y^2 + R^2 S_x^2 - 2R S_{xy},可以通过定义 d=yRxd = y - Rxdˉ=yˉRxˉ\bar{d} = \bar{y} - R\bar{x} 推导。

注意到:

R^R=yˉxˉR=dˉxˉdˉX \hat{R} - R = \frac{\bar{y}}{\bar{x}} - R = \frac{\bar{d}}{\bar{x}} \approx \frac{\bar{d}}{X}

因此:

V(R^)(1nN)Sd2nX2 V(\hat{R}) \approx \left(1 - \frac{n}{N}\right) \frac{S_d^2}{nX^2}

考虑到相关系数 ρ=SxySxSy\rho = \frac{S_{xy}}{S_x S_y},方差也可写为:

V(R^)(1nN)Sy2+R2Sx22RρSxSynX2 V(\hat{R}) \approx \left(1 - \frac{n}{N}\right) \frac{S_y^2 + R^2 S_x^2 - 2R\rho S_x S_y}{nX^2}

比率的偏差

比率估计量 R^=yˉxˉ\hat{R} = \frac{\bar{y}}{\bar{x}} 的偏差为:

B(R^)=E(R^)R=E(yˉRxˉxˉ)=E[yˉRxˉX(1+ϵ)] B(\hat{R}) = E(\hat{R}) - R = E\left( \frac{\bar{y} - R\bar{x}}{\bar{x}} \right) = E\left[ \frac{\bar{y} - R\bar{x}}{X(1+\epsilon)} \right]

其中 ϵ=xˉXX\epsilon = \frac{\bar{x} - X}{X}。使用泰勒展开法,偏差变为:

B(R^)=Cov(xˉ,yˉ)R×V(xˉ)X2=(1f)R(CxxCxy)n B(\hat{R}) = \frac{\text{Cov}(\bar{x}, \bar{y}) - R \times V(\bar{x})}{X^2} = (1 - f) R \frac{(C_{xx} - C_{xy})}{n}

其中 Cxx=Sx2X2C_{xx} = \frac{S_x^2}{X^2}Cxy=SxyXYC_{xy} = \frac{S_{xy}}{XY}f=nNf = \frac{n}{N}。当样本 nn 较大时,这个偏差可忽略不计。

比率的均方误差(MSE)

nn 较大时,偏差可忽略,MSE 近似等于方差:

MSE(R^)=E(R^R)2=E(yˉRxˉxˉ)2V(R^)=E(yˉRxˉX)2 \text{MSE}(\hat{R}) = E(\hat{R} - R)^2 = E\left( \frac{\bar{y} - R\bar{x}}{\bar{x}} \right)^2 \approx V(\hat{R}) = E\left( \frac{\bar{y} - R\bar{x}}{X} \right)^2

定义 di=yiRxid_i = y_i - Rx_iDˉ=0\bar{D} = 0,总体方差为:

Sd2=i=1N(yiRxi)2N1=i=1N[(yiY)R(xiX)]2N1=Sy2+R2Sx22RSxy=Sy2+R2Sx22RρSxSy S_d^2 = \sum_{i=1}^{N} \frac{(y_i - Rx_i)^2}{N-1} = \sum_{i=1}^{N} \frac{[(y_i - Y) - R(x_i - X)]^2}{N-1} = S_y^2 + R^2 S_x^2 - 2R S_{xy} = S_y^2 + R^2 S_x^2 - 2R\rho S_x S_y

方差的自然估计为:

v(R^)=(1f)sd2nxˉ2 v(\hat{R}) = (1 - f) \frac{s_d^2}{n\bar{x}^2}

其中 di=yiR^xid_i = y_i - \hat{R}x_isd2s_d^2 是这些 did_i 的样本方差。综上所述,我们可以给出RR 的置信区间为:

R^±1.96v(R^) \hat{R} \pm 1.96 \sqrt{v(\hat{R})}

比率估计在估计均值和总和中的应用

在某些情况下,xxyy 之间存在明显的正相关关系,例如土地面积与产量。此外,有时总体中 xx 的均值或总和是已知的。当 XX 已知时,我们可以通过以下调整估计 YY

Y^R=(Xxˉ)yˉ \hat{Y}_R = \left( \frac{X}{\bar{x}} \right) \bar{y}

xxyy 近似成比例时,这个估计量可能更有效,我们称之为比率估计量。Y^R\hat{Y}_R 不是无偏的,其方差近似为:

Var(Y^R)=X2Var(yˉ/xˉ)=X2×(1f)Sy2+R2Sx22RρSxSynX2=(1f)Sy2+R2Sx22RρSxSyn \text{Var}(\hat{Y}_R) = X^2 \text{Var}(\bar{y}/\bar{x}) = X^2 \times (1 - f) \frac{S_y^2 + R^2 S_x^2 - 2R\rho S_x S_y}{nX^2} = (1 - f) \frac{S_y^2 + R^2 S_x^2 - 2R\rho S_x S_y}{n}

与样本均值相比,比率估计量只有在以下条件下具有更小的方差:

R2Sx22RρSxSy<0 R^2 S_x^2 - 2R\rho S_x S_y < 0 RSx<2ρSy RS_x < 2\rho S_y

等价地:

YXSx<2ρSy \frac{Y}{X} \cdot S_x < 2\rho S_y SxX<2ρSyY \frac{S_x}{X} < 2\rho \frac{S_y}{Y}

因此,对于比率估计更有效的情况:

ρ>Sx/X2Sy/Y=CV(X)2CV(Y) \rho > \frac{S_x / X}{2 S_y / Y} = \frac{CV(X)}{2 CV(Y)} CV(xˉ)CV(\bar{x})CV(yˉ)CV(\bar{y}) 的绝对值通常不会产生显著差异。因此,当 ρ>1/2\rho > 1/2 时,比率估计比 SRS 更有效。

简单来说:当 xxyy 之间存在强正相关关系时,比率估计器比样本均值更适合估计 yy 的总体均值。

Y^R\hat{Y}_R 的方差估计为: v(Y^R)=(1f)sy2+R^2sx22R^sxyn v(\hat{Y}_R) = (1 - f) \frac{s_y^2 + \hat{R}^2 s_x^2 - 2\hat{R}s_{xy}}{n}

为什么使用比率估计

当参数本身是一个比率时,如每个苹果的平均果汁含量。

当辅助变量 xx 与研究变量 yy 高度相关,且总体中 xx 的总和或均值已知时,比率估计可提供比简单样本均值更精确的估计。

估计总体总和,但总体大小未知

例如: 有一批苹果,我们想估计整批苹果的果汁总量。设:

  • y1,,yny_1, \dots, y_n:样本中每个苹果的果汁量
  • xix_i:样本中每个苹果的重量,xˉ\bar{x} 是样本平均重量
  • NN 难以计数,所以 NyˉN\bar{y} 难以直接获取
  • 但整批苹果的总重量 XX 容易获得

苹果数量可估计为 X/xˉX / \bar{x},苹果果汁总量可估计为:

Y^r=yˉxˉX \hat{Y}_r = \frac{\bar{y}}{\bar{x}} X

调整估计量以反映人口统计学总量

例子: 某大学共有 4000 名学生,取 SRS 样本 400 人:

  • 样本中有 240 名女性和 160 名男性
  • 84 名女性和 40 名男性计划从事教学工作

目标: 估计计划成为教师的学生总数。

估计器1: 仅使用 SRS 信息

Nyˉ=4000×124400=1240 N\bar{y} = 4000 \times \frac{124}{400} = 1240

估计器2: 纳入人口统计学信息(学院有 2700 名女性和 1300 名男性)

84240×2700+40160×1300=1270 \frac{84}{240} \times 2700 + \frac{40}{160} \times 1300 = 1270

关键点:

  • 每个性别组内应用比率估计
  • 样本中 60% 是女性,但女性占总体的 67.5%。估计器相应调整以更好地反映人口统计比例

处理无响应偏差

例子: 企业样本

  • yiy_i:企业 ii 在健康保险上的支出
  • xix_i:企业 ii 的员工数量,已知
  • 目标: 估计总保险支出

估计器1: NyˉN\bar{y}

  • 员工少的公司不太可能回应调查
  • yiy_ixix_i 成比例
  • 估计器1会高估总保险支出 tyt_y

估计器2: XyˉxˉX \frac{\bar{y}}{\bar{x}}

  • 由于员工多的公司更可能回应,X/xˉ<NX / \bar{x} < N
  • 因此,总医疗保健保险支出的比率估计可能有助于补偿员工少的公司的无响应

简单随机抽样中的回归估计

关于回归估计

在调查抽样中,回归估计是一种利用辅助变量信息提高估计精度的统计技术。当我们研究一个变量yy(如收入、产量等)时,常常可以获取与其相关的辅助变量xx(如人口、面积等)的信息。当x与y存在线性关系,且x的总体参数(如总体均值或总和)已知时,我们可以利用这种关系改进对y的估计。

回归估计的核心是利用以下信息:

  • 辅助变量与目标变量的关系: 假设 yyxx 存在线性关系 E(y)=β0+β1xE(y) = \beta_0 + \beta_1 x
  • 辅助变量的总体信息: 已知 xx 的总体均值 Xˉ\bar{X} 或总体总和 txt_x
  • 样本数据: 通过样本观察到的 (xi,yi)(x_i, y_i) 配对数据

这种估计方法的关键洞察是:如果辅助变量 xx 与研究变量 yy 高度相关,那么 xx 的已知总体信息可以帮助我们更精确地估计 yy 的总体参数。例如,如果我们知道一个地区的总人口(xx),并观察到人口与家庭收入(yy)之间存在强相关性,那么我们可以利用这种关系得到比简单样本均值更精确的家庭收入估计。

与简单估计和比率估计的比较

  • 简单随机抽样估计: 仅使用 yy 的样本信息,忽略任何辅助变量
  • 比率估计: 假定 yyxx 之间存在通过原点的比例关系 y=Rxy = R x
  • 回归估计: 允许 yyxx 之间存在一般线性关系 y=β0+β1xy = \beta_0 + \beta_1 x,更为灵活

回归估计的优势在于当关系不通过原点时(即当 x=0x=0y0y \neq 0),它比比率估计更适用。例如,在估计死树数量时,即使照片计数(xx)为零,实地计数(yy)可能不为零,此时回归估计比比率估计更合适。

回归估计的流程

我们重新介绍这里回归需要的流程,由于只有两个变量,因此方程很简单

定义总体回归参数:

  • β1=B1=i=1N(xiXˉ)(yiYˉ)i=1N(xiXˉ)2\beta_1 = B_1 = \frac{\sum_{i=1}^{N} (x_i - \bar{X})(y_i - \bar{Y})}{\sum_{i=1}^{N} (x_i - \bar{X})^2} (总体回归斜率)
  • β0=B0=YˉB1Xˉ\beta_0 = B_0 = \bar{Y} - B_1 \bar{X} (总体回归截距) 其中,Xˉ\bar{X}Yˉ\bar{Y} 分别是辅助变量 xx 和研究变量 yy 的总体均值。

从样本中,我们可以估计:

  • β^1=B^1=iS(xixˉ)(yiyˉ)iS(xixˉ)2\hat{\beta}_1 = \hat{B}_1 = \frac{\sum_{i \in S} (x_i - \bar{x})(y_i - \bar{y})}{\sum_{i \in S} (x_i - \bar{x})^2}
  • β^0=B^0=yˉB^1xˉ\hat{\beta}_0 = \hat{B}_0 = \bar{y} - \hat{B}_1 \bar{x}
yy 的总体均值 Yˉ\bar{Y} 的回归估计量为: y~reg=B^0+B^1Xˉ=yˉ+B^1(Xˉxˉ) \tilde{y}_{reg} = \hat{B}_0 + \hat{B}_1 \bar{X} = \bar{y} + \hat{B}_1 (\bar{X} - \bar{x})

这个估计量可以理解为:先用样本均值 yˉ\bar{y} 估计 Yˉ\bar{Y},然后根据样本中 xx 与已知总体 xx 的差异 (Xˉxˉ)(\bar{X} - \bar{x}),结合估计的斜率 B^1\hat{B}_1 进行调整。

估计量的性质

偏差

bias(y~reg)=cov(B^1,xˉ) \text{bias}(\tilde{y}_{reg}) = \text{cov}(\hat{B}_1, \bar{x})

回归估计量通常是有偏的,但当样本量较大时,偏差可以忽略。如果回归线完美通过所有总体点 (xi,yi)(x_i, y_i),则 B^1=B1\hat{B}_1 = B_1,偏差为零。

均方误差(MSE)

MSE(y~reg)=(1nN)Sd2n \text{MSE}(\tilde{y}_{reg}) = \left(1 - \frac{n}{N}\right) \frac{S_d^2}{n}

其中 di=yi[Yˉ+B1(xiXˉ)]d_i = y_i - [\bar{Y} + B_1(x_i - \bar{X})]Sd2S_d^2 是这些 did_i 的总体方差。

利用相关系数 ρ\rho,MSE 可以重写为:

MSE(y~reg)=(1nN)1nSy2(1ρ2) \text{MSE}(\tilde{y}_{reg}) = \left(1 - \frac{n}{N}\right) \frac{1}{n} S_y^2 (1 - \rho^2)

这表明:

  • 当样本量 nn 增大或抽样比例 n/Nn/N 增大时,MSE 减小
  • xxyy 之间的相关系数 ρ\rho 接近 ±1\pm 1 时,MSE 显著减小

总体总和的回归估计量

t^yreg=iSyi+iSc(B^0+B^1xi)=iSyi+(Nn)B^0+B^1(txiSxi) \hat{t}_{yreg} = \sum_{i \in S} y_i + \sum_{i \in S^c} (\hat{B}_0 + \hat{B}_1 x_i) = \sum_{i \in S} y_i + (N - n)\hat{B}_0 + \hat{B}_1 (t_x - \sum_{i \in S} x_i)

nNn \ll N 时,可近似为:

t^yregN(B^0+B^1Xˉ)=Ny~reg \hat{t}_{yreg} \approx N(\hat{B}_0 + \hat{B}_1 \bar{X}) = N \tilde{y}_{reg}

标准误差

SE(y~reg)=(1nN)sd2n \text{SE}(\tilde{y}_{reg}) = \sqrt{\left(1 - \frac{n}{N}\right) \frac{s_d^2}{n}} SE(t^yreg)=N(1nN)sd2n \text{SE}(\hat{t}_{yreg}) = N \sqrt{\left(1 - \frac{n}{N}\right) \frac{s_d^2}{n}}

其中 sd2s_d^2 是残差 di=yiB^0B^1xid_i = y_i - \hat{B}_0 - \hat{B}_1 x_i 的样本方差。

95% 置信区间:

y~reg±tn2(0.025)(1nN)sd2n \tilde{y}_{reg} \pm t_{n-2}(0.025) \sqrt{\left(1 - \frac{n}{N}\right) \frac{s_d^2}{n}} t^yreg±tn2(0.025)N(1nN)sd2n \hat{t}_{yreg} \pm t_{n-2}(0.025) N \sqrt{\left(1 - \frac{n}{N}\right) \frac{s_d^2}{n}}

关于回归估计与比率估计的总结

比较三种估计方法

估计方法 均值 Yˉ\bar{Y} 的估计量 总和 TYT_Y 的估计量
SRS yˉ\bar{y} NyˉN\bar{y}
比率 B^Xˉ\hat{B} \bar{X} B^tx\hat{B} t_x
回归 B^0+B^1Xˉ\hat{B}_0 + \hat{B}_1 \bar{X} N(B^0+B^1Xˉ)N(\hat{B}_0 + \hat{B}_1 \bar{X})

选择回归估计的情况:

  • xxyy 之间存在线性关系,但不一定通过原点
  • 当辅助变量 xxyy 高度相关(ρ>0.5|\rho| > 0.5
  • 当已知 xx 的总体信息(均值或总和)
  • 当存在系统性偏差需要校正(如死树计数案例中的照片计数偏差)

选择比率估计的情况:

  • xxyy 之间存在通过原点的比例关系
  • 当总体大小 NN 未知,但辅助变量总和已知
  • 在整群抽样中特别有用

选择 SRS 估计的情况:

  • 当没有可用的辅助信息
  • 当辅助变量与研究变量相关性弱
  • 当分析需要简单性和易解释性
  • Title: Sampling Survey: Sampling Design, Estimation Methods, and Data Quality
  • Author: Hyacehila
  • Created at : 2025-11-12 08:04:37
  • Link: https://hyacehila.github.io//blog/2025/11/12/sampling-survey-notes/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments