统计:让数据开口说话

获取数据:抽样方法

研究对象的全体叫总体,其中每一个对象叫个体,从总体中抽取的一部分个体叫样本,样本含个体的数目叫样本量。抽样要回答的核心问题是:怎么用一小部分数据推断总体?前提是样本要有代表性。

简单随机抽样

从总体中逐个不放回地抽取 个个体,每个个体被抽到的机会都相等,叫简单随机抽样。实现方式:抽签法(总体不大)、随机数法(用随机数表或软件产生随机数)。

分层随机抽样

当总体由差异明显的几部分组成(如按年级、城乡分层)时,把总体分成互不重叠的层,按各层个体数占总体比例分别独立抽取,合起来组成样本,叫分层随机抽样。层内差异可能大,但层间比例被严格保持——样本结构才与总体结构一致。

方法 适用场景 要点
简单随机抽样 总体较小、个体差异不大 等可能、不放回
分层随机抽样 总体由差异明显的几部分组成 各层按比例抽取

易错点:分层抽样每层抽多少?第 层应抽 (该层个体数占总体比例乘以样本量),不是每层抽一样多。

用样本估计总体

频率分布直方图:看“形状”

画直方图的流程:求极差(最大减最小)→ 决定组距与组数 → 将数据分组 → 列频率分布表 → 画图。直方图中:

易错点:读直方图频率必须看面积(高 × 宽),不能直接读纵轴刻度!组距不同纵轴就不同,只有面积才是频率。

其它常用图表

集中趋势:平均数、中位数、众数

平均数(均值)是所有数据的“重心”:

公式 (1)

中位数:数据从小到大排序后,中间位置的那个数( 为偶数时取中间两个的平均)——不易受极端值影响。众数:出现次数最多的数据,可以不止一个。

记忆:极端值(如“某人年薪一个亿拉高平均”)会把平均数拉走,但中位数岿然不动——所以收入分布常用“中位数”描述更诚实。

离散程度:极差、方差、标准差

数据“散不散”用离散程度衡量:

公式 (2)
公式 (3)
指标 回答的问题
平均数 数据的“中心”在哪
中位数 排序后“中间人”是谁,抗极端值
众数 最常见的取值
方差 / 标准差 数据偏离中心有多远
极差 最大与最小的距离

易错点:方差为 当且仅当所有数据全部相等;比较两组数据稳定性比标准差(或方差),越小越稳定。计算方差时平方差要“先差、再平方、后平均”,顺序别乱。

百分位数

把数据从小到大排列, 分位数是这样一个数:至少有 % 的数据小于或等于它,且至少有 % 的数据大于或等于它。求法:先算位置 %(即 ),若 不是整数,取大于 的最小整数所对应的数据;若 是整数,取第 项与第 项的平均数。

常用:25%(下四分位数)、50%(即中位数)、75%(上四分位数)。箱线图就是围绕三个四分位数与极值画的。

分层抽样下的总体均值与方差

分层抽样得到两组样本后,总样本均值不是简单相加平均,而要按样本量加权。设第 1 层样本量 、均值 、方差 ,第 2 层相应为 、、,则总样本均值为:

公式 (4)

总样本方差要把“层内散布”和“层间差距”都算进去:

公式 (5)

直觉:两堆数据合在一起后,不仅每堆内部有散布,两堆均值不同本身也是一种散布——方差公式第二项 补的就是“组间差距”。考试若给两组统计量求合并方差,直接用本公式;求合并均值则必用加权平均。

用样本估计总体的思想

统计的终极动作是推断:用样本的频率分布、平均数、方差去估计总体的相应特征。样本量越大、抽样越随机,估计越可靠——这正是下一章“概率”要解释的:为什么频率能稳定地逼近概率。