统计:让数据开口说话
获取数据:抽样方法
研究对象的全体叫总体,其中每一个对象叫个体,从总体中抽取的一部分个体叫样本,样本含个体的数目叫样本量。抽样要回答的核心问题是:怎么用一小部分数据推断总体?前提是样本要有代表性。
简单随机抽样
从总体中逐个不放回地抽取 个个体,每个个体被抽到的机会都相等,叫简单随机抽样。实现方式:抽签法(总体不大)、随机数法(用随机数表或软件产生随机数)。
分层随机抽样
当总体由差异明显的几部分组成(如按年级、城乡分层)时,把总体分成互不重叠的层,按各层个体数占总体比例分别独立抽取,合起来组成样本,叫分层随机抽样。层内差异可能大,但层间比例被严格保持——样本结构才与总体结构一致。
| 方法 | 适用场景 | 要点 |
| 简单随机抽样 | 总体较小、个体差异不大 | 等可能、不放回 |
| 分层随机抽样 | 总体由差异明显的几部分组成 | 各层按比例抽取 |
易错点:分层抽样每层抽多少?第 层应抽 (该层个体数占总体比例乘以样本量),不是每层抽一样多。
用样本估计总体
频率分布直方图:看“形状”
画直方图的流程:求极差(最大减最小)→ 决定组距与组数 → 将数据分组 → 列频率分布表 → 画图。直方图中:
- 纵轴是“频率 / 组距”,不是频率;
- 每个小矩形的面积 = 该组的频率,所有小矩形面积之和 = 1;
- 最高矩形所在的组叫众数所在组,直方图轮廓反映数据分布形态(对称、左偏、右偏、双峰)。
易错点:读直方图频率必须看面积(高 × 宽),不能直接读纵轴刻度!组距不同纵轴就不同,只有面积才是频率。
其它常用图表
- 茎叶图:保留全部原始数据(十位作茎、个位作叶),适合样本量不大的两组数据比较;
- 频率折线图:连接直方图各矩形上边中点而成,用于观察变化趋势;
- 柱状图比大小、折线图看趋势、扇形图看占比——读图先问“它想让你看什么”。
集中趋势:平均数、中位数、众数
平均数(均值)是所有数据的“重心”:
中位数:数据从小到大排序后,中间位置的那个数( 为偶数时取中间两个的平均)——不易受极端值影响。众数:出现次数最多的数据,可以不止一个。
记忆:极端值(如“某人年薪一个亿拉高平均”)会把平均数拉走,但中位数岿然不动——所以收入分布常用“中位数”描述更诚实。
离散程度:极差、方差、标准差
数据“散不散”用离散程度衡量:
- 极差 = 最大值 − 最小值,最粗糙的散布指标;
- 方差 是离差平方的平均:
- 标准差 是方差的算术平方根,与数据同单位,实际使用更多:
| 指标 | 回答的问题 |
| 平均数 | 数据的“中心”在哪 |
| 中位数 | 排序后“中间人”是谁,抗极端值 |
| 众数 | 最常见的取值 |
| 方差 / 标准差 | 数据偏离中心有多远 |
| 极差 | 最大与最小的距离 |
易错点:方差为 当且仅当所有数据全部相等;比较两组数据稳定性比标准差(或方差),越小越稳定。计算方差时平方差要“先差、再平方、后平均”,顺序别乱。
百分位数
把数据从小到大排列, 分位数是这样一个数:至少有 % 的数据小于或等于它,且至少有 % 的数据大于或等于它。求法:先算位置 %(即 ),若 不是整数,取大于 的最小整数所对应的数据;若 是整数,取第 项与第 项的平均数。
常用:25%(下四分位数)、50%(即中位数)、75%(上四分位数)。箱线图就是围绕三个四分位数与极值画的。
分层抽样下的总体均值与方差
分层抽样得到两组样本后,总样本均值不是简单相加平均,而要按样本量加权。设第 1 层样本量 、均值 、方差 ,第 2 层相应为 、、,则总样本均值为:
总样本方差要把“层内散布”和“层间差距”都算进去:
直觉:两堆数据合在一起后,不仅每堆内部有散布,两堆均值不同本身也是一种散布——方差公式第二项 补的就是“组间差距”。考试若给两组统计量求合并方差,直接用本公式;求合并均值则必用加权平均。
用样本估计总体的思想
统计的终极动作是推断:用样本的频率分布、平均数、方差去估计总体的相应特征。样本量越大、抽样越随机,估计越可靠——这正是下一章“概率”要解释的:为什么频率能稳定地逼近概率。