自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

统计与概率入门

  1. 01数据到底在说什么
  2. 02数据从哪里来:调查、实验与偏差
  3. 03用图表看数据:分布、形状与异常值
  4. 04平均数不总是平均:中心与离散
  5. 05相关不等于因果
  6. 06概率从不确定开始
  7. 07计数、排列组合与概率计算
  8. 08条件概率:信息会改变概率
  9. 09随机变量与常见分布
  10. 10从样本推总体:抽样误差与置信区间
  11. 11显著性检验:差异是真的,还是偶然的
正在加载课程章节内容
课程数学统计与概率入门数据到底在说什么

数据到底在说什么

统计学最容易让人产生的一种错觉,是“表格里已经有很多数字,答案应该就在里面”。其实正好相反:数字越整齐,我们越容易忘记追问它们是怎么来的,又在替谁说话。

一条新闻说“本市高中生平均每天运动 42 分钟”,看起来只需要理解“42”这个数。可只要多问几句,事情立刻变复杂:新闻说的是所有高中生,还是参加问卷的高中生?“运动”包不包括步行上学?每天 42 分钟是过去一天、过去一周,还是一个学期的平均?没有回答的人会不会恰好更少运动?

这并不是故意挑刺。统计学研究的本来就不是确定答案,而是怎样用有限、会波动、可能不完整的数据,做出尽量可靠的判断。学这门课的第一步,不是急着算平均数,而是先把数据里的对象、变量和范围摆正。

从观察形成数据,再把数据当作证据支持判断的手绘示意图

数据更像证据,不像判决书。它能支持某种判断,也会留下新的疑问。

看到一个统计结论时,先问三件事:观察了谁,记录了什么,想说明谁。只要这三件事没有对齐,再精确的小数也可能没有解释力。


从一项校园决策开始

我们用一个案例贯穿这一节。

某校高一年级共有 620 名学生。学校正在考虑要不要增开一班早晨接驳车,于是从这 620 人中随机抽取 60 人,记录他们平时的通勤方式、单程通勤时间、需要换乘的次数、过去一周是否迟到,以及对当前通勤状况的满意程度。

这项调查真正要支持的是一个决策:有没有必要增开接驳车?要回答它,光知道“平均通勤时间”还不够。学校还得知道哪些学生通勤困难、困难表现在哪里,以及抽到的 60 人能不能代表全年级。

先把最基本的统计语言放到案例里。

统计概念在通勤调查里指什么
个体(观测单位)每一名高一年级学生
变量通勤方式、单程通勤时间、换乘次数、是否迟到、满意程度
变量值某名学生的“公交”“38 分钟”“换乘 1 次”“是”“不满意”
数据60 名学生在这些变量上的全部记录
总体学校想了解的全部 620 名高一学生
样本实际被抽取并记录的 60 名学生

这几个词看起来只是名词,实际是在检查一条证据链:我们逐个观察个体,在每个个体身上记录变量值,把许多记录组成数据,再用样本去了解总体。


把现实放进数据表

个体和观测:一行到底代表谁

个体是被逐个观察的对象,也叫观测单位或案例。个体不一定是人。研究医院的候诊时间时,一个个体可能是一名病人;研究城市空气质量时,一个个体可能是某个监测站在某一天的记录;研究网购退货时,一个个体可能是一笔订单。

“一行对应一个个体”是数据表最常见的组织方式,但不能机械地把“人”当作个体。假如一名学生连续 14 天每天填写一次通勤记录,那么每一行更可能对应“某名学生的某一天”,同一名学生会出现 14 行。判断个体时,要问的是:这份表里,每一行代表一次什么样的观察?

变量和值:一列在问什么

变量是对每个个体记录的特征。你可以把它理解成对每一行都要问的同一个问题:“通勤方式是什么?”“用了多少分钟?”“上周迟到过吗?”

变量值是某个个体对这个问题给出的具体答案。“单程通勤时间”是变量,“38 分钟”是变量值;“是否迟到”是变量,“是”是变量值。把变量和变量值混在一起,后面就很容易把“要研究什么”和“实际观察到什么”混为一谈。

下面是这项调查中的五行示意数据。案例是教学用的假设情境,表中数值只用来帮助我们读懂数据结构。

学生编号通勤方式单程通勤时间(分钟)换乘次数过去一周是否迟到通勤满意程度
G101公交381是不满意
G102步行120否满意
G103地铁462否一般
G104家人接送250否满意
G105骑行180是一般

通常每一行对应一名学生,每一列对应一个变量,每个单元格是一个变量值。整张表称为数据表或数据矩阵。以后增加一名学生,就增加一行;增加“出门时间”这个变量,就增加一列。

编号不是“可以求平均的数字”

学生编号里可能含有数字,但它只是标签。把 G101、G102、G103 中的数字部分求平均没有实际含义。电话号码、邮政编码、球衣号码也一样:长得像数字,不代表它就是定量变量。

这件事很反直觉,因为我们习惯于“只要是数字就能算”。统计里更可靠的判断方法是:加减、求差、求平均以后,结果有没有现实含义?如果没有,它大概率只是分类标签。

缺失值也不能随手填成 0

如果 G103 没有回答满意程度,这个格子应标记为缺失,而不能写成 0。0 可能是一个真实的变量值,例如换乘 0 次;缺失表示“我们不知道”。两者如果混在一起,平均数、比例和图表都会被悄悄改变。

“没有记录”不等于“记录为零”。整理数据时要同时保存变量定义、测量单位和缺失值规则,否则一张看起来干净的表也可能无法正确解释。


先看变量类型,再决定怎么算

初学统计时,最常见的冲动是见到一列数据就求平均数。可有些列适合求平均,有些列只能数每一类有多少个。变量类型决定了我们能问什么问题,也决定了后面该用什么图表和计算方法。

分类变量:回答“是哪一类”

分类变量记录类别或状态。通勤方式可能取“步行、骑行、公交、地铁、家人接送”,是否迟到可能取“是、否”。对这类变量,我们通常统计每一类的人数或比例。

分类变量还可以分成两种。

  • 名义分类的类别没有自然顺序,例如通勤方式、血型、所在班级。
  • 有序分类的类别有先后顺序,例如“不满意、一般、满意”,但相邻两级之间相差多少并不明确。

满意程度即使编码成 1、2、3,也不会自动变成真正的定量变量。“满意”与“一般”的差距,未必和“一般”与“不满意”的差距相同。编码只是方便存储,不会改变变量本身的含义。

定量变量:回答“有多少”

定量变量记录数量或大小,数值之间的差和平均通常有意义。单程通勤时间、身高、温度、考试分数都属于这一类。

定量变量又可以分为离散变量和连续变量。

离散变量来自计数,可能值之间有明显的跳跃。换乘次数可以是 0、1、2 次,不会是 1.37 次;一个家庭的孩子数、一周迟到次数也都是离散变量。

连续变量来自测量,在一定范围内可以取任意精细的值。通勤时间可能是 31 分 20 秒,身高可能是 171.24 厘米。表里把通勤时间四舍五入成整数分钟,只是记录精度有限,并不把“时间”变成离散变量。判断离散还是连续,要看它本来是计数还是测量,不能只看表里有没有小数点。

变量分为分类变量和定量变量,定量变量再分为离散变量与连续变量

先问数值是否表示可计算的数量,再判断它来自计数还是测量。

一个容易踩坑的例子:年龄

如果记录“实际年龄 15.7 岁”,年龄是连续的定量变量;如果只记录“15 岁、16 岁、17 岁”,通常仍把年龄理解为连续变量,只是按整岁记录;如果把年龄改成“15 岁及以下、16 岁、17 岁及以上”,它就变成了有序分类变量。

同一个现实特征可以因为记录方式不同而成为不同类型的变量。所以我们不能只看列名,还要看变量的具体定义和值是怎样记录的。

快速判断变量类型

可以按下面的顺序判断。

先问这个值是在给对象贴类别标签,还是在测量数量。“公交”是类别,“38 分钟”是数量。

如果是类别,再看类别之间有没有自然顺序。通勤方式没有顺序,满意程度有顺序。

如果是数量,再问它来自计数还是测量。换乘次数来自计数,是离散变量;通勤时间来自测量,是连续变量。

最后检查数值是不是编号或编码。编号即使全由数字组成,通常仍是分类标签。


样本为什么可以替总体说话

总体是研究问题真正想覆盖的全部对象,样本是实际观察到的那部分对象。在通勤案例里,总体是 620 名高一学生,样本是被抽到的 60 名学生。

这个定义有一个常被忽略的细节:总体由研究问题决定。如果学校只想改善住校生周末返校交通,总体就应是住校生;如果要为全校三个年级安排接驳车,总体又会扩大到全校学生。同一份 60 人数据,面对不同问题,代表能力完全不同。

从总体620人中随机抽取样本60人,再用样本估计总体

样本是我们实际看见的一部分,总体是我们最终想判断的整体。

为什么不直接调查所有人

把总体中的每一个对象都调查一遍叫普查。总体很小时,普查有时可行;但总体很大、测量昂贵,或者测量会破坏对象时,普查就不现实。例如检验灯泡寿命需要一直点到灯泡损坏,不可能先把所有产品都测坏再出售。

样本的价值就在这里:我们用一部分对象估计整体。代价是样本会波动。即使从同一个总体反复随机抽取 60 人,每次得到的平均通勤时间也不会完全相同。这不是谁算错了,而是抽样本身带来的自然变化。

样本大,不等于样本有代表性

假设学校在“绿色出行社团”群里收集到 300 份问卷,另一次则从全年级名单中随机抽取 60 人。300 人听起来更有气势,但社团成员的通勤方式很可能和全年级不同。60 人的随机样本反而更有机会对准总体。

样本量主要影响随机波动:在抽样方式合理时,样本越大,结果通常越稳定。代表性主要受选人方式影响:如果某类人很难进入样本,再大的样本也可能稳定地偏向错误方向。

来源单一的大样本与覆盖多个群体的代表性样本对比

人数多能减少随机摇晃,选得对才能避免方向性的偏差。两件事都重要,作用却不一样。

样本结果只能直接描述样本。要把它推广到总体,必须继续检查抽样范围、抽样方式、未回应情况和测量方法。第 2 页会专门处理这些问题。


参数和统计量:两个很像、却不能混用的数

通勤调查结束后,样本中 60 名学生的平均单程通勤时间是 31.8 分钟,15 人在过去一周迟到过。于是样本迟到比例是:

p^=1560=0.25=25%\hat{p}=\frac{15}{60}=0.25=25\%p^​=6015​=0.25=25%

31.8 分钟和 25% 都是从样本算出来的数,叫统计量。统计量会随样本改变:换一批 60 人,平均时间和迟到比例很可能跟着变。

学校真正关心的是全部 620 名学生的平均通勤时间和迟到比例。这两个总体中的真实数值叫参数。参数对于这个确定的总体是固定的,只是我们通常不知道它。只要还没有调查全部 620 人,就不能把样本的 25% 直接写成总体参数。

要描述的对象平均数比例特点
总体总体均值常记作 μ\muμ总体比例常记作 ppp数值固定,但通常未知
样本样本均值常记作 xˉ\bar{x}xˉ样本比例常记作 p^\hat{p}p^​可以从样本算出,会随抽样波动

样本统计量的一个核心用途,就是估计总体参数。这里可以用 xˉ=31.8\bar{x}=31.8xˉ=31.8 分钟估计总体均值 μ\muμ,用 p^=25%\hat{p}=25\%p^​=25% 估计总体比例 ppp。但“估计”不是“完全相等”。帽子符号 p^\hat{p}p^​ 就像一个提醒:这是我们根据样本得到的估计,不是已经看见的总体真值。

参数和统计量的判断口诀

别急着看这个数有没有百分号或小数。先看它描述谁。

  • “被调查的 60 人中有 25% 迟到过”描述样本,是统计量。
  • “全年级所有学生中迟到过的真实比例”描述总体,是参数。
  • “620 人”只是总体规模,不是这项研究要估计的迟到比例参数。

这里最容易出现的错误,是把“总体”“参数”都理解成“大”。总体是对象的集合,参数是描述这个总体的数;样本是对象的子集,统计量是从样本算出的数。对象和数字处在不同层次。


描述统计和推断统计:先说看见的,再说没看见的

统计分析大体上做两类工作。

描述统计负责整理已经观察到的数据。表格、比例、平均数、图形都属于描述工具。它回答的是:“这 60 名学生的记录呈现出什么样子?”

推断统计则从样本走向总体。它回答的是:“根据这 60 人,我们对全部 620 人能说什么?这个估计可能有多大误差?观察到的差异会不会只是抽样波动?”

在通勤调查里,下面两句话只差几个字,统计含义却不同。

在样本的 60 名学生中,25% 过去一周迟到过。

这是描述统计,因为它只说已经观察到的 60 人。

我们估计全年级约有四分之一的学生过去一周迟到过。

这是统计推断,因为它把样本结果推广到了没有逐个观察的总体。第二句话要成立,必须有合理的抽样设计,并说明估计的不确定性。

一个反直觉的医疗比较

一项实验想判断某种血管支架能否降低高风险病人的中风风险。224 名病人接受支架和常规医疗管理,227 名病人只接受常规医疗管理。一年内,前一组有 45 人中风,后一组有 28 人中风。

只看“45 和 28”,比较还不够公平,因为两组总人数不同。我们先把人数变成组内比例。

支架组中风比例=45224≈20.1%\text{支架组中风比例}=\frac{45}{224}\approx 20.1\%支架组中风比例=22445​≈20.1% 对照组中风比例=28227≈12.3%\text{对照组中风比例}=\frac{28}{227}\approx 12.3\%对照组中风比例=22728​≈12.3% 样本比例之差=20.1%−12.3%=7.8 个百分点\text{样本比例之差}=20.1\%-12.3\%=7.8\text{ 个百分点}样本比例之差=20.1%−12.3%=7.8 个百分点

这个结果和“支架应该降低风险”的直觉相反。承认反直觉很重要:数据不会因为研究者期待某个方向,就自动配合那个方向。

到这里,我们完成的是描述:在参加实验的这些病人中,支架组的一年中风比例更高。接下来才是推断问题:7.8 个百分点的差异大到足以排除随机波动吗?实验里的病人能代表哪些人?结果能否推广到其他支架、其他医院、其他类型的病人?

统计学并不是看到差异就宣布答案。它会先认真描述差异,再衡量这种差异是否可能由随机性造成,最后才讨论结论能走多远。

描述统计把已经看见的数据压缩成清楚的图、表和数;推断统计承认我们只看见了一部分,再判断这部分证据能否支持对总体的说法。


数据必须放回语境

一列写着“12、18、25、38、46”,脱离语境几乎什么都说明不了。它可能是通勤分钟数、年龄、温度,也可能是商品价格。单位不同,解释会彻底改变。

读任何数据之前,都应该把下面这些信息补齐。

要问的问题在通勤调查中的答案为什么要问
谁被观察被抽中的高一学生决定每一行代表什么
记录了什么方式、时间、换乘、迟到、满意程度决定变量含义和类型
在哪里、什么时候本校,本学期某个正常教学周节假日或特殊天气可能改变结果
为什么记录为是否增开接驳车提供依据决定哪些变量真正相关
怎样记录抽样问卷、自报通勤时间决定误差和偏差可能从哪里进入
单位和定义是什么单程、分钟;迟到指过去一周至少一次防止同名变量实际测量不同内容

定义不清,数字越精确越危险

假设问卷只问“你每天通勤多久”,有人填单程时间,有人填往返总时间。最后算出 42.37 分钟,看起来非常精确,实际却把两种不同含义混在了一列里。小数点后两位没有修复定义问题,只是让混乱显得更正式。

“平均运动时间”“就业率”“治疗有效”“经常熬夜”这类词也一样。看到它们时,要找操作定义:怎样才算运动?就业率的分母是谁?有效是症状减轻还是完全康复?经常是每周几次?

单个故事很真实,却未必有代表性

学校可能收到一封很诚恳的邮件:“我每天换乘三次,接驳车对我特别重要。”这条经历是真的,也值得被看见。但它不能单独回答“全年级有多少人需要接驳车”。我们对鲜明的个案记得特别牢,容易误以为它就是普遍情况。

个案能帮助发现问题、理解机制,也能提醒我们新增变量;要估计总体情况,仍然需要一组有代表性的观测。


分步例题:把一段新闻拆开

题目:一篇校园新闻写道:“为了了解本市初中生对校内手机管理规定的看法,研究者从 12 所学校抽取 800 名学生,记录他们是否支持规定、每天使用手机的时长和所在年级。样本中有 488 人支持,因此本市初中生的支持率是 61%。”

请指出个体、变量、变量类型、总体、样本、统计量和参数,并判断最后一句话应怎样改写。

先找研究问题想覆盖的对象。新闻想了解“本市初中生”,所以总体是本市所有初中生。实际进入数据的是从 12 所学校抽取的 800 名学生,所以样本是这 800 人。

每一行记录一名学生,因此个体是每一名学生。“是否支持规定”“每天使用手机的时长”“所在年级”都是变量,每名学生的“支持”“2.5 小时”“八年级”是相应的变量值。

判断变量类型。“是否支持”是名义分类变量;“每天使用手机的时长”是连续定量变量;“所在年级”虽然常写成七、八、九,但它表示有顺序的类别,通常按有序分类变量处理。

计算并识别样本统计量。样本支持比例为 p^=488/800=0.61\hat{p}=488/800=0.61p^​=488/800=0.61,所以 61% 是描述这 800 人的统计量。

研究真正想知道的,是本市所有初中生中支持规定的真实比例 ppp。这个总体参数通常未知,61% 只能用来估计它,不能在没有抽样信息时直接宣布二者相等。

最稳妥的描述是:“在被调查的 800 名学生中,61% 支持这项规定。”如果确认样本抽取合理,再写:“样本结果估计本市初中生的支持率约为 61%,但估计会受抽样波动和调查方式影响。”

这道题里真正的难点不是除法,而是给结论划边界。488 除以 800 谁都会算;知道这个 61% 首先属于样本、要代表总体还得检查数据来源,才是统计思维。


常见误区

有数字,就一定是定量变量

错。学生编号、地区代码、满意度编码都可能用数字表示,但加减这些数字没有合理含义。要看数字扮演的是数量还是标签。

表里有 60 行,就一定有 60 个不同的人

错。一行表示一个观测单位,不一定表示一个独立的人。如果同一名学生连续记录 14 天,他会出现 14 行。必须先看数据表的行定义和唯一标识。

样本统计量就是总体参数

错。样本平均数和样本比例是对总体参数的估计。换一个样本,统计量会变;对同一个确定总体,参数不会因为抽了哪批人而改变。

样本越大,结论越真

错。大样本通常更稳定,却不能自动消除选择偏差。20 万名自愿点击网页投票的人,可能不如 1000 名从完整名单中合理抽取的人有代表性。

两个样本比例不同,就一定存在总体差异

错。样本会自然波动。观察到差异以后,还要判断差异相对于样本量是否足够大,以及研究设计有没有把别的因素混进来。

描述得很清楚,就可以推断得很远

错。一张图可以准确描述样本,却未必能代表总体;一次观察性调查可以发现两个变量一起变化,却未必能证明一个导致另一个。描述质量和推断范围是两件事。


读统计新闻时的检查单

以后看到“平均值上涨”“多数人支持”“风险降低”“两者相关”这类标题,可以按下面的顺序检查。先别急着接受或反驳,先把缺的信息找出来。

  1. 结论想说谁?总体的时间、地区、年龄和其他边界是什么?
  2. 实际观察了谁?样本量是多少,样本怎样进入研究,有没有大量人未回答?
  3. 每个个体记录了什么?变量的定义、单位和测量时间是否清楚?
  4. 报道给的是人数还是比例?分母分别是多少?比较的两组规模是否相同?
  5. “平均”具体是哪一种平均?数据分布很偏时,少数极端值会不会拉动它?
  6. 给出的数是样本统计量,还是已经知道的总体参数?报道有没有把估计写成确定事实?
  7. 变化是绝对变化还是相对变化?风险从 1% 降到 0.5%,是下降 0.5 个百分点,也是相对下降 50%,两种说法听起来差很多。
  8. 数据只显示一起变化,还是研究设计真的支持因果解释?有没有可能存在第三个因素?
  9. 结果有没有说明随机波动和不确定性?只报一个很精确的点估计,往往会把证据说得太满。
  10. 这个结论会用于什么决策?即使差异在统计上可信,它在现实中是否大到值得改变政策、治疗或个人选择?

这份检查单不会让你对所有数字都抱怀疑。它的作用恰好相反:把真正可靠的证据和只靠标题制造确定感的数字分开。


本节小结

这一节建立了一条从现实问题到统计判断的基本路线。

  • 个体或观测单位回答“一行是谁”,变量回答“每一列记录什么”,变量值是某个格子里的具体结果。
  • 数据表通常一行一个观测单位、一列一个变量;编号、单位、定义和缺失规则都是数据的一部分。
  • 分类变量记录类别,定量变量记录数量;定量变量又可按计数和测量分成离散变量与连续变量。
  • 总体是研究真正想了解的全部对象,样本是实际观察到的部分对象。
  • 参数描述总体,通常固定但未知;统计量从样本算出,可以用来估计参数,也会随抽样发生波动。
  • 描述统计先说清样本呈现了什么,推断统计再讨论样本能否支持对总体的判断。
  • 数据离不开语境。对象、时间、地点、定义、单位、收集方式和研究目的不清楚时,计算本身救不了结论。

现在我们已经知道一张数据表里“谁是谁”,也知道从样本走向总体会多出不确定性。下一步自然要追问:这些人究竟是怎样进入样本的?数据来自问卷、日常观察,还是研究者主动安排的实验?不同来源会带来不同的偏差,也决定我们能不能谈因果。下一页就从数据的来源与研究设计开始。


练习

练习 1:识别基本要素

某学校想了解全校学生的早餐习惯,从每个年级随机抽取 40 名学生,记录他们当天是否吃早餐、早餐花费和第一节课是否迟到。指出总体、样本、个体、变量和变量值的例子。

总体是该校全体学生;样本是从各年级实际抽取出的学生;个体是每一名学生;变量包括当天是否吃早餐、早餐花费、第一节课是否迟到。某名学生记录为“是、12 元、否”,这三个具体结果就是变量值。注意,“从每个年级抽取 40 人”如果有多个年级,样本总量不是 40 人,而是各年级抽取人数之和。

练习 2:判断变量类型

一张班级数据表的列名包括“学生编号、身高、兄弟姐妹人数、是否近视、最喜欢的运动、体育锻炼强度(低、中、高)”。分别判断变量类型。

学生编号是名义分类变量,因为它只是标签;身高是连续定量变量;兄弟姐妹人数是离散定量变量;是否近视和最喜欢的运动是名义分类变量;体育锻炼强度是有序分类变量。判断时不要只看值是不是数字,要看求差或平均是否有现实意义。

练习 3:区分参数和统计量

某市从全部出租车司机中随机抽取 500 人,得到他们上个月平均工作时长为 184 小时。研究者想估计全市出租车司机上个月的平均工作时长。这里的 184 小时是什么?研究者真正想知道的数又是什么?

184 小时由 500 人的样本计算得到,是样本均值 xˉ\bar{x}xˉ,属于统计量。研究者真正想知道的是全市所有出租车司机上个月的总体平均工作时长 μ\muμ,它是总体参数。184 小时可以用来估计 μ\muμ,但不能假定二者完全相等。

练习 4:人数还是比例

某医院比较两种护理方案。A 方案有 80 名病人,其中 12 人复发;B 方案有 120 名病人,其中 15 人复发。有人看到 12 小于 15,就说 A 方案复发情况更少。这个比较有什么问题?

两组总人数不同,直接比较复发人数不公平。A 组复发比例为 12/80=15%12/80=15\%12/80=15%,B 组复发比例为 15/120=12.5%15/120=12.5\%15/120=12.5%。按组内比例看,样本中 A 组反而更高。这里仍然只是描述样本结果;要判断总体中是否真有差异,还要了解分组方式、样本量和随机波动。

练习 5:给新闻结论划边界

一个视频平台发起自愿投票,20 万名参与者中有 68% 支持限制短视频使用时长。新闻标题写道:“68% 的市民支持限制短视频。”请写出至少三个需要追问的问题,并给出一个更稳妥的改写。

可以追问:平台用户是不是目标城市的市民?哪些人更愿意主动投票?同一个人能否重复参与?年龄、地区和使用习惯是否覆盖了全体市民?题目措辞是否中立?更稳妥的改写是:“在这次平台自愿投票的 20 万名参与者中,68% 支持限制短视频使用时长。”这个结果可以准确描述参与投票者,但在抽样方式得到说明之前,不能直接代表全体市民。

练习 6:描述还是推断

在通勤调查的 60 名学生中,平均通勤时间为 31.8 分钟。判断下面两句话分别属于描述统计还是推断统计,并说明原因。

  1. “这 60 名学生的平均通勤时间为 31.8 分钟。”
  2. “全年级学生的平均通勤时间大约为 31.8 分钟。”

第一句只概括已经观察到的 60 人,属于描述统计。第二句把样本均值推广到全部 620 名学生,属于推断统计。第二句并非一定错误,但它需要合理的抽样方法,并应承认样本均值和总体均值之间可能存在误差。

下一章数据从哪里来:调查、实验与偏差