0%

课前说明

1. 为何选择IBM SPSS?

  • SPSS是一款历史悠久、发展成熟的统计软件。在图形化操作系统出现之前,SPSS已经为早期计算机用户提供统计分析。
  • SPSS的算法通过了美国国家标准技术研究所(NIST)的严格检验,确保了计算结果的准确性。同时,它也是美国食品药品监督管理局(FDA)等权威机构认可的分析工具之一,在学术界和工业界都享有很高的信誉。
  • 相较于纯代码驱动的统计语言,SPSS的语法(Syntax)被设计为更贴近自然语言,具有很高的可读性和可解释性,对初学者非常友好。
  • SPSS不仅内置了绝大多数社会科学研究所需的统计模型,还支持与Python、R等现代编程语言进行深度集成。通过其 开发者模块 ,用户可以不断拓展SPSS的功能,实现更复杂的定制化分析。

对应关系

1. 新建语法(syntax)

  • 快捷键操作: Alt + F + N + S (Windows)
  • 点选操作: 文件 → 新建 → 语法

语法窗口

辅助知识点:什么是SPSS语法? SPSS语法是SPSS软件内置的命令语言。相较于通过鼠标点击菜单完成操作,使用语法具有更高的效率、可重复性和准确性。一次编写,即可反复执行,尤其适用于批量处理数据、构建复杂模型或记录分析过程的场景。一份清晰的语法文件本身就是一份完整的“数据分析日志”。

13. 处理多选题 (Multiple Choice Question)

  • 问卷中的多选题,在数据录入时需要进行转换。最常用、最规范的方法是“多重二分法”,即将一个多选题拆解成多个“是/否”型的单选题。每个选项都成为一个独立的变量。

案例(13-1):将以下多选题录入SPSS

  • Q1. 您主要通过何种途径了解国际新闻____(可多选): A.报纸 B.杂志 C.广播 D.电视 E.电脑 F.手机 G.其他
  • 转换思路: 将其转换为七个独立的、回答为“是”或“否”的变量。
    • 您是否通过“报纸”了解国际新闻? (是/否)
    • 您是否通过“杂志”了解国际新闻? (是/否)
    • … 以此类推 …
  • 语法实现
 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
STRING news1 news2 news3 news4 news5 news6 news7 (A1).

* 为每个新变量添加详细的变量标签.
VARIABLE LABELS 
    news1 "您是否通过报纸了解国际新闻?" / 
    news2 "您是否通过杂志了解国际新闻?" /
    news3 "您是否通过广播了解国际新闻?" /
    news4 "您是否通过电视了解国际新闻?" /
    news5 "您是否通过电脑了解国际新闻?" /
    news6 "您是否通过手机了解国际新闻?" /
    news7 "您是否通过其他方式了解国际新闻?".

* 为所有这些变量统一定义值标签:0代表未选中,1代表选中.
VALUE LABELS news1 TO news7 0 "否" 1 "是".

* 定义这些变量的测量级别为名义变量.
VARIABLE LEVEL news1 TO news7 (NOMINAL).

EXECUTE.

0. 预处理

  • 设置工作目录
1
CD "/Users/ginglam/Public/data".
  • 导入2016年中国劳动力动态调查数据 (CLDS)
1
2
3
GET FILE "clds2016_i.sav".
DATASET NAME clds.
DATASET ACTIVATE clds.

1. 理解基尼系数

  • 基尼系数 (Gini Coefficient) 是意大利统计学家基尼 (Corrado Gini) 在1912年提出的一种核心指标,用于衡量一个国家或地区居民收入分布的差异程度,是衡量社会不平等度的重要工具。

基尼画像

  • 基尼系数的内涵
    • 它通过一个简洁的数字(取值在0到1之间),概括了收入在全体人口中的分配情况。
    • 基尼系数为 0,代表完全平等。可以想象一个社会,其中每个人的收入都完全相同,没有任何差异。
    • 基尼系数为 1,代表完全不平等。可以想象一个极端社会,其中一个人占有了所有的社会财富,而其他所有人收入为零。
    • 现实社会总是处于这两个极端之间。基尼系数的数值越大,表明该地区的收入不平等程度越高。

核心概念梳理

辅助知识点

在学习统计推断前,我们必须清晰地辨别三个名字相似但意义迥异的概念。这三者的关系是整个统计推断的基石。

  1. 总体分布 (Population Distribution)

    • 是什么? 指的是我们所研究的全体对象中,某个变量的真实分布情况。例如,中国所有劳动力的真实收入分布。
    • 特点: 这是我们最想知道的,但通常是未知且不可得的。因为我们几乎不可能去测量每一个个体。它的参数(如总体均值 μ、总体标准差 σ)是固定但未知的常数。
  2. 样本分布 (Sample Distribution)

    • 是什么? 指的是我们从总体中抽取出来的那一小部分数据中,某个变量的分布情况。例如,CLDS调查中几千名受访者的收入分布。
    • 特点: 这是我们实际拥有的、看得见摸得着的数据。我们通过分析样本分布,来推断总体分布的样貌。它的统计量(如样本均值 X̄、样本标准差 s)是已知的,但每次抽样都可能不同。
  3. 抽样分布 (Sampling Distribution)

    • 是什么? 这是一个理论上的、抽象的分布。想象我们从同一个总体中,反复抽取无数个大小相同(例如,n=200)的样本。每一个样本都会有一个自己的均值。把这无数个样本均值收集起来,它们自身就会形成一个分布,这个分布就叫做“均值的抽样分布”。
    • 特点: 这是连接样本与总体的桥梁。中央极限定理告诉我们,这个分布近似于正态分布。它的标准差有一个特殊的名字,叫做标准误 (Standard Error)。我们正是利用抽样分布的这个性质,来判断我们的样本结果在多大程度上是可靠的,并据此构建置信区间。

从理论到实践

辅助知识点: 在上一讲中,我们通过模拟,直观地理解了总体、样本和抽样分布这三大核心概念。

本讲我们将学习

  1. 精确计算这三个分布的关键参数(均值、方差、标准差/标准误)。
  2. 利用我们手中的一个样本,对未知的总体参数进行区间估计(Confidence Interval)。
  3. 基于样本证据,对关于总体均值的某个断言进行科学的假设检验 (Hypothesis Testing)。