1 定类变量的基本概念
1.1 定义
定类变量是统计学和社会科学中用于表示类别而非数量的变量类型。它将研究对象按照属性、身份、状态或归属划分为不同组别,组与组之间主要体现“不同”,而不是“多少”。常见例子包括性别、血型、籍贯、职业、品牌类型等。
1.2 核心特征
1.2.1 类别属性
定类变量的取值本质上是类别标签,用来指明对象属于哪一类。其重点在于识别和区分,而不是度量大小或变化幅度。
1.2.2 无序性
多数定类变量的各类别之间没有天然顺序,不能简单地说某一类“高于”或“低于”另一类。例如,血型中的A型、B型、O型和AB型彼此并不构成大小规律。
1.2.3 穷尽性与互斥性
理想情况下,定类变量的类别设置应尽量做到穷尽,即能够覆盖研究对象的全部可能情况;同时也应保持互斥,即同一对象在同一时点通常只能归入一个类别,避免重复归类造成统计混乱。
1.3 与其他变量类型的区别
1.3.1 与定序变量的区别
定序变量虽然也以类别形式呈现,但类别之间存在明确顺序,如“低、中、高”或“满意、一般、不满意”。定类变量则不强调次序,仅表示类别归属。
1.3.2 与定距变量的区别
定距变量具有可比较的数值间隔,能够反映差值大小,例如温度、考试分数等。定类变量不具备数值间距意义,其编码数字通常只是标记,而非测量结果。
1.3.3 与定比变量的区别
定比变量在定距变量基础上具有绝对零点,因而可以进行倍数比较,如身高、体重、收入等。定类变量不涉及零点问题,也不支持加减乘除意义上的数量运算。
2 定类变量的分类
2.1 二分类变量
二分类变量只有两个类别,常用于表示是否、是非、男女性别等简单划分。这类变量在调查和建模中十分常见,处理起来也较为直观。
2.1.1 哑变量
哑变量是将二分类信息以0和1编码的形式表示出来的变量,常用于回归分析和统计建模。一般来说,1表示某种属性的存在,0表示不存在,但具体含义需结合研究设定理解。
2.1.2 是非型变量
是非型变量直接表达“是”与“否”、“有”与“无”等两种状态,语义清晰,便于问卷设计和数据汇总。在实际研究中,它也常被进一步转换为数值编码。
2.2 多分类变量
多分类变量包含三个及以上类别,适用于描述较复杂的属性划分,如职业类型、地区类别、教育程度分组等。它们往往需要更细致的编码和分析方式。
2.2.1 名义多分类
名义多分类是指各类别之间没有顺序关系的多分类变量,例如民族类别、品牌类型、城市名称等。分析时通常关注各类别出现的频率及其差异。
2.2.2 多重响应变量
多重响应变量允许同一对象对应多个类别,常见于兴趣爱好、媒体接触渠道、症状勾选等情境。与单一归类不同,这类变量反映的是并列选择结果。
2.3 单选与多选情形
2.3.1 单选定类变量
单选定类变量要求受访者或样本对象在若干类别中只能选择一项,因此具有较强的互斥性。它适合用于身份确认、主类归属或单一偏好判断。
2.3.2 多选定类变量
多选定类变量允许对象同时选择多个类别,更适合捕捉现实中并不互相排斥的情况。此类数据在统计时通常需要分别计数,并注意总和可能超过样本量。
3 定类变量的测量与编码
3.1 编码原则
3.1.1 数字编码
数字编码是最常见的处理方式,即用数字代表不同类别。其优势在于便于录入、整理和软件分析,但这些数字通常不应被理解为大小顺序。
3.1.2 字母编码
字母编码适合类别较少或需要避免数字歧义的情境,例如用A、B、C标识不同组别。此法在人工记录和某些表格管理中较为方便。
3.1.3 其他符号编码
除数字和字母外,也可使用符号、缩写或组合代码表示类别,例如“男/女”“已婚/未婚”等。编码方式应以清晰、统一和便于识别为原则。
3.2 编码中的注意事项
3.2.1 编码不代表大小
定类变量的编码只是标识符号,不应赋予数值意义。将“1、2、3”理解为等级高低,容易导致分析方法选择错误。
3.2.2 保持类别一致性
同一研究中应尽量保持编码规则前后一致,避免同类对象在不同表格或不同批次数据中使用不同代码。统一规则有助于减少混淆和重复解释。
3.2.3 缺失值处理
对于未回答、无法判断或不适用的情况,需要单独设置缺失值代码,而不应与有效类别混在一起。这样可以避免统计结果被错误污染。
3.3 变量标签与值标签
3.3.1 标签设置
变量标签用于说明变量本身的含义,值标签用于解释各编码对应的具体类别。二者配合使用,可以提高数据可读性,减少后续分析中的误解。
3.3.2 编码表管理
在较大规模研究中,通常需要建立编码表来统一记录变量名称、类别设置、代码含义及修改历史。良好的表格管理有助于数据维护和项目交接。
4 定类变量的统计分析方法
4.1 描述性统计
4.1.1 频数统计
频数统计用于计算各类别出现的次数,是定类变量最基础的分析方式之一。它能够直观显示样本在不同类别上的分布情况。
4.1.2 百分比统计
百分比统计在频数基础上进一步表达各类别所占比例,便于不同样本量之间比较。对于类别分布不均的变量,百分比往往比单纯频数更具解释力。
4.1.3 众数
众数是出现次数最多的类别,适用于定类变量的集中趋势描述。与平均数不同,众数不依赖数值大小关系,因此更符合类别数据的特征。
4.2 交叉分析
4.2.1 列联表
列联表用于展示两个或多个定类变量之间的联合分布,是交叉分析的基本工具。通过列联表,可以观察不同类别组合的数量差异和可能关联。
4.2.2 分组比较
分组比较通常是将样本按某一类别分层,再比较另一变量在各组中的分布情况。该方法有助于发现类别之间的差异模式,并为进一步检验提供依据。
4.3 推断统计
4.3.1 卡方检验
卡方检验常用于判断两个定类变量之间是否存在统计关联,或观察频数分布是否偏离理论预期。它是定类变量分析中最经典的检验方法之一。
4.3.2 Fisher精确检验
当样本量较小或列联表中某些格子的期望频数过低时,Fisher精确检验比卡方检验更适合。它能够在小样本条件下提供较稳妥的显著性判断。
4.3.3 比例差异检验
比例差异检验主要用于比较不同组别在某一类别上的比例是否存在显著差异。它常见于两组或多组比较情境,适合处理二分类结果。
5 定类变量在社会科学研究中的应用
5.1 问卷调查中的应用
5.1.1 人口学变量
定类变量常用于收集受访者的人口学信息,如性别、婚姻状况、职业类别、户籍类型等。这些信息通常用于样本描述和分层分析。
5.1.2 态度与立场分类
在问卷中,态度和立场有时会被简化为若干类别,如支持、反对、中立等。此类设置便于快速编码,但也会压缩回答的细腻程度。
5.1.3 行为类型分类
行为类型分类可用于记录受访者是否参与某种活动、偏好哪一类行为或属于何种使用方式。它常见于消费、媒介接触和生活方式研究。
5.2 量化研究中的角色
5.2.1 自变量
在量化分析中,定类变量可作为自变量,用来解释不同类别对结果变量的影响差异。例如,群体类别可能与某种结果表现相关。
5.2.2 因变量
定类变量也可以充当因变量,尤其当研究关注的是某种结果是否发生、属于哪一类时更为常见。此时通常会采用适配分类结果的统计模型。
5.2.3 控制变量
研究中还常将定类变量作为控制变量,以排除某些背景差异的干扰。通过控制性别、地区、职业等类别因素,可以使主效应分析更清晰。
5.3 质性研究中的辅助作用
5.3.1 分类整理
在质性研究中,定类变量可帮助研究者对访谈材料、文本片段或观察记录进行初步分类。它有助于将零散信息转化为可管理的分析单元。
5.3.2 编目归类
编目归类强调对资料进行主题化、条目化处理,便于后续比较与检索。虽然质性研究重视语境,但适当的类别整理仍能提高分析效率。
6 定类变量的数据处理
6.1 数据录入
6.1.1 原始类别转录
数据录入时,需要先将原始答案或现场记录中的类别信息准确转录到数据库中。转录过程应尽量保持原意,不随意增删类别。
6.1.2 编码转换
若原始资料使用文字表达,常需进一步转换为统一代码,以便统计软件识别。转换时应同步保留对照关系,防止后期无法追溯。
6.2 数据清洗
6.2.1 重复类别合并
在实际数据中,可能出现同义写法或录入变体,如简称、全称混用等。清洗时需要将这些重复或近似类别合并到统一标准中。
6.2.2 异常值识别
定类变量的异常值通常不是极端数值,而是错误分类、乱码或不在编码表中的无效内容。识别并修正这些异常信息,是保证数据质量的重要环节。
6.2.3 缺失类别补全
对于部分可推断但未填写完整的类别信息,有时可依据其他记录进行补全;但若无法可靠判断,则应保留缺失状态,避免过度推测。
6.3 软件处理
6.3.1 Excel中的处理
Excel适合进行基础录入、筛查和简单汇总。通过筛选、排序、数据透视表等功能,可以完成定类变量的初步整理与展示。
6.3.2 SPSS中的处理
SPSS对定类变量支持较为直接,常用于设置值标签、生成频数表、交叉表和卡方检验等。它在社会科学研究中具有较高的使用率。
6.3.3 R与Python中的处理
R与Python适合进行更灵活的数据清洗、编码转换和统计建模。借助相关库,可以实现分类变量的批量处理、可视化和自动化分析。
7 定类变量的常见问题
7.1 类别划分不清
7.1.1 标准不统一
当分类标准缺乏一致性时,不同调查员或不同批次数据可能出现口径不一的问题。统一定义和操作规则,是减少歧义的关键。
7.1.2 边界模糊
某些现实对象并不容易被明确归入某一类,导致类别边界不够清晰。此时需要在研究设计阶段预先规定判定规则。
7.2 编码误用
7.2.1 将类别当作数值处理
如果把定类变量的编码直接当作连续数值计算,容易产生错误结论。尤其在均值、差值或回归解释中,这类误用较为常见。
7.2.2 编码顺序引起误解
即使编码只是标记,研究者或读者仍可能因代码排列而误以为存在顺序关系。因此,编码方案应避免产生不必要的联想,并在说明中明确其含义。
7.3 研究设计中的局限
7.3.1 信息量有限
定类变量能够提供的是类别归属信息,通常难以反映程度、强弱或变化幅度,因此信息量相对有限。若研究问题更关注差异深浅,往往需要其他测量层级补充。
7.3.2 解释空间受限
由于定类变量缺少连续性和数量关系,其解释通常集中在分类比较上,而不适合展开精细的数值推断。研究者需要根据问题性质选择合适的变量类型。