信度效度检验,几乎是每个用SPSS做问卷数据分析的人都会遇到的第一道门槛。问卷回收上来,数据录好,想去检验假设、做回归、看差异,但在此之前如果没把信度和效度这关过掉,后面算出来的结果解释起来就没有底气。这篇文章我会用一整套可复现的操作流程,讲清楚SPSS里的信度检验到底怎么做、结果怎么读,以及多维度问卷为什么要分维度验证,顺便把那些容易绊倒新手的坑也一并趟一遍。
这篇内容适合正在写课程论文、毕业论文,或者工作中需要处理量表数据的读者。我已经用SPSS做过大量问卷数据的信度效度验证,踩过的坑不少,所以这篇不会只堆菜单路径,还会把背后的逻辑讲明白:为什么这么操作、什么情况下结果会失真、怎么排查低信度背后的原因。
1. 信度效度检验到底在干什么:先说清楚逻辑再动手
很多人拿到SPSS第一件事就是找菜单,但我的习惯是先想清楚两个问题:信度是什么、效度是什么、为什么这两个检验能撑起后续所有统计分析的合法性。没有这层理解,操作再熟练也只是机械地"点按钮出结果",一旦结果不理想,根本不知道怎么排查。
1.1 信度:你的测量工具稳不稳
信度这个概念,一句话解释就是:用同一套题重复测量同一批对象,结果是不是一致的。放到问卷场景里更直白的说法是,量表里的多道题有没有在共同测量同一个东西。
举个生活化的例子。你想知道自己体重,站上电子秤,称出来65公斤,下来再站上去还是65公斤,这台秤就是可信的。如果第一次65、第二次70、第三次62,那这台秤没法用。问卷是一个道理:客户满意度量表设计了8道题,8道题应该都在从不同角度测量"满意度"这个隐藏概念。如果某道题和其他7道题完全不搭,那这道题可能就是"秤坏了"。
SPSS里最常用的信度指标是Cronbach's Alpha系数,也就是克隆巴赫α系数。它的逻辑是把题目两两之间的一致性做成一个综合指标,范围在0到1之间,越接近1说明内部一致性越好。实际操作中,α在0.7以上属于可接受,0.8以上表明信度良好,0.9以上说明非常理想,但如果高到0.95以上,也要怀疑是不是题目冗余——这个后面我会单独说。
1.2 效度:测出来的东西是不是你想要的东西
信度解决的是"稳不稳",效度解决的是"准不准"。一台秤如果内部很稳,每次称都是同一个数,但它把65斤显示成65公斤,那它信度再好也没有用,因为不准。
问卷里的效度分好几种:内容效度看题项是否覆盖了想要测量的概念范围,结构效度看实际测量结果和理论框架是否吻合,效标效度看测量结果和一个外部标准是否一致。SPSS数据检验中,日常用得最多的是结构效度,手段是探索性因子分析,KMO和Bartlett检验也就是在这时候派上用场。
有个关键逻辑必须记住:信度是效度的必要不充分条件。也就是说,信度高的量表未必有效度,但效度高的量表一定先得有信度。这也是为什么数据检验的顺序一定是先信度后效度,先保证测量的稳定性,再谈准确性。如果信度这关都过不了,效度检验的结果大概率也不会好看。
1.3 检验顺序和整体安排
我一般把信度效度检验的流程固定成这么几条线:先做数据清洗,检查反向题有没有做反向计分、缺失值异常值有没有处理干净;然后跑信度检验,看总体量表和各维度的α系数,结合CITC判断题目去留;信度达标后,再进入效度检验,做KMO和Bartlett检验、探索性因子分析,判断维度结构是否匹配预期。
这篇文章是系列的第一篇,先把信度检验讲透。效度检验涉及的因子分析内容量更大,我后面会单开一篇细讲,这样每篇的内容都能吃透,而不是一锅炖。
2. 信度检验实操:SPSS里Cronbach's Alpha完整操作
接下来进入实际操练环节。我会按照我自己平时做问卷分析的流程一步步走,从数据准备到跑结果再到解读,每一步都会说清楚为什么这么做。
2.1 数据准备:先别急着点菜单,把这几个地方检查一遍
SPSS下载安装好以后,很多人把问卷录入成Excel直接导进来就开跑,这是最容易出问题的一步。
第一,变量类型必须设对。在"变量视图"里,每个题项的"度量标准"要设成"标度",尤其Likert五级量表和七级量表这种连续型计分题。如果某道题被设成"名义"或"有序",后面跑信度时SPSS可能会给出不一样的处理方式,影响结果。我见过不少人一整套题跑出来α只有0.4,检查了半天,发现是变量类型全乱了。
第二,反向计分必须处理干净。这是信度检验里面最容易被忽略的一环。很多量表里会故意放几道反向题,用来避免被试乱填或不认真作答。比如"我对公司很满意"是正向题,而"我经常想换工作"就是反向题。如果这两类题不统一计分方向就直接算信度,α会断崖式下跌,因为正向题和反向题的回答方向本来就相反,内部一致性自然极低。
反向计分在SPSS里有两种常规做法。一种是直接在"计算变量"里生成一个新的反向变量,公式是"6-原得分",适用于五级量表;如果是七级量表,就改成"8-原得分"。另一种是用SPSS的"重新编码为不同变量"功能,把原值1→5、2→4、3→3、4→2、5→1这样映射过去。我个人的习惯是生成新变量,保留原始变量不动,这样万一后面要看原始数据还能回溯。
第三,无效问卷要提前筛掉。连续10道题都选同一个选项的、整份问卷作答时间明显过短的,该剔就剔。这类样本不仅拉低信度,而且会给后续效度检验制造虚假因子结构。没有一个精确的"必须剔多少"的标准,我的底线是剔除后样本量仍然要达到题项数的5倍以上,做因子分析时更稳一些。
2.2 SPSS操作步骤:可靠性分析的最短路径
数据准备完毕,就可以跑了。SPSS做信度检验的路径不算长,但每一步都有讲究。
操作路径是这样:菜单栏点"分析"→"标度"→"可靠性分析"。在弹出的对话框里,把需要检验的题项从左侧变量列表全部选入右侧"项目"框。这里有一个高频错误:很多人顺手把总均分、性别、年龄这些变量也拖进去了。总均分千万不能放,它是所有题项的平均值,放进去会人为抬高α;人口学变量更不能放,它们是分类变量,性质和连续计分量表完全不同。
"模型"下拉框保持默认的"Alpha"即可。如果是分半信度则选"半分",但常规问卷信度检验默认Alpha就够了。
接下来点右侧的"统计"按钮,这一步很多人会漏掉。弹出对话框里我建议勾选这几项:在"描述"栏勾选"如果删除项则进行缩放"旁边的"项"和"标度";在"汇总"栏可以勾选"标度";在"项目之间的相关性"里可以勾选"相关性",这些能在输出里给出每个题项与总量表的相关系数以及删除该题后α值的变化情况,对后续是否需要删题的判断至关重要。
点击"确定"后,输出窗口会给出结果。我通常还会做一个附加操作:如果问卷设计了多个维度,我建议把每个维度下的题项单独跑一次信度分析,同时再跑一次总量表的信度分析。这样后面"分维度"汇报时就有现成数据可用,不用来回重跑。
2.3 结果解读:重点看三个表
SPSS跑完信度检验后,会输出一堆表格,但我只重点看三张。
第一张是"可靠性统计"表,关注Cronbach's Alpha那一行。这是全篇的核心指标。α≥0.9说明内部一致性极好,但注意,如果题项超过20个而且α接近0.95以上,要考虑题目是否有冗余表达;α在0.8~0.9说明信度良好;α在0.7~0.8属于可接受范围;α低于0.7,就需要认真考虑修订题项了。α的判断标准我后面会专门做一张对照表。
第二张是"项总计统计"表,这是判断删题的利器。表里有几个关键列:"修正后的项与总计相关性"(CITC)和"删除项后的Cronbach's Alpha"。CITC衡量的是这道题和其他题总分的相关性。如果某题的CITC低于0.4,说明这道题跟整体量表不太搭。这时看一下"删除项后的Alpha"列,如果删掉这道题后α值明显上升,那这题就是拖后腿的元凶,删掉它是合理的。
第三张是"项目间相关性矩阵",这个表我一般不细看,只扫一眼有没有明显负相关的题对。如果有,大概率说明有反向题没转过来,回去检查反向计分。这个方法很灵,我排查问题时常先用这招。
3. 多维度量表:到底要不要分维度做信度分析
在热搜词里我注意到一个问题很典型:"SPSS多维度题项效度分析需要分维度做吗"。这个问题同样适用于信度检验。无数人在做完总量表信度检验后被导师或者审稿人追问:你这是个多维量表,怎么只报了总量表的α?这时候才慌慌张张回去补各维度α。我的建议是,从一开始就分维度跑。
3.1 为什么必须分维度看信度
原因很简单:整份量表里的题项可能分属几个不同的维度或者说不同的子构念。比如工作满意度量表,可能包括"薪酬满意度"5道题、"晋升满意度"4道题、"同事关系满意度"4道题。把它们全部放在一起算总量表α,本质上是在假设所有题目测的是同一个"工作满意度"的总体概念,计算α时会把跨维度之间的低相关也纳入公式。
结果很常见:总量表的α可能在0.85以上,看起来亮眼,但其实分维度细看,某个维度内部的一致性可能特别糟糕。比如薪酬满意度的5道题只跑出α=0.55,那这个维度的测量就明显不可靠。如果不分维度,这个问题会被总量表掩盖过去。
反过来还有一种情况:总量表α偏低,但分维度后每个维度的α都过得去。这种情况说明量表存在清晰的多维结构,简单把全部题项当一个整体来计算信度本身就是不合适的。所以分维度做信度分析不是多此一举,而是尺度更精准的诊断。
3.2 实际操作中的分维度策略
我的标准做法是分两轮跑。第一轮跑总量表α,整个量表的题项全部选入。第二轮按维度拆开,每个维度单独跑一次α。汇报的时候先报总量表α,再分别报各维度α范围,这是学术论文和行业报告里最常见的汇报范式。
需要注意,所谓"按维度拆开"不是手动把题项挑出来扔进对话框跑一遍,前提是你在设计问卷时已经对维度归属有清晰预设。如果一份量表没有明确维度结构,所有题目本来就是在测一个单一构念,那就没必要强行拆维度。判断方法有一个常用的经验法则:看题目之间的内容指向,题目在问同一个对象、同一个层面的,通常属于同一维度;题目在问同一个大概念下的不同侧面的,就是多维结构。
这里顺带回答热搜里关于"SPSS数据分拆文件"的关联问题。有人用"数据"→"拆分文件"按维度拆分后再跑信度,我的建议是:跑信度不需要拆分数据文件,直接通过选择变量或者反复跑"可靠性分析"对话框就可以了。拆分文件主要适用于按照分组变量来做后续分组统计,比如按性别、学历分组跑描述统计,跟信度检验没关系。
3.3 反向题与维度归属的连带问题
分维度做信度时,反向题的处理会直接影响结果。很多量表在某个维度内部插入了一两道反向题,这个维度单独跑信度时,反向题如果没有完成计分转换,该维度α会骤降。
我曾经处理过一份员工敬业度问卷,其中一个维度"工作投入"含7道题,其中2道是反向题。最初把原始数据直接跑,该维度α只有0.38。我当时第一反应是"这个维度本身有问题",但通过对每对题目的相关矩阵检查,发现那几道反向题与其他题目全部负相关,所有负相关条目都指向这2道题。把反向题转换之后,维度α直接升到0.82。所以提醒各位,看到异常低的分维度α,第一件事不是删题,而是检查反向题。
4. 信度检验前后的数据清洗与排查:先别想着改数据,先改思路
信度检验结果不理想的时候,很多人第一反应是删题,把α低的那道题删掉,再到0.7往上走为止。这种"为删而删"的做法我非常不推荐。删题要有逻辑、要有依据,最好是在问卷设计逻辑和统计指标双重证据下做判断。
4.1 样本量和效度之间的微妙关系
很多人不知道,样本量本身就会影响α值的稳定性。α基于题项之间的平均相关性,而相关性估计在小样本下波动非常大。你拿30份问卷跑出来的α可能是0.75,但再补20份变成0.65,这不是题目有问题,而是样本量太小,相关系数估计不稳定。一般建议做信度检验的样本量至少不少于50,能达到100以上最好。如果你手里只有三四十份问卷,α偏低时不要急着删题,先增加样本量再说。
另一个容易出问题的场景是样本异质性。比如你在研究大学生群体的学习投入度,但样本里混了一部分高中生和中专生,作答模式差异大,总体α可能受影响。这时候把样本按群体拆开跑信度,你可能会发现每个群体内部的α都挺好,合并起来反而偏低。这类问题要从抽样设计上解决,而不是靠删题掩盖。
4.2 低信度的原因排查列表
我把自己平时排查低信度的一条经验路线整理成了五个步骤,按顺序执行能省很多事。
第一步,检查反向题有没有转换。这是成本最低、回报最高的检查项。看相关矩阵里有大片负相关,基本就是这个问题。
第二步,检查数据有没有录入异常。用描述统计跑一遍所有题项的最小值、最大值、均值、标准差,如果某道题出现了选项范围外的数字,或者标准差接近0,说明录入有错或者该题几乎是废题,只有一个人在一个选项上波动。
第三步,看CITC指标。逐题查看修正后的项与总计相关性,找出那些低于0.4、并且删除该题后α值上升超过0.05的题项。这类题通常是语义含糊、和被试理解存在偏离、或者测量内容和其他题目不相关。这种时候可以考虑删题。
第四步,看维度归属是否合理。有时候某道题原本被分在A维度,但在受访者理解里它问的内容更贴近B维度。这种情况做效度检验时会出现交叉载荷,信度检验里则会表现为该维度α偏低。处理时需要结合理论框架判断,甚至要考虑把它调到另一个维度。
第五步,反思题项表述本身。如果一道题连续几次预调查信度都极低,大概率是这道题的措辞有问题——比如使用了否定句式、双重否定、过于抽象、或者同时问了两个问题。这类题目应该直接修改,而不是用删题来回避。
5. 效度检验预告与常见问题速查
信度检验通过之后,接下来的自然动作就是效度检验。这里先把方向点一下,详细操作我留在下一篇文章展开。
5.1 下一步:KMO与Bartlett检验
效度检验第一步通常是KMO检验和Bartlett球形度检验,用来判断数据是否适合做因子分析。KMO的取值在0到1之间,越接近1越好,通常要求大于0.6,最好在0.7以上。Bartlett球形度检验则看显著性,p值小于0.05说明变量之间存在足够的相关性,可以做因子分析。
通过这两个检验以后,就可以做主成分分析或者探索性因子分析,观察因子载荷、方差解释率、维度结构是否符合预期。整个过程和信度检验是前后衔接的,所以建议在做信度时就把变量命名、维度归属、反向计分这些基础工作做扎实,避免后面返工。
5.2 高频问题速查表
| 问题 | 可能原因 | 处理建议 |
|---|---|---|
| 总量表α低于0.7 | 反向题未处理、样本量过小、维度间差异过大 | 先检查反向题,再看CITC,考虑分维度跑 |
| 某维度α特别低 | 该维度内反向题未转换、题项表述模糊、维度归属错位 | 检查相关矩阵中的负相关项、逐题CITC,必要时调整题项归属 |
| 删掉一道题后α大幅上升 | 该题为低质量题项 | 结合CITC低于0.4且删除后α上升的证据,才能考虑删除 |
| α高达0.96以上 | 题目重复表达或题项过少导致相互冗余 | 检查题项之间是否存在高度重复的表述,考虑精简量表 |
| 分维度α都高但总量表α不高 | 量表是多维结构,各维度测的是不同构念 | 分别汇报各维度α,不需强行追求总量表高α |
| 样本量不到40份,α偏低 | 小样本下相关估计不稳定 | 优先补充样本,再做删题判断 |
最后分享一个我在实际使用中很喜欢的小习惯:每次跑完信度检验,把"可靠性统计"结果和"CITC表格"截图存档,按问卷名称和版本号命名。后面写论文或者做报告的时候,不需要重新打开数据找结果,直接调档就行。这个习惯帮我省了很多来回翻找的功夫。
信度检验是整个问卷数据分析里最基础但也是最能反映数据质量的一环,用一周时间认真把数据整理干净,后面分析会顺很多。下一篇我会接着写效度检验中的探索性因子分析,包括KMO解读、因子提取、载荷判断和维度调整,有兴趣的可以继续关注。