实证研究怎么做?量化与质性的方法对比及流程指南

实证研究核心方法:设计、检验与解释 约 8 分钟
本文目录
一句话定义: 实证研究(Empirical Research)是依靠可观察、可测量的事实和数据,用系统的办法来检验假设、回答研究问题的一种科学活动。其要义在于让证据说话,而不是依靠单纯的逻辑推理或者个人的经验。

一个核心问题: 为什么90%的实证研究新手都会掉进同一个坑里——跳过预测试?这不是危言耸听。很多研究者怀着极大的热情去设计问卷、收集数据,但是在分析的时候发现数据不可用、信度低、假设不能检验。本指南会先从量化和质性的对比入手,给你一份从零开始的实证研究操作路线图,再附上一份新手避坑清单,让你避开那些教科书上没有写的雷区。

1. 什么是实证研究

实证研究不是简单的发问卷、跑SPSS。它是问题到证据的一个闭环系统。其主要特点有:

  • 可验证性:研究结论可以被其他研究者用同样的方法或者类似的方法重复验证。
  • 客观性:研究过程中尽量避免研究者主观因素的影响,使用标准化的工具和程序。
  • 系统性:按照一定的逻辑流程,从研究问题到数据分析,一环套一环。

它与非实证研究的本质区别在于:非实证研究(纯理论思辨、政策分析、哲学讨论等)主要依靠逻辑推理、概念分析、主观经验等手段得出结论,缺少可以直接观察到的数据支持,并且很难被重复验证。实证研究所有的结论都要建立在收集到的数据(数字或者文本)的基础上。

2. 实证研究的核心要素与类型

按照研究问题的性质以及数据收集的方法不同,实证研究可以分为量化研究、质性研究和混合研究方法。选择哪种方法取决于你想回答的是“A在多大程度上影响B?”还是“A是如何影响B的?”。

维度量化研究质性研究
核心目标验证假设、测量变量、寻找普遍规律、预测探索现象、理解意义、深挖机制、构建理论
研究问题什么、多少、程度、相关性、因果关系如何、为什么、是什么样的过程、意义
假设预先设定,需要数据验证在研究过程中逐渐形成,或初始假设开放
数据收集结构化问卷、实验数据、二手统计数据(数字)深度访谈、参与式观察、档案文本、图像(文字/符号)
样本量通常较大(数百至数千),基于统计检验力计算通常较小(十至数十人),以达到信息饱和为准
数据分析描述性统计、推断性统计(t检验、ANOVA、回归)主题分析、扎根理论编码、叙事分析
信效度标准内部/外部效度、Cronbach‘s α、KMO值可信度、可转移性、可靠性、可确认性 (Lincoln & Guba, 1985)
典型方法调查法、实验法、准实验法案例研究、现象学、民族志、扎根理论

引用目的:本表对比标准参照Creswell (2014) 《Research Design: Qualitative, Quantitative, and Mixed Methods Approaches》的核心分类框架。

1. 量化研究:追求统计显著性,用数字来验证理论。例如,“收入水平对工作满意度的影响”适合用量化的方法来检验。

2. 质性研究:追求情境化的理解,通过文本挖掘出因果关系。例如,“一线城市程序员工作倦怠的形成”可以采用质性研究的方法进行研究。

3. 混合研究方法:将两者的优点结合起来。先用问卷(量化)发现一个显著的相关,再用深度访谈(质性)来解释这个相关背后的原因。

3. 实证研究的完整流程

无论采用哪种方法,完整的实证研究都要经过以下五个步骤。每一个步骤的疏忽都会造成整个研究的失败。

步骤一:提出研究问题与假设

这是研究的开始。研究问题要具体、可操作。以社交媒体使用对大学生心理健康的影响为出发点,但是需要进一步细化,在控制学业压力变量之后,每天使用TikTok的时长是否和大学生的焦虑水平呈正相关?

构建研究假设要从文献中得出。假设不是凭空想出来的,是理论或者前人研究的缺口。

  • 模糊写法:“A会影响B。”
  • 操作化写法:工作压力(用工作压力自评量表PSQ-30测量)对离职意向(用离职意向量表TIQ测量)有正向预测作用,在控制了年龄和工龄之后效应仍然显著。

关键提示:假设必须包含可测量的变量。如果你说“幸福感”,就必须定义如何测量(比如用SWLS量表得分)。变量类型(自变量、因变量、控制变量)的转化是假设能否被检验的前提。

步骤二:研究设计与变量界定

这一步决定了你将用什么样的方法来回答你的问题。

  • 自变量:你认为是原因的那个变量(教学方法)。
  • 因变量:你认为是结果的那个变量(考试成绩)。
  • 控制变量:需要排除干扰的其他变量(学生的基础水平、学习时长等)。

核心动作:操作化定义。把抽象的概念转化为可以测量的指标的过程。把“社会支持”操作化为“感知社会支持量表(MSPSS)总得分”。

步骤三:数据收集与样本选择

这是最容易出错的环节。很多人认为只要样本量足够大就可以了,这是一个很大的误区。

样本量并不是越大越好,而是要根据效应量和统计检验力来定。一个常见的误区是认为200份足够了,但是如果效应量只有0.2,那么需要394份样本才能达到0.8的统计检验力(Cohen,1988)。

效应量(Cohen’s d)计算示例

假设要比较两个独立组(实验组和对照组)的成绩差异。

  • 实验组平均分 = 85,标准差 = 10
  • 对照组平均分 = 80,标准差 = 10
  • Cohen‘s d = (85-80) / √( (10²+10²)/2 ) = 5 / 10 = 0.5

这是一个中等效应量。根据Cohen (1988) 的表格,在α=0.05,检验力=0.80,效应量=0.5的双尾t检验中,每组至少需要64人。

抽样原则:随机抽样可以最大程度上保证样本的代表性。如果不能做到(大部分研究都是方便抽样),在研究局限中如实说明。

步骤四:数据分析与结果解读

这是证明自己观点的重要环节。但是要记住,统计显著性(p值)并不等于实际重要性。

  • 量化分析:先做描述性统计(均值、标准差),再做推断性统计(相关、回归、t检验、方差分析)。
  • 质性分析:按照一定的编码方式(开放编码、主轴编码、选择性编码)来提取主题和模式。

步骤五:结论推导与局限讨论

结论必须完全依据你的数据分析结果。不要外推没有根据的因果故事。如果你的研究只发现了相关关系,那么在结论中就不能说A导致B。一定要花足够的篇幅来讨论研究的局限性,即样本代表性不足、测量工具误差、不能排除的混淆变量等。反而体现出你的学术严谨性。

4. 实证研究设计的关键要点

这是区分学术小白和老手的主要区域。设计不周全,后面所有的工作都将是徒劳的。

如何保证研究的信度和效度

信度、效度是实证研究的生命线,但是新手常常把两者混淆。

  • 信度:测量结果的一致性和稳定性。常用指标为Cronbach’s α系数,通常要求α ≥ 0.7。α值过低,说明你的题目间一致性差,数据不可靠。
  • 效度:测量工具是否准确测量了你想要的东西。
  • 内容效度:你的问卷题项是否全面覆盖了你所测量的构念?这通常靠专家评审和文献支撑。
  • 结构效度:你的量表题项是否按照你预期的维度排列?这需要通过探索性因子分析(EFA) 验证。如果你用SPSS跑出的KMO值低于0.6,说明变量间相关性太弱,需要重新设计题项。

真实案例复盘:一个研究生是如何被预测试“救活”的

一位社会学研究生想研究“职场内卷对员工幸福感的影响”。她直接用问卷星,通过微信群、朋友圈发问卷,一周后收回200份。满心欢喜地去做信度分析的时候,发现Cronbach‘s α只有0.6,比0.7的标准低很多。她很沮丧,差点就放弃了。

后来在导师的建议下,她做了一次预测试。她找了20个目标人群填写问卷,并逐题询问反馈。她发现:

1. “职场内卷”这个词太学术了,很多人把它理解成“加班”,但它实际上包含的意义更广泛。

2. 有一道题是反向计分题,表述不清,造成一半人理解相反。

3. 部分题项表述带有诱导性。

她做了两件事:

1. 调整题项表述:把抽象词汇换成具体的情境描述,删掉两道歧义题。

2. 增加样本量:根据新的效应量估算,把样本量目标从200份提高到300份。这次她通过更精准的社群(工作5-10年的白领群)发放。

结果令人振奋:新收集的300份数据,Cronbach‘s α达到了0.82。她的反思金句是:“永远不要跳过预测试。预测试的成本是最低的,但收益是最大的——它避免了你投入巨额时间和精力后,才发现你的测量工具是无效的。”

控制变量与随机化的重要性

  • 控制变量:在回归模型中必须加入那些会同时影响自变量和因变量的变量(年龄、教育程度、收入等)。否则,你得到的相关关系可能是虚假的。
  • 随机化:在实验法中,将受试者随机分配到实验组和对照组,是保证内部效度(即我们能确信A导致B)的黄金标准。随机化能有效平衡两组在除自变量外的其他特征上的差异。

常见的设计误区就是把变量当作抽样偏差

  • 混淆变量:一个既与自变量有关,又与因变量有关的变量。研究“咖啡消费与心脏病风险”。喜欢喝咖啡的人也可能喜欢熬夜(混淆变量),熬夜才是导致心脏病风险增加的主要原因。
  • 抽样偏差:样本不能代表所要研究的总体。只在校园论坛上发布有关“大学生理财习惯”的调查问卷,就会大大低估那些不常上论坛的学生。

数据分析方法选择建议

数据分析属于实证研究的关键部分。选择哪种方法取决于你的数据类型(连续、分类、有序)以及研究目的(比较、关联、预测)。

数据类型 / 研究目的比较两组均值比较三组及以上均值探究相关关系预测/解释
连续数据 (如量表得分、年龄)独立样本t检验 / 配对样本t检验单因素方差分析 (ANOVA)Pearson相关线性回归 / 多元回归
分类数据 (如性别、职业)卡方检验卡方检验卡方检验 / Phi系数Logistic回归
有序数据 (如满意度等级)Mann-Whitney U检验Kruskal-Wallis H检验Spearman等级相关有序Logistic回归

注:本表给出基本的选择指南。实际分析时还要检验数据是否符合某种方法所要求的前提假设(正态性、方差齐性等)。

描述性统计与推断性统计

  • 描述性统计:对数据特征进行总结和描述。均值、中位数、标准差、频数分布。这是一切分析的开始。
  • 推断性统计:根据样本数据来推断总体情况。t检验、回归分析。这是检验假设、得出结论的重要环节。

质性数据分析:主题分析与编码策略

如果选择质性研究,NVivo或者Atlas.ti是常用的辅助分析工具。核心步骤:

1. 开放式编码:逐字逐句阅读文本,为每个有意义的片段贴上“标签”(如“加班文化”、“职业倦怠”、“同辈压力”)。

2. 主轴编码:将开放编码归类,建立范畴和子范畴(如将“加班文化”、“同辈压力”归类为“内卷化工作环境”)。

3. 选择性编码:确定一个核心范畴(如“幸福感侵蚀机制”),并围绕它讲一个故事。

结果呈现与学术写作规范

  • 数据可视化:图表选择原则——比较数据用柱状图;展示趋势用折线图;展示占比用饼图(慎用,易误导);展示分布用箱线图。保证所有的图表都清楚、自明,并且有标题和编号。
  • 结果讨论:结果必须回扣研究假设。在讨论部分除了要报告自己的发现之外,还要解释它的意义,并且与前人的研究进行对话。你的发现支持了谁?挑战了谁?为什么?
  • 伦理规范与数据透明度:必须获得受试者的知情同意,保护其隐私。在学术写作中,应承诺数据透明度,如“如有需要,可向第一作者请求匿名化数据”。

5. 常见实证研究误区与避坑指南

常见误区具体表现对策与补救策略
过度依赖统计显著性只报告p < 0.05的结果,忽视效应量和实际意义。同时报告效应量(Cohen’s d, η², R²)和置信区间。大样本下,微小效应也可能显著。
忽视样本代表性只使用大学生样本(方便抽样),却声称结论适用于“所有年轻人”。明确说明样本来源,并在局限中讨论推广的边界。
混淆相关与因果发现A和B显著相关,就直接声称“A导致了B”。只有在严格控制的随机实验设计下才能断言因果关系。相关研究只能报告“相关”。
研究设计缺乏可重复性不提供详细的问卷题项、代码、分析步骤,导致他人无法复现。在论文附录或公开数据仓库(如OSF, GitHub)中共享你的材料和分析脚本。
预测试形同虚设只找了2-3个同学帮忙看,没有做系统的信效度检验。严格按照预测试流程,至少找10-20个目标人群,收集反馈并计算初始信度。
忽视数据清洗不检查缺失值、异常值,直接跑分析。在分析前进行数据清洗:处理缺失值(删除或插补)、识别并处理极端值。

常见问题

常见问题

共 3 个问题,点击展开查看答案

  • 实证研究依靠可以观察、测量的数据和事实,用系统的办法来检验假设,结论可以重复。非实证研究(纯理论研究)更多地依靠逻辑推理、概念分析或者主观经验,缺少直接的数据支持。简单来说,实证研究用数据说话,非实证研究靠逻辑自洽。

  • 从自身兴趣领域入手,结合文献综述找到研究空白,保证选题有明确的研究对象和可操作化的变量。从小规模、可控制的研究入手,不要选择过于宏大或者数据难以获得的课题。一个可靠的方法是,先做一个迷你案例研究或者小样本预测试,看数据是否能够“跑通”。

  • 不是。实证研究包含量化研究(问卷调查、实验法)、质性研究(访谈、案例研究)和混合方法。选择取决于研究问题和数据性质,关键是要保证数据的可观察性以及分析的系统性。想知道有多少人就选量化,想知道为什么是这样就选质性。


决策路线图:

当你准备开始一项实证研究的时候,请根据你的情况选择工具组合:

  • 如果你的研究是探索性的(“这是怎么回事?”),且时间充裕、预算有限:选择质性研究。工具组合:NVivo + 深度访谈(5-15人)。适合初探全新领域。
  • 如果你的研究是验证性的(“这个理论/假设是否成立?”),且目标人群明确、样本易得:选择量化研究。工具组合:SPSS/Stata + 问卷星。适合验证前人理论或检验因果关系。
  • 如果你既有理论验证需求,又希望理解机制:选择混合方法。工具组合:先问卷后访谈(顺序型)问卷中嵌入开放题(并行型)。这是最强大的研究设计,但对时间和资源要求最高。

记住:永远不要跳过预测试。 这是所有经验的起点,也是你避免灾难的最后防线。