跳到主要内容
返回时间线
Research Square来源发表:

LLM 用于开放式调查文本分析:人类与 GPT-5 在归纳式内容分析上的表现比较

核心概要

本研究以欧洲博士生调查中六个开放题、共 903 条回答为材料,让五名人类编码者与 GPT-5.4 按同一套归纳式内容分析流程分别生成编码与主题,用调整兰德指数(ARI)衡量一致性,结果显示人机在编码层面的平均一致性为 0.61、主题层面为 0.54,接近人类内部(0.68)与模型内部(0.76)的一致性水平,且各变量间一致性差异较大,低内部一致性总伴随低跨主体一致性。

Source-provided article image: LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
第 10 页

深度剖析

在归纳式内容分析这一任务上,人机一致性(编码 ARI = 0.61,主题 ARI = 0.54)与人类自身在编码与主题之间的一致性(ARI = 0.68)以及模型自身的一致性(ARI = 0.76)相差不大。 以往关于 LLM 文本编码的证据多集中在演绎式、尤其是二元类别的简单编码,归纳式路径与人类的直接比较数据仍然稀少;本研究把同一套归纳流程同时交给人类与模型,并给出可比的量化一致性指标。 基于 903 条回答、六个变量,五名人类编码者与 GPT-5.4 分别产出编码与主题,采用调整兰德指数(ARI)比较,并把多标签编码转换为共现矩阵后再计算;作者同时说明该指标在随机划分时为 0、完全一致时为 1。

人机一致性在不同变量之间波动明显,ARI 从 0.31 到 0.89 不等,且编码主体的内部一致性低时,跨主体一致性也低。 研究把可靠性差异与数据特征和个体表现联系起来,指出变量层面的差异并非均匀分布,例如“财务状况”各值均不高于 0.71,而“其他任何内容”各值均不低于 0.70。 来自表 1 的逐变量 ARI 数值,以及作者对“财务状况”“幸福感”中模型内部一致性偏低、“个人经历”中人类内部一致性偏低的对应解释。

主题层面的对齐低于编码层面,作者将其解释为更高层抽象带来更多自由度,并指出这一现象在人类之间也存在。 把“编码易、主题难”的差异从模型特性问题转为归纳分析步骤本身的特征,与既有工作中主题一致性低于编码一致性的结果相呼应。 编码 ARI = 0.61 与主题 ARI = 0.54 的对比,以及作者引用的相关研究结论。

人类编码者在看到模型结果后表示其分类反映了自己的归类,并支持继续用这种方式分析后续数据,同时提出对过度解读、精度下降和主题过宽的关切。 在量化指标之外补充了编码者对模型输出的直接判断,为“模型可作为早期阶段辅助工具”的定位提供了质性依据。 附录 D 中逐变量的编码者意见,包括对短回答被过度解读、不同回答被同等对待、多个编码被合并为单一主题等具体观察。

启示与展望

本研究面向的是开放式调查回答的归纳式内容分析,尤其是编码这一早期、劳动密集的阶段,适用于希望以 LLM 辅助初步归类的定性研究者与需要处理大量文本的团队。作者强调结果不应被理解为 LLM 可以取代人类的定性判断,人类研究者仍需承担语境解释、验证与理论建构;同时作者把结论限定为“case-specific”,即针对本案例情境。

作者指出本研究依赖单一模型、缺少明确的金标准,且每个变量仅由一名人类编码,因此人机一致性的解释需要谨慎;未来可探索不同模型、不同提示策略,以及每个变量配置更多人类编码者的评估方式。此外,表 1 中“无障碍性提升”变量的主题列出现 NA,原因是负责该变量的编码者缺少主题编码,这一空缺会影响对该变量主题层面一致性的判断。

来源