生成式辟谣:用大语言模型自动生成气候变化虚假信息的“真相三明治”式反驳
核心概要
本研究提出“生成式辟谣”框架,将气候变化反智主张分类(CARDS)与谬误检测(FLICC)整合进大语言模型的提示流程,使模型接收一条气候迷思后输出符合“事实—迷思—谬误—事实”(真相三明治)结构的辟谣文本;作者用三种复杂度递增的提示策略分别搭配GPT-4、Palm2与Mixtral,并由四位作者(含一位气候虚假信息专家)对20条迷思生成的60份辟谣按事实、谬误、结构分项评分,结果显示GPT-4配简单提示与Mixtral配结构化提示表现较好,谬误解释得分普遍高于事实部分,且非专家标注者与专家之间在事实质量上一致性较差。
Figure 2: Overview of our dynamic prompting approaches. Left: Single prompt with dynamic fallacy prediction (FLICC) and example retrieval (CARDS). Right: Structured prompt with additional ReAct component (Fact 1) and FEVER evidence retrieval (Fact 2). External resources are shown as diamonds, and shared components between the two approaches are highlighted in green.
· 第 4 页深度剖析
首次将谬误检测整合进端到端的、有心理学依据的结构化辟谣系统,输出严格遵循“事实—迷思—谬误—事实”的真相三明治格式。 以往自动事实核查多把问题简化为真伪分类,或仅从支持/反驳文档中抽取解释性事实;本文把CARDS反智主张分类与FLICC谬误检测嵌入提示框架,直接生成自由文本辟谣。 作者自述“据我们所知,我们是首个将谬误检测整合进端到端系统用于心理学依据的结构化辟谣”,并给出完整提示模板(附录表5至表11)与系统架构图(图2)。
三种提示策略与三个模型的组合在20条未见过的气候迷思上均能100%遵循真相三明治结构,但事实质量是主要短板。 结构合规性并非难点,难点在于生成既正确又与迷思直接相关的事实;作者指出“缺乏事实性与相关性”是即便最新大语言模型也存在的重要不足。 四位作者(含一位气候虚假信息专家)对60份辟谣独立盲评,按1至3分对事实1、谬误、事实2分项打分;作者报告所有模型结构合规率100%,并据此不再报告该分数。
GPT-4配简单通用提示与Mixtral配结构化上下文提示整体优于Palm2配单条上下文提示;Mixtral在谬误解释上得分最高,GPT-4在事实生成上(尤其按专家评分)更好。 说明结构化提示可让开源模型在辟谣任务上接近专有大模型,为低成本、可广泛部署的自动辟谣提供路径。 表3给出全部标注者、非专家(n=3)与专家(n=1)的平均分:GPT-4事实均值2.28、谬误2.44;Palm2事实1.91、谬误2.20;Mixtral事实2.25、谬误2.55。
非专家标注者在评估辟谣事实时与专家一致性差、且系统性更乐观,容易被具体但未必相关的事实说服。 揭示自动辟谣系统评估本身需要领域专家参与或密切监督,因为非专家用户难以察觉系统缺陷。 表1显示事实部分一致性普遍偏低(如Mixtral事实1与专家Gwet AC1为0.09),谬误部分一致性明显更好(GPT-4谬误与专家Gwet AC1为0.66);作者举例说明非专家给Mixtral含“仅0.3°C”等具体细节的事实打高分,而专家判其不相关。
启示与展望
该框架面向气候迷思的自动辟谣研究场景,适用于需要按“事实—迷思—谬误—事实”结构批量生成反驳文本的探索性用途;作者明确将其定位为研究工具,用于在受控环境中收集用户体验并推动后续工作,而非面向广泛部署。对希望复用该方法的读者,其价值在于提示设计、外部知识检索(FLICC、CARDS、CLIMATE-FEVER)与评估量表的组合方式,而非直接产出可发布内容。
作者未系统区分模型选择与提示策略各自的贡献,也未穷尽所有提示与模型的组合,因此难以判断性能提升来自模型能力还是提示设计;评估仅覆盖20条迷思与四位标注者,且未系统考察模型在常见迷思与新颖迷思上的差异,作者观察到强模型在广为人知的迷思上表现更好、在较少见的迷思上有时生成不相关事实或错误分类谬误;此外,本文假设所有输入均为非事实性内容,未评估模型区分迷思与事实的能力。读者可关注后续工作如何提升事实的具体性与相关性,以及如何用专家监督弥补非专家评估的局限。
