丹麦议会近五百万句辩论显示:指责在2016年前下降后持续攀升,且右翼极端政党升温最猛
核心概要
该研究用自建分类器 BlameBERT(宏平均 F1 为 0.80)标注丹麦议会 1997 至 2026 年约 493.8 万句发言,并以多层统计模型分析,发现指责呈“香蕉形”轨迹——先降至 2016 年 4 月的低点、随后显著加速上升,执政身份持续压低指责(即“政治对照”),而这一效应受意识形态调节,右翼政党在野时指责随意识形态极端程度上升得更强,近年这一交互进一步加剧。
深度剖析
研究构建了面向丹麦政治语境的指责检测模型 BlameBERT,并在人工标注测试集上取得宏平均 F1 为 0.80、平均召回 0.81、平均精确 0.80 的表现。 作者称这是首个用于丹麦政治语境指责检测的模型,并配套发布代码、模型与数据集;训练标签由机器翻译加零样本 NLI 模型 DEBATE 生成,形成从 DIAL-1 到 DIAL-5 的“一致性递增数据集”,最终选用最保守的 DIAL-5。 测试集为 424 句人工标注样本(148 句为指责,占 34.9%),两名标注者一致率 84.8%(Cohen's Kappa 0.676),仅保留双方一致的句子;与 Qwen 3 嵌入基线(宏 F1 0.67)和 Qwen 3.5 生成基线(宏 F1 0.75)相比,BlameBERT 的宏 F1 更高,且按政党检查未发现系统性误差。
1997 至 2026 年间,议会指责呈“香蕉形”轨迹:先下降,在 2016 年 4 月达到最低点,随后加速上升。 这为“政治话语是否变得更敌对”这一长期争议提供了议会场景下的量化证据,而既有实证多来自社交媒体;作者指出时间点与丹麦 2015 年移民危机后修辞趋硬的说法相吻合。 基于负二项混合效应模型的似然比检验,加入时间线性项与二次项均显著改善拟合,二次项系数显著为正;对 2019 至 2026 年的单独建模也显示显著的正向线性趋势。
执政身份持续压低指责,即作者所称的“政治对照”:执政的左翼政党指责量仅为左翼在野党的约一半。 该效应在全时段与近年子样本中均成立,且在加入议题控制后几乎不变,说明它更可能反映修辞框架差异而非议程构成差异。 全时段模型中政府身份系数显著为负;近年模型中同样显著为负。补充分析用 ManifestoBERTa 对 84,581 条发言做议题分类,执政党与在野党的议题分布相近,控制议题后政府身份系数几乎未变。
意识形态调节了政治对照效应,且这种调节在近年加剧:右翼政党执政时的“指责抑制”更弱,意识形态越极端指责越多,这一放大效应在右翼更强。 作者称结果部分支持既有关于极端政党更常指责的发现,但指出该效应只在右翼成立;近年右翼“意识形态极端度”每增加一个单位带来的指责增幅比左翼更大,提示一种集中在右翼的意识形态硬化。 全时段模型中政府身份与右翼的交互、右翼与极端度的交互均显著;近年模型中右翼与极端度的交互显著且强度高于全时段。敏感性分析显示所有效应方向在各阈值下保持一致,唯一例外是全时段模型中政府身份与意识形态翼的交互在最严格阈值下不再显著。
启示与展望
该研究适用于丹麦议会 1997 至 2026 年的发言记录,以及 13 个在分析时仍活跃于丹麦本土的政党;其分类器与标注流水线面向低中资源语言的议会文本,方法框架可被其他议会语料借鉴。对读者而言,这项工作的价值在于把“政治话语是否变敌对”的争论从社交媒体扩展到制度性场景,并给出可复用的模型与数据资源,使后续研究能在同一测量基础上比较不同国家、不同时期或不同制度环境下的指责动态。
分类器只识别“是否存在指责”,不识别指责的对象,因此高指责率的政党也可能主要指向欧盟、疫情或全球市场等非党派目标,这与本文理论框架强调的对手指向型政治对照是不同现象。训练标签经由丹麦语到英语的机器翻译再交由以英语政治文本为主的 DEBATE 生成,反讽、间接表达与语言特定习语可能受影响,BlameBERT 也可能继承这些系统性偏差。翼与极端度是仅随 13 个政党变化的时间不变变量,有效样本量接近 13 而非全部观测数,且两者源自同一份专家调查指标,存在信息重叠。近年子样本较小,且涵盖疫情与多次政府更替。此外,本次加载的文本中部分数值(如各 DIAL 的指责占比、部分系数与标准误)在表格中缺失,若需精确复现具体效应量,仍需查阅原文附录。
