系统提示中隐藏的当前日期让9个模型成绩波动,最高达14%并重排榜单
核心概要
该研究在9个近期大模型和6个数据集上固定其他配置、只改变系统提示中隐藏注入的当前日期(2024年全年逐日扫描),发现仅日期变化即可让多选问答准确率波动最高6%、数学推理最高14%、代码生成最高7%、机器翻译最高2.84 BLEU,模型排名随之改变,且该效应大于批大小与数值精度等已知非确定性来源,思维链提示不但不能缓解反而放大敏感性。
深度剖析
研究识别出一个此前被忽视的评测变异来源:API提供方与部分开源模型聊天模板会在用户不可见的层面把当前日期注入系统提示,而这一信息每天都在变化。 以往工作把大模型评测的不稳定归因于批大小、数值精度、硬件或提示格式,本文把时间变化的隐藏提示元数据单独列为一种来源。 作者在附录中说明该注入发生在模板层或服务端,并以Qwen3经OpenRouter调用时自行报出当前日期作为服务端注入的例证;同时说明并非9个模型都在默认模板中注入日期。
仅改变日期即可造成跨任务、跨规模的性能波动:多选问答最高6%,数学推理最高14%,代码生成最高7%,机器翻译最高2.84 BLEU,且模型排名会重排。 波动出现在执行判分的代码任务和整段输出判分的翻译任务上,说明这不是多选问答特有的假象,而是隐藏时间元数据下评测的普遍性质。 覆盖9个模型(Llama 3.1 8B/70B、Gemma 3 4B/27B、Qwen3 4B、Qwen3-Next 80B、Phi-4 14B、GPT-OSS 20B/120B)与6个数据集(MMLU、GPQA、ARC-Challenge、GSM8K、HumanEval、WMT英德/英芬/英捷),日期从2024年1月1日扫到12月31日;GSM8K平均差7.75%对多选问答平均2.52%,HumanEval平均4.81%、最高7.32%,翻译平均最高1.88 BLEU与1.33 chrF。
日期效应没有可固定的“好日期”,它表现为每个模型与数据集各自的噪声,并且比批大小、数值精度、GPU型号更大,与选项顺序和系统提示措辞改写的量级相当。 作者用相关系数与变异系数把日期效应与其他已知非确定性来源放在同一尺度上比较,并检验了日期是否在模型间或数据集间共享。 27个模型–数据集组合的日期与准确率Spearman相关中位数为0.02,跨数据集与跨模型相关中位数分别为0.03与0.01,同一日期让两者同向变化的比例为51%(接近随机);系统提示六种措辞带来的准确率变异系数为0.78%,与日期效应相同。
思维链与少样本提示都不能降低日期敏感性,思维链反而放大它;作者据此建议在可能时从聊天模板中移除日期,或固定日期并在报告中注明。 这否定了“显式推理或示例能让模型锚定、从而削弱表层元数据影响”的直觉,并给出可操作的评测协议建议。 在Llama 3.1 (8B)上对MMLU全年日期做思维链评测,观察到日期影响初始思维链token的选择并沿自回归路径级联;5-shot提示下各模型差距仍存在,平均准确率差2.27%,对比零样本的2.52%。
启示与展望
这项工作面向使用默认聊天模板或API服务进行基准评测的研究者与榜单维护者,适用于多选问答、数学推理、代码生成和机器翻译这四类任务,以及2024年这一时间窗口内的日期取值。它给出的下一步是:在可能时沿用模型默认模板与特殊token但去掉当前日期,或在无法移除时固定日期并把日期与结果一并报告;同时把置信度与校准作为与准确率并列的评测标准,用来标记容易随隐藏因素漂移的预测。
作者在局限性中说明,实验只覆盖一组选定的模型与数据集,专有模型验证仅限GPT-5.1的一周;日期以固定格式、固定位置注入,且只在2024年内变化,其他格式、位置或年份的敏感性仍待研究;对话、摘要等开放式任务尚未纳入。附录中关于其他元数据的初步实验显示,改变系统提示中的用户位置也能带来与日期效应量级相当的差异,这提示可能还有更多隐藏可变元数据值得考察。此外,本次读取的文本中多张结果表格的数值单元格为空,因此部分逐模型、逐数据集的精确数字无法在此复述,只能引用正文中明确给出的汇总数值。
