GateScope 黑盒审计 10 家商用 LLM API 网关:部分平台对 gpt-5 的模型识别率低至 13.09%,o*ey 账单高出预期 62.8%
核心概要
作者提出 GateScope 这一仅依赖公开 API 的轻量黑盒审计框架,从响应内容、多轮对话一致性、计费准确性和延迟特征四个维度评估 LLM API 网关,在官方端点验证中 24 个模型的平均 F1 为 0.968±0.085,随后审计 10 家商用网关,发现部分平台对 gpt-5 的模型识别率低至 13.09%、多轮记忆检查点通过率下降、o*ey 的 gpt-4o 账单高出预期 62.8%,以及 b*ie 的延迟变异系数明显偏高。
Figure 1: Overview of LLM API gateway architecture and the
· 第 2 页深度剖析
GateScope 用结构化探针与行为签名向量(答案质量、推理结构、规模、风格、解析质量五类特征)训练每个模型的 one-vs-rest XGBoost 分类器,从而在不知道网关内部实现的情况下判断响应是否来自所声称的模型。 以往 LLM 指纹工作(如 LLMmap、指令指纹、UTF、AuditLLM、FDLLM)主要针对模型本身或下游产物,本文把审计对象换成第三方商用网关,并强制 JSON 输出以降低自由文本噪声。 在官方厂商端点上,24 个模型的平均 F1 为 0.968±0.085,多数超过 0.95;对 5 个未参与训练的模型(Claude sonnet 4.5、Claude haiku 4.5、Qwen-plus、Qwen-turbo、DeepSeek-V3.2-Exp)没有出现误判为已知模型的情况。
在 10 家商用网关的响应内容审计中,多个平台对特定模型的识别率显著低于官方基线,提示可能存在模型替换或降级。 论文把“是否真的用了所声称的模型”从传闻变成可量化的比例:每个百分比基于每个模型 275 条响应。 官方基线对 gpt-4o、gpt-5、Gemini-2.5-pro、Claude Sonnet 4.0 的识别率分别为 98.18%、97.09%、96.00%、97.09%;而 b*ie 对 gpt-5 仅 13.09%,a*yi 对 gpt-5 为 48.00%,多个平台低于 60%。
25 轮对话模板配合记忆检查点、system_fingerprint 计数与缓存命中率,揭示网关在长上下文中的记忆保持与基础设施行为差异。 把多轮一致性拆成可观测的三个指标,并利用 system_fingerprint 变化和缓存率下降作为模型切换的辅助信号。 gpt-4o 官方基线在 T10/T24/T25 全部通过、仅 1 个指纹、缓存率 48.7%;a*yi 在 gpt-4o 上 T24 仅 1 次通过、指纹数为 4、缓存率 4.2%;o*ey 对 gpt-4o-mini 在 T24/T25 通过率高于基线但缓存率为 0.0%。
计费审计按公开单价与网关自报 token 用量计算预期成本并与实际扣费对比,发现少数平台存在明显偏差。 把“账单是否可信”变成可复算的差额百分比,并单独处理缓存 token 的定价。 gpt-4o 上多数网关差额为 0.0%,a*ix 为 +7.6%,o*ey 为 +62.8%;扩展表中 gpt-5 在 a*ix 为 +14.8%、在 o*ey 为 +15.0%,gemini-2.0-flash-lite 在 o*ub 为 +19.3%。
启示与展望
GateScope 面向普通客户端,通过公开 API 检测可观测的一致性缺口与支持性信号,而不是推断网关内部实现。它适用于使用 OpenAI 兼容接口、需要验证所声称模型、长上下文记忆与账单是否可信的开发者与企业采购方;论文明确把结果定位为某一时点的快照,而非对具体服务的长期排名,并已对平台做匿名化处理。
延迟被作者定位为支持性信号而非直接证据,因为高变异也可能来自网关负载或网络条件;所有延迟测量来自单一固定观测点,应视为时点观测。多轮与计费结果基于每个模型每个网关 5 次重复,属于快照性质。论文对 a*yi、o*ey 等异常给出的解释是“可能”的几种机制,尚未归因到具体内部行为;未来工作包括多观测点、长期连续监测以及扩展测量维度以更好归因。
