对 55,393 条热搜查询的 40 天测量显示:Google AI 概览触发率 13.7%、问题式查询达 64.7%,98,020 条原子论断中 11.0% 缺乏引用来源支持
核心概要
作者用部署在 AWS Lambda 上的 Puppeteer 爬虫,在 2026 年 3 月 13 日至 4 月 21 日的 40 天窗口内对 19 个主题类别的 55,393 条 Google 热搜查询进行大规模纵向测量,发现 AI 概览整体触发率为 13.7%(问题式查询升至 64.7%),被引用域名的可信度高于同页展示的第一页结果但 29.8% 根本不出现在第一页,把回答拆成 98,020 条原子论断后 11.0% 不被所引页面支持(以遗漏为主),且至少 50.6% 的被引页面带有展示广告。
Figure 1: Our approach to characterizing the Google AIO ecosystem: (1) We begin by extracting top search queries from Google Trends. (2) We develop a bespoke crawler to capture search results for these queries, including their AIOs and associated metadata (e.g., reference links). We then crawl the referenced pages to extract their content and detect the presence of advertisements. (3) We evaluate the quality of AIOs by assessing the credibility of cited references and the consistency of AIO claims with source content. Finally, we analyze the potential economic impact of AIOs on the web ecosystem.
· 第 5 页深度剖析
AI 概览的触发高度结构化:整体触发率 13.7%,问题式查询为 64.7% 而非问题式查询仅 9.5%,相差 6.8 倍;类别间相差 13 倍,从 Beauty & Fashion 的 3.5% 到 Hobbies & Leisure 的 46.1%,Politics(7.5%)与 Law & Government(9.6%)低于平均。 此前研究或局限于单一领域,或使用 AI 概览达到当前规模之前采集的固定查询集;本文首次在多样化、自然产生的热搜查询样本上同时刻画触发模式,并给出查询措辞与长度的独立效应(非问题式查询从单词的 9.9% 升至六词以上的 38.7%)。 基于 40 天内 55,393 条查询、7,583 次 AI 概览触发;问题式与非问题式的差异经卡方检验(χ² = 10,002.2,p < 10⁻³⁰⁰),类别差异来自 19 个类别的分层统计。
AI 概览引用的域名系统性比同页第一页结果更可信(PC1 均值 0.732 对 0.645,差 +0.087,95% CI [0.085, 0.089]),但 29.8% 的被引域名完全不出现在对应第一页,说明其来源池与 Google 自身排序算法不同。 这一结果与先前用分类式可信度指标得出“AI 概览来源质量更低”的研究方向相反;作者改用连续型 PC1 域名质量分,并额外刻画两个来源池的重叠度,指出 AI 概览并非第一页的简单重排。 37,020 条可匹配 PC1 的 AI 概览引用对 159,752 条第一页 URL(Welch's t = 80.9,p ≪ 0.001);19 个类别中 14 个经 Bonferroni 校正后显著且方向一致;离页引用质量更高(PC1 0.758 对 0.724,UGC 占比 3.4% 对 18.5%)。
把 7,491 个可验证 AI 概览拆成 98,020 条原子论断后,88.97% 与所引来源一致,11.03% 不一致:Omitted 6.98%、Incorrect 2.66%、Ambiguous 1.39%;遗漏而非编造是主要失败模式,且来源质量与论断保真度基本独立(r ≈ 0.045)。 Google 声称 AI 概览“一般不会像其他 LLM 体验那样产生幻觉”;本文用五类标注体系逐条核验论断与所引全文,给出可量化的不一致率,并显示改善来源质量本身不足以降低不支持论断比例。 流水线经人工标注验证:论断抽取精确率 98.26%、召回率 83.23%、F1 90.12%;核验器在分层抽样的 100 条判定上与人工一致 98 条,按标签频率加权总体准确率 95.6%,且从未把有据论断误判为 Incorrect 或 Omitted。
61,212 条被引 URL 中 30,994 条(50.63%)展示可见广告,而 7,583 个含 AI 概览的结果页中 164 个(2.16%)同时带有 Google 赞助搜索广告、39 个(0.51%)把赞助位放在 AI 概览之上,二者占据互不重叠的页面区域。 此前研究已记录 AI 概览带来的点击与流量下降,但未刻画被引页面自身的变现结构,也未记录同一页面上 Google 自有广告库存是否被保留;本文把这两侧放在一起测量。 基于 40 天窗口内全部 61,212 条被引 URL 的 DOM 解析(EasyList 规则)与全部 7,583 个含 AI 概览结果页的赞助广告识别;作者说明 50.63% 是下界,因为占引用 14.2% 的社交与视频平台未被抓取、按无广告计。
启示与展望
这项工作为后续测量提供了可复用的基线:触发率、来源质量、论断保真度与广告暴露四类指标都可以在同一套爬虫与核验流水线上重复执行,因此适合被监管机构、独立审计者、新闻与平台研究者用来追踪系统随时间的演变。结果适用于美国本地化的 Google 搜索、以热搜查询为入口、2026 年 3 月 13 日至 4 月 21 日这一窗口内的 AI 概览行为;作者也指出,商业意图查询在其样本中被低估,而这类查询正是赞助广告最密集的场景。对出版方而言,可直接使用的是被引页面的广告占比与类别分布;对读者而言,可直接使用的是问题式查询与长查询更易触发 AI 概览这一结构性事实。
作者自己列出若干尚待回答的问题:研究测量的是 AI 概览说了什么、引用了什么,而不是用户拿它做了什么——错误是否转化为信念、用户是否会寻求更正、在健康与政治这类高风险话题上后果是否更严重,都还没有答案;AI 概览行为在不同用户画像、个性化状态与地理情境下如何变化也不清楚。方法层面,社交与视频平台未被抓取,作者据此把 11.0% 的不一致率视为上界,并在最宽松假设下估计残余不一致率约为 5.3%;Climate 与 Jobs & Education 的低保真度被作者归因于实时数值(天气、停课)在抓取时已变动,属于流水线层面的失败模式而非真实的 AI 概览质量问题,因此 9.64% 的 Omitted 与 Incorrect 合计应读作实质性不忠实的保守上限。此外,赞助广告共现率 2.16% 反映的是以信息型与热搜查询为主的样本,商业意图查询空间中的情况仍需另行测量。
