跳到主要内容
返回时间线
ORBi UMONS来源发表:

GHAgentFiles:GitHub 仓库中编码智能体文件历史数据集

核心概要

该工作构建并公开了 GHAgentFiles 数据集与开源提取工具 cofee,从 165,281 个候选 GitHub 仓库中识别出 27,717 个含编码智能体文件的仓库,提取出 142,294 条上下文、技能与子智能体文件历史(共 401,873 次文件修订、185,795 次提交,时间跨度自 2022 年 11 月 22 日至 2026 年 7 月 1 日),并给出初步观察性分析,显示编码智能体文件自 2025 年初开始出现、2026 年初出现新增与修改的峰值,且通用 AGENTS.md 已成为最流行的命名实践。

Source-provided article image: GHAgentFiles: A dataset of coding agent file histories in GitHub repositories
Figure 1

The heatmap of Figure 1 quantifies how file revisions in the

· 第 3 页

深度剖析

提供了目前规模最大的编码智能体上下文文件历史数据集,包含 142,294 条文件历史与 401,873 次修订,来自 27,717 个 GitHub 仓库,覆盖 Claude、Codex、GitHub Copilot、Gemini、Windsurf 与 Cursor 六个智能体。 相较此前研究(如 453 个仓库、2.3K+ 文件、4,768 个文件或 4,738 个仓库的数据集),该数据集在仓库数量、文件历史数量与时间跨度上都有明显扩展,作者称其为“largest dataset of context files covering the largest period of time”。 数据规模由明确的提取流程与统计表支撑(表 III 列出各快照的仓库、历史、提交与修订数);数据集经随机抽取 666 个文件、三位作者独立标注验证,评分者间一致性为 92.4%,无人回答“No”。

提出并开源了 CLI 工具 cofee(COntext File Extraction Engine),通过 .toml 配置中的 glob 式路径规则自动识别并提取上下文、技能与子智能体文件及其 git 元数据。 此前研究多依赖各自构建的有限数据集,该工具使数据集可被复现、扩展与复用,作者称其可“alleviating the error-prone and time-consuming nature of producing such datasets”。 工具行为在文中以命令形式(cofee -c config.toml repo)、配置示例(Listing 1)与遍历规则(first-parent rule、默认从 git HEAD 回溯)具体描述,并已在 GitHub 与 PyPI 发布。

对数据集做了初步观察性分析,发现编码智能体文件约自 2025 年初开始出现,2026 年初出现新增与修改的峰值,修改多于新增,删除与重命名较少;上下文文件数量在 2025 年 6 月后增长加快、2025 年 12 月再次加速,技能文件约自 2025 年 11 月起步,子智能体文件使用最少。 这些演化模式是在远大于既有研究的数据集上观察到的,作者称其“only scratches the surface”,并呼吁在此基础上复现与扩展既有研究。 结论基于图 2、图 3、图 4 的周度与月度计数曲线及指数回归拟合,属描述性观察,作者明确将其定位为“preliminary observational analysis”。

在最新快照中,通用 AGENTS.md 已成为最流行的命名实践(占全部文件修订的 45.7%),Claude 为最主要的非通用组(33.7%),Copilot 与 Cursor 较少;上下文文件中最常见的二级标题为 project overview、architecture、testing、commands 等。 这为“AGENTS.md 正在成为跨工具开放标准”以及上下文文件内容以项目结构、架构、测试与命令为主提供了大规模计数证据。 基于最新快照的 111,727 条文件历史与表 IV 的标题频次统计;标题分析仅覆盖二级标题(出现于 86.6% 的上下文文件中),属频次描述。

启示与展望

该数据集面向研究协作式 GitHub 仓库中编码智能体文件演化的实证研究,适用于需要跨仓库、跨时间比较上下文、技能与子智能体文件采用与维护模式的场景;其仓库范围限定为经 SEART 检索、创建至少一年、非 fork、至少 300 次提交且近一年有提交的项目,历史遍历仅沿主分支并遵循 first-parent 规则,因此结果适用于这类较活跃、较成熟的公开仓库。

读者仍需留意:文件识别配置基于对六个智能体文档的人工分析,文档可能过时、不完整或随时间变化,因此覆盖完整性无法保证;数据集仅沿主分支与 first-parent 路径,其他分支的提交未纳入;符号链接(1,086 个)在目标变更时不会随之修改,分析时需单独处理;观察性分析为描述性结果,未涉及因果;此外本次读取为不完整范围,图表与表格的完整细节可能影响对具体数值的进一步核对。

来源