EvoOntology:让数据智能体拥有可自我演化的本体层
核心概要
该工作提出 EvoOntology,把本体封装为 MCP 服务器(含 schema、content、tool 三层),由 builder agent 通过探测查询构建初始本体,再用归因引导的类型化编辑与骨干条件配对评估持续演化本体,在 DDR-Bench、InsightBench、BIRD 三个数据智能体基准和六个 LLM 骨干上一致优于 ReAct 基线与静态语义层基线。
深度剖析
提出首个面向数据智能体的自主交互式本体层,并封装为 MCP 服务器,使智能体在运行时主动查询本体而非被动接收上下文元数据。 相对直接把原始数据源交给智能体探索的 raw querying 方法,以及把人工构建语义层整体注入提示的 semantic-layer 方法,这里把本体拆成 schema 层(对象类型与引用规则)、content 层(Terms、Mappings、Constraints、Evidence 四类节点与 Semantic Relations、Structural References 两类边)和 tool 层(browse、resolve 两个 MCP 工具加 session manifest),只把 manifest 放进提示,详细记录按需检索。 论文给出架构描述与 DDR-Bench 上的对比:Baseline + SL 在 Claude-Sonnet-5 上反而下降,而 EvoOntology 在六个骨干上均提升,作者将差异归因于静态提示片段无法按轮裁剪、而 MCP 工具可按当前步骤检索。
引入 builder agent 与自演化循环:先由工作负载引导的探测查询构建有证据支撑的初始本体,再通过轨迹归因、单层局部干预和骨干条件配对验证持续精炼。 相对静态、人工维护的语义层,这里把本体维护变成由智能体交互轨迹驱动的闭环,且每次候选编辑只改动 Content、Tool、Schema 中的一层,并须在同一验证集上以相同解码与交互预算超过父版本才被接受。 消融显示去掉 gate 的 Traj-Wise 下降最大,去掉 attribution 次之,去掉 diagnose 与改用自由形式改写下降更小,作者据此称 gate 与 attribution 是承重环节;三个可编辑层级单独使用时均不及三层联合。
在三个数据智能体基准上一致提升,且提升来自初始本体与后续演化的叠加。 相对无本体基线与静态语义层基线,EvoOntology 在 DDR-Bench 的 Trajectory-Wise 上六个骨干全部提升,在 InsightBench 的 Overall 与 BIRD 的 EX、VES 上每个骨干均有提升。 DDR-Bench 上 GPT-5.5 的 Traj-Wise 从 64.2 升至 90.9、GPT-5.6-sol 从 68.5 升至 93.5;BIRD 上 Claude-Opus-4.8 的 EX 从 67.5 升至 78.3;InsightBench 增益较小,作者解释为 Insight 按简短参考答案评分、对齐后趋于饱和。
本体层在降低总 token 成本的同时提升表现,且不同骨干演化出不同本体。 相对基线,本体层增加了每轮输入 token,但缩短了轨迹轮数,从而降低每任务总 token;跨骨干迁移实验显示把某个骨干演化出的本体用于其他骨干时性能下降。 附录报告 Baseline 每任务 52.6K token、14.6 轮,Evolved 为 42.0K token、8.4 轮,同时 Traj-Wise 从 69.5 升至 89.5;跨骨干 Jaccard 重叠均不超过某一上限,对角线为各列最高值,非对角线至少下降若干点。
启示与展望
该结果面向需要在异构数据源(关系数据库、半结构化文件、非结构化文档)上完成自然语言任务的数据智能体,适用于本体可由探测查询与交互轨迹自动构建和精炼、且存在留出验证集用于配对评估的场景;论文的验证覆盖 DDR-Bench 的 10-K 场景、InsightBench 与 BIRD 的 Oracle Knowledge 设置,以及 GPT-5.5、GPT-5.6-sol、Claude-Sonnet-5、Claude-Opus-4.8、DeepSeek-V4-Flash、Qwen3.5-Flash 六个骨干。
论文正文以摘要与章节文本形式加载,图表数值在文本中多处以占位形式出现,因此部分具体增益数字只能从表格中读取;跨骨干迁移的语义等价性作者也指出仅凭标识符重叠无法判定。此外,演化在最后两轮趋于平坦,作者解释为失败签名变少,这一收敛行为在其他数据源与任务分布下是否同样出现,仍是值得继续观察的问题。
