同一智能体框架四次运行生成的客户反馈分类树全部通过通用检查,却出现97.7%–100%叶名复述祖先、分支泄漏达76.4%
核心概要
该研究在两个专有客户反馈语料(1,940与5,000条记录)上构建六套分类树——每语料一套生产参考树与同一智能体框架的两次重复运行——发现六套全部通过通用命名与结构检查,但生成树中至少97.7%的叶名只是复述祖先名称,且一套生成树中四分之三记录落入多个顶层类别;作者据此提出两组无需LLM评判的整树指标:结构判别指标与团队可划分性指标。
Figure 3: Branch leakage and co-occurrence modularity (Q,
arXiv · 第 6 页深度剖析
通用、逐节点式的LLM评判检查无法发现整树层面的失效模式:模板化标签坍缩、生成器强加的分支上限、跨团队碎片化。 既有分类树评估(名称-描述匹配、描述完整性、层级正确性、兄弟区分度)每次只看一个节点、一条边或一对兄弟,而这三类失效都不是任何单个节点的属性。 六套分类树(两语料各一套生产参考加两次同框架重复运行)全部通过全部通用检查:描述完整性均为1.00,名称-描述匹配0.97–1.00;C-1的层级正确性为1.00,C-2为0.92。
生成树的叶名几乎全部由祖先名称拼接而成,而参考树并非如此。 作者提出祖先包含率与词型-词例比(TTR)等结构判别指标,把“标签是否提供超出祖先的信息”变成可计算的整树统计量。 四套生成树的祖先包含率为97.7%–100%,两套参考树为13.9%与2.9%;TTR在小样本上坍缩2.5–4.4倍、大样本上2.0–2.7倍;四套生成树的跨分支复用均为0,参考树分别为48与73个共享节点。
生成树的分支无法把记录流划分成团队可独立负责的组,且这一差异在通用检查看来不可见。 作者提出团队可划分性指标族(分支泄漏、记录纯度、共现模块度、可划分性),把“互斥性”这一节点级设计规范落到记录级可计数违规上。 参考树L1泄漏为19.8%与19.3%,生成树为34.7%–76.4%;C-2的L1模块度为0.12且L2为负值,即其分支边界比随机划分更差;C-1与C-2在层级正确性上仅差0.08,却在泄漏上相差27个百分点并出现模块度符号翻转。
更深的覆盖度检查反而奖励了这些失效模式:按文档术语逐条造节点是提高覆盖度最廉价的方式。 产品术语覆盖度是唯一一项生成树超过参考树的检查,作者指出它与整树结构质量方向相反。 小样本上生成树覆盖度0.74–0.86对参考树0.72,大样本上0.90–0.91对0.80;泄漏最严重的C-2在小样本上覆盖度最高(0.86)。
启示与展望
该工作面向以客户反馈分类树作为生产工件、并需要把顶层分支分配给不同产品团队的场景:指标只需分类树工件(结构判别指标)以及该工件自身的记录分类(团队可划分性指标),无需LLM评判,也无需金标准分类树,因此可直接用于任何满足同一输入契约的分类树工件。作者指出,参考树(Live)由数据方自有流水线构建,其流水线本就围绕类似结构检查设计,故其良好表现部分来自构造方式;无混淆的证据来自同一框架内生成运行之间的对比。后续方向包括时间稳定性、第二类框架、阈值调优以及构建时的插入门禁。
所有生成运行只使用一个框架,框架多样性尚未检验;上限可疑阈值在真正窄分支上可能误报,在大样本参考树上确实出现一次;词型-词例比对规模敏感;泄漏、纯度与模块度依赖各工件自身的记录分类,因此评估的是分类树加分类器的系统;两组指标均未与团队速度等外部有用性信号对照验证;表1中所有指标均为LLM评判且无人际一致性研究。语料、工件与文档为专有客户数据未公开,表2与表3无法被独立重算,但公式与协议已完整给出,可据论文重新实现。
