跳到主要内容
返回时间线
arXiv来源发表:

南京大学团队发布DSEBench:首个同时支持“关键词+示例数据集”检索与字段级解释的数据集搜索测试集

核心概要

该工作提出并形式化了“带示例的数据集搜索”(DSE)及其可解释扩展(ExDSE)任务,构建了首个同时提供数据集级与字段级人工标注的测试集DSEBench(141个测试用例、7,415个三元组,另含5,699个训练用例、122,585个三元组),并用大语言模型生成大规模训练标注,最后适配并评测了多种检索、重排与解释方法以建立基线。

Source-provided article image: DSEBench: A Test Collection for Explainable Dataset Search with Examples
Fig. 1

Fig. 1: An example of ExDSE. Left: The user submits a query and a target dataset. Right: The system aims to return positive candidate datasets that ex- hibit both relevance to the query (highlighted in yellow and green) and similarity to the target dataset (highlighted in magenta, cyan, and gray), as opposed to negative ones that are only relevant to the query or only similar to the target dataset. These judgments are supported by specific metadata and content fields.

· 第 2 页

深度剖析

论文把“关键词查询+若干目标数据集示例”这一信息需求形式化为DSE任务,并进一步要求给出候选数据集中被判定为相关或相似的字段,形成ExDSE任务。 此前数据集搜索分为关键词检索与相似数据集发现两条独立路线,已有测试集(如NTCIR、ACORDAR、WTR)只面向关键词输入,且只提供数据集级标注,无法评测同时依赖查询与示例、并要求字段级解释的场景。 任务定义在引言中明确给出,并以图1的教育类数据集示例说明正例需同时满足查询相关与目标相似,负例只满足其一;字段级要求以“identifying ... a subset of its metadata or content fields”形式写入定义。

DSEBench在NTCIR英文子集(46,615个数据集、92,930个数据文件)基础上构建,为每个数据集定义title、description、tags、author与从数据文件抽取的summary五个字段,并生成内容摘要以支持检索与人工标注。 已有测试集未把数据文件内容纳入统一字段表示;该工作按文件真实格式(用python-magic检测)分别抽取表头、摘要或键/标签/谓词,其中CSV表头抽取在50个随机样本上准确率92%,XLSX/XLS在100个样本上为91%,文本摘要用bart-large-cnn生成。 字段定义、格式分布表(PDF占51.02%等)、摘要生成流程与抽样准确率均在正文中报告;摘要字段在后续解释评测中被证明具有与title、tags相当的选择频率。

测试用例由NTCIR中141个高相关查询-数据集对改编而来,经池化得到7,415个待标注三元组,由24名有数据集搜索经验的学生按0/1/2分级标注查询相关性与目标相似性,并对相关或相似的数据集标注指示字段。 这是首个同时提供数据集级与字段级真值的DSE测试集;标注采用两人独立标注、分歧交由第三人多数表决的流程,Krippendorff's α为查询相关性0.51、目标相似性0.52,高于NTCIR报告的0.44。 标注人数、分级标准、仲裁流程、一致性统计与判定分布(68.19%不相关、52.47%不相似、9.94%高相关、14.16%高相似)均在正文与表2、表3、图3、图4中给出。

训练侧用GLM-3-Turbo对337,976个三元组自动标注,经启发式过滤后保留122,585个完整标注三元组(5,699个训练用例),并在实验中表现出接近人工标注的训练效果。 在人工标注成本高、训练数据稀缺的背景下,该工作给出了一条用LLM扩充训练数据并做质量控制的路径;过滤后抽样人工检查显示查询相关性与目标相似性判断准确率从73%和69%提升到85%以上。 质量控制的规则、抽样检查规模(3,378个三元组)与准确率变化均有报告;检索评测中五折划分与标注者划分的性能差异很小,作者据此认为LLM标注“almost as effective as human annotations for training”。

启示与展望

该测试集面向数据集搜索的研究与评测场景:可用于训练和比较检索、重排与解释方法,适用于需要同时考虑关键词查询与目标数据集示例、并要求给出字段级依据的任务。作者已把测试集发布在Zenodo、基线代码发布在GitHub,并计划持续补充人工标注用例、申请在ISWC或IR会议举办相关挑战或共享任务,以及把方法扩展到以RDF数据集为中心的其他测试集。对使用者而言,它适合作为可复用的评测基准与弱监督训练数据来源。

测试用例中每个查询只对应单个目标数据集,多目标数据集的评测设定尚未覆盖;池化仅通过把查询与目标数据集字段拼接来扩展查询,未分别评估查询相关性与目标相似性;目标相似性标注采用与上下文无关的通用相似性概念,实际用户情境下的判定标准可能不同。此外,LLM标注的字段级判断未做过滤,其错误模式被作者描述为较复杂、难以检测;训练用例的分布虽与测试用例大体相似,但两者标注来源不同。这些是读者在复用该测试集或比较基线结果时可以继续关注的方向。

来源