跳到主要内容
返回时间线
arXiv来源发表:

MITE 用 Python、C++、Java 三种代码格式指令微调并投票集成,在六个 BioNER 数据集上稳定超过 BERT 与 LLM 基线

相关研究与后续进展

核心概要

该工作提出 MITE,将生物医学命名实体识别重构为结构到结构的生成任务,把同一训练实例转写为 Python、C++、Java 等多种编程语言格式以提供结构多样的监督信号,无需外部生物医学知识或额外标注,并在推理时用实体级投票聚合不同代码格式的预测;在六个常用 BioNER 数据集上,MITE 稳定优于代表性 BERT 类与 LLM 类基线,并表现出较强的跨数据集泛化能力,消融与参数分析进一步验证了各组件的作用与稳健性。

Source-provided article image: Enhancing Biomedical Named Entity Recognition via Multiple Programming Languages Instruction Tuning and Ensemble Method
Fig. 1 ·

Fig. 1: Examples of performing structured BioNER task with NL and Code instructions. In contrast to prompting with NL instructions, we utilize structured Code instructions to mitigate the output discrepancy between the pretraining and inference stages.

arXiv

深度剖析

MITE 把 BioNER 从自然语言指令下的扁平文本序列标注,改写为代码格式的结构到结构生成任务,指令与实体输出都以代码表示承载。 既有指令微调方法通常把标注序列化为扁平文本,对带类型的实体抽取提供的结构约束有限;MITE 用代码格式替代这一序列化形式。 摘要层面的方法描述,说明指令与实体输出均采用代码格式表示,未给出具体模板细节。

同一训练实例被转写为 Python、C++、Java 等多种编程语言格式,在保持底层实体语义一致的前提下提供结构多样的监督。 以往缓解标注稀缺多依赖引入外部生物医学知识,而该路线需要昂贵的资源构建;MITE 不依赖外部知识或额外标注即可获得多样性监督。 摘要层面的方法描述,明确列出 Python、C++、Java 三种格式并强调语义保持一致。

推理阶段采用实体级投票策略聚合不同代码格式的预测,以降低语言特定差异带来的预测方差并提升稳健性。 单一序列化输出形式的学习会限制结构多样性并削弱模型稳健性,投票集成针对这一来源的方差进行抑制。 摘要层面的方法描述,未报告投票的具体实现或统计量。

在六个广泛使用的 BioNER 数据集上,MITE 稳定优于代表性 BERT 类与 LLM 类基线,并展现出较强的跨数据集泛化;消融与参数分析支持各组件有效且稳健。 相对既有 BERT 类与 LLM 类基线,该工作在多个数据集上取得一致的优势,并通过消融与参数分析检验组件贡献。 摘要层面的实验结论,未提供具体数据集名称、指标数值或效应量。

启示与展望

该工作面向生物医学命名实体识别这一结构化抽取任务,适用于标注资源有限、又希望利用 LLM 指令微调的场景;其方法设定为把训练实例转写为 Python、C++、Java 等代码格式并保持实体语义一致,推理时以实体级投票聚合多格式预测,因此不需要外部生物医学知识库或额外人工标注。摘要所述结论建立在六个常用 BioNER 数据集之上,并报告了跨数据集泛化表现,说明该方案面向的是多数据集、跨数据集的评测设置。对希望降低标注与知识构建成本的生物医学文本挖掘研究者与工程实践者,这一路线提供了可直接借鉴的监督构造与集成推理范式。

当前可见文本仅为摘要,缺少具体数据集名称、评价指标数值、基线配置、投票策略实现以及消融与参数分析的具体结果,因此无法判断优势幅度与在何种实体类型或文本领域上更明显。多编程语言格式之间的语义等价如何保证、代码格式监督是否对模型规模或预训练语料敏感,仍是值得关注的开放问题。此外,摘要未说明该方法在非生物医学领域或非实体抽取任务上的表现,其可迁移范围有待进一步验证。

来源