跳到主要内容
返回时间线
Applied Intelligence来源发表:

面向无监督词义消歧的上下文感知语义相似度测量

核心概要

该研究提出一种面向无监督词义消歧的上下文感知语义相似度(CASS)方法:给定目标词、其上下文与排除表,把上下文与「用某个候选同义词替换目标词后的上下文」分别编码为向量,选取使余弦相似度最大、即语义改变最小的候选同义词作为词义判定,并在由维基百科构建、仅含名词、覆盖20个词、共10,196个实例的CoarseWSD-20基准上以准确率与随机选项基线(43.73%)和最频繁词义基线(73.43%)比较;基于BERT嵌入的配置取得最高77.74%(7,927次命中),是唯一超过强基线的配置,USE(71.94%)、ELMo(68.75%)与WMD(60.00%)均超过弱基线但未超过强基线。

Source-provided article image: Context-aware semantic similarity measurement for unsupervised word sense disambiguation
Fig. 1

Fig. 1 Results obtained for the CoarseWSD-20 dataset using UWSD+BERT. The solid blue bar represents the results obtained. While the black and red colors represent the weak and strong baselines, respectively

· 第 11 页

深度剖析

提出 CASS 判定流程:给定词 w、上下文 C 和排除表 E,把 C 与「用候选同义词 s_i 替换 w 后的上下文 C_si」分别编码为向量,取使「1 减余弦相似度」最小的候选作为结果。 此前语义相似度度量多依赖词的固有特征或语料共现,未把「替换之后上下文的变化」当作判定依据;本文把该判据形式化为式(3),并接入预训练 transformer 嵌入来实现无监督词义判定。 该方法为形式化定义,并配以四个嵌入族(BERT、ELMo、USE、WMD)及其多个具体模型的对照实验;作者报告在 CoarseWSD-20 上所有配置均超过弱基线,其中仅 BERT 配置超过强基线。

在 CoarseWSD-20 上,基于 BERT 的 CASS 配置取得 77.74%(7,927 次命中)的最高准确率,高于需要外部知识的 MFS 强基线 73.43%。 作者称该结果在未使用任何标注训练数据或外部知识的情况下超过强基线;同族中 all-mpnet-base-v2(77.74%)、all-MiniLM-L12-v2(75.05%)、all-MiniLM-L6-v2(74.63%)三个模型均高于 MFS。 单一基准上的准确率对比,报告命中数与百分比(表1、表2);作者同时说明尚未发现该任务上其他已发表的无监督 WSD 结果可供横向比较。

同族内比较显示嵌入选择是关键变量:USE 最佳为 71.94%、ELMo 最佳为 68.75%、WMD 最佳为 60.00%,均高于弱基线 43.73% 但未超过 MFS 的 73.43%,其中 USE 的 Large 模型最接近基线。 此前工作多把「引入上下文」本身视为提升来源,本文通过跨四个嵌入族、逐模型的列表,呈现同一 CASS 流程在不同嵌入下的表现差异。 表3、表4、表5 逐族列出多个模型的具体命中数与准确率,属于同一流程内的可比对照;作者亦指出不同模型排序优劣的原因尚待进一步分析。

评测设定为:使用 CoarseWSD-20(源自维基百科、仅含名词、20 个词、每词 2 至 5 个粗粒度义项、共 10,196 个实例),以准确率为指标,按用例与整体分别报告,并公开源代码。 作者强调方法完全无监督,因此刻意不与使用训练样本的方案比较,只与弱基线(随机选项)和强基线(最频繁词义)对比,并说明对部分映射类别做了适配以便消歧。 数据集与指标在正文中明确描述,基线覆盖弱(随机)与强(最频繁词义)两类,并附逐词图表与全局汇总表。

启示与展望

该工作让无标注数据条件下的词义判定可以借助现成的上下文嵌入来完成:对缺少标注的低资源语言,以及检索、文档分类、问答、文本摘要等依赖语义相似度的场景具有直接参考价值;其结论设定在英语名词、CoarseWSD-20 的粗粒度义项(每词 2 至 5 个)与准确率指标之下。作者提出的后续方向是整合更多上下文来源,或与其他 WSD 技术结合;开源代码也便于把这一「同义词替换—嵌入相似度」流程迁移到其他嵌入模型或语料上。

作者指出该方法依赖上下文质量:上下文噪声较大或过于稀疏时,消歧准确率可能受到影响;不同嵌入模型之间排序差异的原因未作解释,作者把更深入的分析列为未来工作。就本次阅读而言,正文以文本形式给出图1 至图4 与表1 至表5,图中逐词柱状分布的具体数值无法在正文中逐项读出,逐词准确率细节以及是否做过显著性检验需要回到原图核对。另有两点值得留意:粗粒度词义的映射类别经过适配处理,以及文中未列出同任务其他已发表的无监督结果作横向对照。

来源