CCF自然语言处理与中文计算国际会议(NLPCC)是中国计算机学会自然语言处理专业委员会(CCF-NLP)的年度会议。NLPCC是自然语言处理(NLP)和中文计算(CC)领域的顶级国际会议。NLPCC是CCF推荐的计算机科学会议之一。它是学术界、工业界和政府的研究人员和从业者分享他们的想法、研究成果和经验,并促进他们在该领域的研究和技术创新的主要论坛。


论文标题:ProSide: Knowledge Projector and Sideway for Pre-trained Language Models

论文作者:何朝帆,卢葛威,申丽萍

论文链接:https://link.springer.com/chapter/10.1007/978-981-97-9434-8_5


论文简介:

在NLP任务中,利用外部事实知识增强语言模型是一个时常被提及的任务。虽然 BERT、GPT 这类预训练语言模型表现良好,但如果没有外部知识源,它们的事实准确性可能会受到限制。我们的研究聚焦于使用外部知识图谱这一特殊且常用的知识结构源,提升语言模型在知识驱动的下游任务上的性能。
当前融合知识图谱的方法主要分为几种:将外部知识集成到训练目标、模型输入、以及外部模块中,以实现知识注入。但这几类方法通常需要重复训练,或难以维持知识图谱的全部信息。
基于此,我们提出ProSide结构和预训练方式用于融合知识图谱到语言模型。此外我们还分析了知识结构在语言模型内部的一致性,用于更好地解释我们的工作。

任务定义与挑战

本研究旨在通过整合外部知识图谱到预训练语言模型中,增强模型在知识驱动的下游任务上的性能。这些任务包括实体关系分类、实体分类和知识问答等任务,它们要求模型能够理解和利用实体之间的关系以及实体的属性信息。
当前的主要挑战在于如何有效地将知识图谱中的结构化知识融入到预训练语言模型中,而不牺牲模型的性能或增加过多的计算成本。此外,现有的方法要么需要重新训练模型,要么难以保留知识图谱的完整信息,这限制了它们在实际应用中的有效性。

具体来说,当前研究可以分为以下几类:

  1. 将知识图谱融入到模型训练目标,类似于ERNIE、KEPLER这类模型,在预训练或微调过程中,将知识图谱三元组对齐到文本,并设计预训练任务,以提高模型性能。这类方法缺点是训练消耗大,效率低。

  2. 将知识图谱以prompt方式放在模型输入中,类似于RAG,效率较高,但是难以获取全局或结构性的知识图谱信息。

  3. 以外部模块形式注入模型,代表性的K-Adapter使用知识预训练的模块,注入到语言模型中。

ProSide使用预训练的两个模块的结合,实现参数高效、即插即用的知识图谱注入。

ProSide模型
ProSide模型:对于预训练语言模型的即插即用知识模块。
模型构成

ProSide模型包括两个主要模块:知识映射(Knowledge Projector)和知识旁路(Knowledge Sideway)。


知识映射负责将知识图谱中的实体嵌入从知识空间转换到语义空间,而知识旁路则在预训练过程中保留完整的知识图谱信息。ProSide模型能够适应不同的语言模型,从而无需重新训练,即可提高在下游任务上的性能。


预训练过程

ProSide模型的预训练过程涉及使用Wikidata20M和T-REx作为知识库,超过30M个三元组语料,以及BERT作为基础模型(但BERT本身参数冻结)。预训练的目标是编码一般知识图谱信息,以便于在下游任务中更准确地识别实体。


预训练包括两个损失函数:
  • MMLM损失,将文本中的实体掩盖并预测;
  • RC损失,预测文本中描述的实体关系。

二者结合用于优化ProSide模块。


作用机制

ProSide模型的作用机制在于它如何有效地利用输入序列中的实体信息,同时在模型由浅到深层保留实体间的信息。为了分析模型的表示空间与作用机制,我们计算1000个实例文本中实体的相对关系(通过知识逆映射后)与其在知识图谱中真实的关系的相似度,发现ProSide模型能够在语言模型架构作用后,有效地保留原始知识图谱嵌入空间中的实体-关系信息。


通过对比语言模型本身和多个消融模型的结果(上图横轴为模型层数由浅到深,纵轴为关系相似度,绿线为PLM本身,黄线为使用ProSide的模型,紫线为PLM+映射模块),PLM+知识映射(紫线)的模型在实体关系一致性上逐层降低,而ProSide模型在模型输出层上维持了这一关系,解释了其有效性。


实验与结果

我们在多个基准、不同模型、多个设定上测试了我们的模块,包括多个知识驱动的下游任务、使用不同训练方式的ProSide、增强在不同模型上以及fewshot/zeroshot设定。对比baseline和多个以前的模型,我们在多个测试集上达到最好的效果。