本发明主要涉及到计算机深度学习,特指一种基于自注意力机制的预训练模型去偏方法。
背景技术:
1、大规模预训练语言模型,如bert、gpt和t5等在多个自然语言处理任务基准测试中取得了突破性的结果,包括问答、命名体识别和文本分类等任务。预训练语言模型通过丰富的预训练语料库,采用注意力机制,学习到了有价值的文本表示。在预训练语言模型的基础上对下游任务进行微调成为当前自然语言处理研究的主流范式。
2、然而,预训练语言模型从训练的大量文本数据中捕捉到了社会偏见,例如性别。这些偏见会对某一群体产生不公平的对待甚至在下游任务中传播或扩大,从而对模型决策造成影响。例如,在职业推荐系统中,男性更容易推荐为工程师,而女性更容易推荐为护士。
3、现有预训练模型的去偏方法可分为数据预处理去偏、模型中处理去偏和模型后处理去偏等方法。其中,数据预处理去偏通常通过数据增强的方法来生成一个偏差属性平衡的数据集达到去偏效果。这种方法通过大量的文本数据重新对模型进行训练,对硬件和时间要求很高,需要专门的硬件,如gpu/tpu集群。模型中处理去偏通常通过投影的方式对句子表征进行偏见空间映射来减轻模型中的偏见。这种方法需要对偏见子空间做出了很强的线性假设,且偏见方向的计算很大程度上依赖于数据集。模型后处理去偏通常是通过算法约束模型的预测或输出来减轻模型的偏见,这种方法比较依赖于模板和属性描述。
4、预训练模型中的注意力机制在优化模型性能、提高训练效率和增强模型解释能力等方面具有很重要的作用。现有的去偏方法主要是对模型数据和嵌入层进行去偏,而对自注意力机制中的去偏效果并不明显。因此,如何发明一种减轻模型注意力机机制中的去偏方法,是本技术领域亟需解决的问题。
技术实现思路
1、本发明要解决的技术问题就在于:针对现有技术存在的技术问题,本发明提供一种原理简单、易实现、能够提高去偏精度和去偏效果的基于自注意力机制的预训练模型去偏方法。
2、本发明有利于减轻预训练模型注意力机制中的偏见,提高模型的公平性。
3、为解决上述技术问题,本发明采用以下技术方案:
4、一种基于自注意力机制的预训练模型去偏方法,其包括:
5、步骤s1:构建包含偏差属性词的数据集;
6、步骤s2:对步骤s1中的偏差属性数据集进行反事实数据增强;
7、步骤s3:构建去偏模型,将步骤s2中的数据输入到预训练模型中获取偏差属性词的嵌入表示,构建对输入的偏差属性词进行注意力分布对齐的损失函数ljsd;
8、步骤s4:构建余弦相似度对齐损失函数;对原始模型与去偏模型输出的向量进行余弦相似度对齐损失分析,构成目标损失函数为lcosine;
9、步骤s5:综合两个损失函数作为最终的模型目标损失函数;
10、步骤s6:在公开数据集上对训练的去偏模型进行公平性测试。
11、作为本发明方法的进一步改进:所述步骤s1包括以下流程:
12、步骤s11:整理出偏差属性,获取偏差属性词;
13、步骤s12:获取文本数据集;所述文本数据集为wikitext-2、stanford sentimenttreebank 、meld、pom、news_200语料库中的一个或多个;
14、步骤s13:从文本数据集中挑选出满足包含一个偏差属性词、且长度在5-20个词之间的句子,表示为原始的偏差属性数据集。
15、作为本发明方法的进一步改进:所述步骤s2中,所述反事实数据增强的过程为:根据整理的偏差属性词集x={x1,x2,…,xn},通过找到原始偏差属性数据集中xi,并将xi修改为x中其他偏差属性词,得到除偏差属性词不同其他词都相同的反事实数据集。
16、作为本发明方法的进一步改进:所述步骤s3包括以下流程:
17、步骤s31:将反事实数据增强的偏差属性数据集文本输入到预训练模型中进行编码;
18、步骤s32:计算不同偏差属性词对句子中其他词的注意力权重,计算公式如下:
19、
20、其中,表示注意力分数;
21、步骤s33:最小化不同偏差属性词对句子中其他词的js散度分布作为注意力分布目标损失函数,损失函数计算公式如下:
22、
23、。
24、作为本发明方法的进一步改进:所述步骤s4包括以下流程:
25、步骤s41:将反事实数据增强的偏差属性数据集文本输入到预训练模型和去偏模型中进行编码,获取偏差属性句子的向量表示;
26、步骤s42:将原始模型中的句子表示与去偏模型中相同的句子表示进行余弦相似度计算,计算公式如下:
27、
28、其中oi,si为的向量表示,|oi|,|si|分别表示为它们向量的模长;
29、步骤s43:最小化余弦相似度作为相似度对齐损失目标函数,计算公式如下:
30、。
31、作为本发明方法的进一步改进:所述步骤s5中,最终的去偏模型目标损失函数的公式计算如下:
32、。
33、作为本发明方法的进一步改进:所述步骤s6包括以下流程:
34、步骤s61:获取公平性测试数据集为:stereoset、crowspairs;
35、步骤s62:计算句子所有词的然似概率,计算公式如下:
36、
37、其中s表示输入模型的句子,wi表示句子s中的第i个词;
38、步骤s63:计算模型的偏差得分,计算公式如下:
39、
40、其中i表示指示函数,如果参数为true,则返回1,否则返回0;n表示测试实例总数;sst表示数据集中标签为刻板句子,sat表示数据集中标签为反刻板句子;biasscore为50表示无偏。
41、与现有技术相比,本发明的优点就在于:
42、本发明的一种基于自注意力机制的预训练模型去偏方法,原理简单、易实现、能够提高去偏精度和去偏效果,本发明通过反事实数据增强偏差属性,对齐偏差属性词的注意力分布和对齐偏差属性词的余弦相似度,进而对预训练模型进行训练,达到较佳的去偏效果,最终有利于减轻预训练模型注意力机制中的偏见,提高模型的公平性。
1.一种基于自注意力机制的预训练模型去偏方法,其特征在于,包括:
2.根据权利要求1所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s1包括以下流程:
3.根据权利要求1所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s2中,所述反事实数据增强的过程为:根据整理的偏差属性词集x={x1,x2,…,xn},通过找到原始偏差属性数据集中xi,并将xi修改为x中其他偏差属性词,得到除偏差属性词不同其他词都相同的反事实数据集。
4.根据权利要求1所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s3包括以下流程:
5.根据权利要求1所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s4包括以下流程:
6.根据权利要求1-5中任意一项所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s5中,最终的去偏模型目标损失函数的公式计算如下:
7.根据权利要求1-5中任意一项所述的基于自注意力机制的预训练模型去偏方法,其特征在于,所述步骤s6包括以下流程:
