一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法

    专利2026-08-25  9


    本发明涉及自然语言处理情感分析,提出了一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法。


    背景技术:

    1、作为自然语言处理的一项重要子任务,方面术语抽取旨在识别给定评论句子中所有的方面术语。方面术语抽取显著地提升了各种自然语言处理下游应用的性能。例如,在情感分析任务中,方面术语抽取有助于确定情感与哪些方面相关,从而实现更细粒度的情感分析。在信息检索任务中,通过识别文本中与特定方面相关的术语,可以更准确地匹配查询与文档,从而提高检索结果的质量。大多数现有的研究工作将方面术语抽取视为一个序列标记任务,有监督的深度学习模型在这一任务上表现出色。然而,由于获取标记级标签数据的成本相当高昂,许多领域标记数据的稀缺性限制这些方法的有效性。在这样一个具有挑战性的背景下,跨领域方面术语抽取利用源领域大量的带标记级标签数据学习有用知识来改进目标领域的方面术语抽取。这一任务正受到学术界和工业界的广泛关注,成为一项具有前景的研究方向。

    2、跨领域方面术语抽取任务目前主要面临2个挑战:(1)特定领域大规模语言模型适配问题和标记数据稀缺问题。大规模语言模型是通过通用数据进行训练的,因此在特定领域上可能缺乏适应性,这可能导致模型的性能下降。另外,特定领域的标记数据可能是有限的或不可用的,这意味着模型在处理未知的领域时面临数据稀缺带来的挑战。例如,在餐厅领域,可用的带标签方面术语相对有限。(2)方面术语在不同领域的分布差异问题。不同领域之间的数据分布存在很大的差异,尤其是方面术语的表达存在很大的差异是不相交的。这使得从源领域学到的知识难以有效地帮助目标领域的方面术语抽取。

    3、现有的跨领域方面术语抽取方法一般采用基于规则的领域适应、基于特征的领域适应和基于数据增强的领域适应方法。基于规则的领域适应需要预先定义的规则或模式和情感种子的先验知识作为桥梁,性能在很大程度上取决于手动定义规则的灵活性和情感种子的完整性。基于特征的领域适应主要侧重于学习单词的领域不变表示,然而,主要任务分类器仅使用源领域标记数据进行训练,未能充分利用目标领域的特定信息。基于数据增强的领域适应利用源领域的标记数据直接生成具有细粒度注释的目标领域数据。然而,它仅仅用目标领域的词汇替换了源领域评论中的源特定词汇,忽略了领域的特定属性,从而限制了生成目标领域数据的质量。

    4、近年来,在自然语言处理领域中提出的预训练+微调的新范式受到了研究学者的广泛关注。该方法已被广泛的应用于自然语言理解、机器翻译、文本分类等任务,并取得了显著进展。预训练+微调范式包括两个关键步骤:(1)预训练:模型在大规模文本数据上进行预训练来获得丰富的语言知识和通用语言表示。通常,这一阶段采用自监督学习方法。(2)微调:根据特定任务的需求,利用相应的数据集对模型进行微调。

    5、本发明提出了一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法。具体来说,该方法利用源领域和目标领域的不带标签数据微调大规模预训练语言模型,这一步骤有助于保留语言模型所学到丰富语言知识,同时使其适应源领域和目标领域的特定语言特点。其次,基于微调后的大规模语言模型构建了方面术语抽取模型,使用源领域标记数据预训练此模型,并保存模型性能达到最优时的参数。最后,将源领域预训练模型参数作为目标领域模型的初始参数,使用目标领域上标记数据微调模型。基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法有效地缓解了目标领域数据稀缺的问题,进一步提高了目标领域的模型性能和泛化能力。


    技术实现思路

    1、本发明旨在通过结合大规模语言模型和预训练微调机制解决跨领域方面术语抽取任务。

    2、为达到上述目的,针对大规模语言模型和预训练微调机制对跨领域方面术语抽取的影响,本发明提出了一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,包括以下步骤:

    3、s1,基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法总体框架;该框架主要包括三个阶段:大规模预训练语言模型的微调阶段、基于大规模语言模型的方面术语抽取模型的构建阶段和特定领域的预训练微调阶段;

    4、s2,微调大规模预训练语言模型;引入大规模语言预训练模型bert,通过掩码预测任务使用源领域和目标领域的未标记数据对bert模型进行微调,形成适应源领域和目标领域数据的bert模型;

    5、s3,构建基于大规模语言模型的方面术语抽取模型;将基于步骤s2微调后的大规模语言模型与双向长短期记忆网络(bi-directional long short-term memory,bi-lstm)和条件随机场(conditional random filed,crf)结合,以构建方面术语抽取模型,该模型包括bert层、bi-lstm层、线性层和crf层;对构建的方面术语模型进行进一步训练和预测;

    6、s4,针对特定领域模型进行预训练和微调,针对步骤s3构建的方面术语抽取模型,首先,在源领域上使用带标签数据预训练模型;然后,在微调过程中引入领域适应损失函数,并使用目标领域带标签数据进一步微调模型。

    7、根据本发明实施例提出的基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法。本发明首先使用源领域和目标领域的未标记数据微调大规模预训练语言模型;其次,基于微调后的大规模语言模型构建方面术语抽取模型;最后,我们在源领域上预训练模型,并使用目标领域的少量标注数据微调此模型。实验结果表明,本发明提出的方法优于基线模型,有效提高了跨领域方面术语抽取的结果。

    8、根据本发明的一个实施例,所述步骤s1包括:

    9、s11,大规模语言模型的微调阶段,使用源领域和目标领域的未标记数据,通过掩码预测任务对大规模预训练语言模型的顶层进行微调,从而使其更好地适应源领域和目标领域的数据;

    10、s12,基于大规模语言模型的方面术语抽取模型的构建阶段,将微调后的大规模语言模型与bi-lstm+crf模型结合,以构建方面术语抽取模型;

    11、s13,特定领域的预训练微调阶段,首先使用源领域标记数据预训练方面术语抽取模型,并保存模型性能达到最优时的参数;然后,将源领域预训练模型参数作为目标领域模型的初始参数,使用目标领域上标记数据微调此模型。

    12、根据本发明的一个实施例,步骤s2还包括:

    13、s21,为了利用大规模语言模型的先验知识,本发明引入大规模语言预训练模型bert作为方面术语抽取模型的编码器,该编码器由12层transformer堆叠而成;输入文本经过12层transformer处理后,生成最终的文本表示;

    14、s22,为了进一步提高bert模型在特定领域下游任务上的适配性,本发明使用源领域和目标领域的未标记数据通过训练掩码预测任务对bert模型进行微调;在微调过程中,仅对顶层的transformer层进行微调,而底层的transformer则全部被冻结。

    15、根据本发明的一个实施例,步骤s3还包括:

    16、s31,bert层生成固定长度的向量表示,基于大规模语言模型的方面术语抽取模型中,对于一个文本序列x=(x1,x2,…,xn),大规模语言模型bert通过对输入序列进行编码生成一个固定长度的向量表示cls;

    17、cls=bert(x);

    18、s32,bi-lstm层进行特征提取,使用bert模型获得输入序列的最终向量表示,将其馈送到bi-lstm网络进行特征提取;对于每个时间步的输入bi-lstm会计算出对应的隐状态ht和细胞状态ct,并将其作为下一个时间步的输入;最终得到整个序列的表示h;

    19、s33,线性层将bi-lstm层提取到的特征映射到crf层所需的特征空间,得到线性层输出o;

    20、o=h·wlinear+blinear,

    21、其中,wlinear和blinear分别是线性层的权重矩阵和偏置向量;

    22、s34,crf层对标签序列进行建模,crf层将每个标签作为一个状态,将相邻标签之间的转移概率作为转移矩阵,将线性层得到的特征作为状态特征,定义目标函数为对数似然函数;对于每个时刻t,假设当前标签为yt,前一个标签为yt-1,则crf层的得分可以表示为:

    23、

    24、其中,φ(yt-1,yt,xi)表示状态转移特征,ψ(yt,xi)表示状态特征;

    25、s35,对构建的方面术语模型进行进一步训练和预测,使用随机梯度下降优化算法最大化对数似然函数,求得crf层的参数;采用维特比算法解码方法,找到标签序列,作为方面术语的最终抽取结果;bi-lstm+crf用于属性抽取的公式为:

    26、

    27、其中,p(y|x)表示给定输入x条件下标签序列y的概率,score(y,x)表示模型得分,∑y′(score(y′,x))表示对所有可能的标签序列y′的得分进行求和。

    28、根据本发明的一个实施例,步骤s4还包括:

    29、s41,在源领域上使用带标签数据预训练模型,模型训练过程,bert层参数全部冻结,使用交叉熵作为分类损失函数更新模型参数,并保存训练过程模型性能达到最优时的参数;源领域上的分类损失函数计算如下:

    30、

    31、其中,θs表示源领域bi-lstm+crf模型的参数,表示第i个样本属于第j个类别的真实标签(b、i或o),为模型对第i个样本属于第j个类别的预测概率;

    32、s42,在微调过程中引入领域适应损失函数,约束源领域和目标领域这两个空间的特征映射尽可能接近,以弥补领域间差异;领域适应损失函数的计算如下:

    33、

    34、其中,ntgt表示目标领域的数据量,‖·‖2表示向量的l2范数,和分别是源领域和目标领域中样本xi的特征映射;

    35、s43,使用目标领域带标签数据进一步微调模型;模型微调过程中,首先将保存的预训练模型参数用作目标领域模型的初始参数,然后使用源领域和目标领域分类损失函数以及领域适应损失函数损失更新模型参数;通过以下公式进行目标领域模型微调:

    36、

    37、其中,θt*表示目标领域bi-lstm+crf模型最优参数;超参数α和β用于平衡领域适应损失和分类损失的权重。

    38、与现有技术相比,本发明具有以下有益效果:

    39、(1)本发明提出了一种新颖的预训练微调框架。该框架通过掩码预测任务利用源领域和目标领域未标记数据对大规模语言模型进行微调。这一方法不仅可以从大规模语言模型中学习强大的语言表示,同时使其适应源领域和目标领域的特定语言特点,进而有效地缓解了目标领域带标签数据稀缺的问题,显著提高了模型的泛化能力。此外,该框架还将源领域中学到的模型参数迁移到目标领域,利用源领域学习到的有用知识帮助目标领域上的方面术语抽取任务,进一步提高了目标领域的模型性能。

    40、(2)为了进一步提高目标领域的模型性能,本发明引入了领域适应损失函数。它利用基于度量学习技术的特征对齐方法,以学习源领域和目标领域之间的特征映射。在训练过程中,该损失函数通过计算源领域和目标领域特征映射之间的欧几里德(l2)范数,直观地度量了源领域和目标里领域之间的特征分布差异。使用少量目标领域标记数据微调模型,在微调过程中,结合领域适应损失函数与分类损失函数,构建了一个综合的总损失函数。通过最小化这一总损失函数,使得模型在目标领域上更好地适应,从而提高了模型的泛化能力。

    41、(3)为了更好地应对领域差异,本发明使用了多步长学习率衰减策略进行微调。通过逐渐降低目标领域微调模型过程中的学习率,使模型更迅速地收敛到最优解。在源领域上,采用相对较大的学习率以充分利用源领域标记数据进行模型预训练。而在目标领域上,通过逐渐减小学习率,有助于细化模型对目标领域数据的适应性,避免过拟合。这一学习率衰减策略不仅提高了模型微调的效率,同时有效平衡了源领域和目标领域的训练过程,使得模型更具有鲁棒性和泛化性。


    技术特征:

    1.一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,其特征在于,包括以下步骤:

    2.根据权利要求1所述的一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,其特征在于,所述步骤s1中的大规模预训练语言模型的微调阶段、基于大规模语言模型的方面术语抽取模型的构建阶段和特定领域的预训练微调阶段进一步包含:

    3.根据权利要求1所述的一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,其特征在于,所述步骤s2中的引入大规模语言预训练模型bert,通过掩码预测任务使用源领域和目标领域的未标记数据对bert模型进行微调进一步包含:

    4.根据权利要求1所述的一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,其特征在于,所述步骤s3中所述的bert层、bi-lstm层、线性层、crf层和对构建的方面术语模型进行进一步训练和预测进一步包含:

    5.根据权利要求1所述的一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法,其特征在于,所述步骤s4所述的在源领域上使用带标签数据预训练模型、在微调过程中引入领域适应损失函数和使用目标领域带标签数据进一步微调模型进一步包含:


    技术总结
    本发明公开了一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法。在跨领域方面术语抽取任务中,针对特定领域标记级标签数据的稀缺性,提出了一种基于大规模语言模型和预训练微调机制的跨领域方面术语抽取方法。本发明首先使用源领域和目标领域的未标记数据微调大规模预训练语言模型;其次,基于微调后的大规模语言模型构建方面术语抽取模型;最后,在源领域上预训练模型,并使用目标领域的标注数据微调此模型。实验结果表明,本发明提出的方法优于基线模型,有效提高了跨领域方面术语抽取的准确率。

    技术研发人员:赵传君,武美龄
    受保护的技术使用者:山西财经大学
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-101097.html

    最新回复(0)