本技术涉及金融科技,应用于文本内容指代消解场景中,尤其涉及一种文本内容指代消解方法、装置、设备及其存储介质。
背景技术:
1、随着互联网的飞速发展,各行各业都在依托互联网寻求行业突破点,近年来,金融行业也正在围绕着互联网进行线上业务拓展。由于金融行业涉及的业务量和数据量较大,导致了在金融业务文本处理上,需要更好的理解文本的含义。
2、而指代消解是自然语言处理中一个重要的任务,它的目标是在一段文本中解决名词短语的指代关系,即确定同一实体(如人、地点、物品等)在文本中出现的所有地方,可以帮助我们更好地理解文本的含义。
3、目前的指代消解方法,通常注重于输入文本本身,着力于挖掘输入文本中的信息:如有研究者使用端到端的神经网络计算文本中短语的向量表示和文本中短语的头注意力机制,以此达到指代消解的目的;还有的学者使用问答模型的形式,首先从文本中提取出候选指称,其次将每个指称所在句子作为问句,整个文本作为上下文,将二者拼接起来,最后通过一个问答模型抽取该文本中该指称的所有共指词,可以发现上述指代消解方法仅对输入文本进行处理,获得的信息十分有限,无法更好的辅助金融处理系统进行文本内容指代消解。
技术实现思路
1、本技术实施例的目的在于提出一种文本内容指代消解方法、装置、设备及其存储介质,以解决现有技术中指代消解方法仅对输入文本进行处理,获得的信息十分有限,无法更好的辅助金融处理系统进行文本内容指代消解的问题。
2、为了解决上述技术问题,本技术实施例提供文本内容指代消解方法,采用了如下所述的技术方案:
3、一种文本内容指代消解方法,包括下述步骤:
4、获取目标知识图谱;
5、解析所述目标知识图谱,得到所有实体数据以及所述所有实体数据间的关系表征数据;
6、将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量,其中,所述包含语义信息的实体关系向量由头部实体数据、关系表征数据和尾部实体数据三者拟合而成;
7、获得待进行指代消解的文本;
8、将所述待进行指代消解的文本输入预设的实体抽取模型,根据所述实体抽取模型抽取所述待进行指代消解的文本中包含的所有实体数据;
9、根据预设的同义词典对所述待进行指代消解的文本中包含的所有实体数据进行同义词归类整理,获得归类整理后的待训练实体数据;
10、以所述包含语义信息的实体关系向量作为监督信号,将所述待训练实体数据输入到所述表示学习模型,获得所述待训练实体数据对应的包含语义信息的实体关系向量;
11、根据所述待训练实体数据对应的包含语义信息的实体关系向量,对所述待进行指代消解的文本中包含的实体数据进行指代消解。
12、进一步的,所述解析所述目标知识图谱,得到所有实体数据以及所述所有实体数据间的关系表征数据的步骤,具体包括:
13、对所述目标知识图谱进行初步解析,获取所述目标知识图谱中包含的所有图谱节点和所有图谱节点间的连线;
14、根据图谱节点标识和预设的第一参照表,确定所有节点分别对应的实体数据,其中,所述第一参照表中包含了图谱节点标识与实体数据间的映射关系;
15、根据连线标识符号和预设的第二参照表,确定所有图谱节点间的连线分别所对应的关系表征数据,其中,所述第二参照表中包含了连线标识符合与关系表征数据间的映射关系。
16、进一步的,在执行所述将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量的步骤之前,所述方法还包括:
17、将所述目标知识图谱作为学习参考图谱部署到所述表示学习模型中;
18、初始化所述目标知识图谱,以获取所述目标知识图谱中包含的实体位置向量和关系表征向量,其中,所述实体位置向量根据所有实体数据在所述目标知识图谱中的位置信息而获得,所述关系表征向量由模长信息和角度信息构成,所述模长信息和角度信息根据具备连接关系的两个实体数据在所述目标知识图谱中的位置信息计算而获得。
19、进一步的,所述将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量的步骤,具体包括:
20、通过对比,识别出所述所有实体数据分别对应的实体位置向量;
21、从所述所有实体数据中任意选择一个实体数据作为头部实体数据;
22、从所述所有实体数据中任意选择一个实体数据作为尾部实体数据;
23、基于所述头部实体数据和尾部实体数据分别对应的实体位置向量,计算出所述头部实体数据和尾部实体数据间的模长信息和角度信息;
24、根据所述目标知识图谱,判断所述头部实体数据和尾部实体数据间是否存在直接的关系表征数据;
25、若所述头部实体数据和尾部实体数据间存在直接的关系表征数据,则根据所述头部实体数据的实体位置向量、所述尾部实体数据的实体位置向量和所述关系表征数据构建所述包含语义信息的实体关系向量;
26、若所述头部实体数据和尾部实体数据间不存在直接的关系表征数据,将根据预设的筛选策略获得所述头部实体数据和尾部实体数据间包含的最佳路径下的间接关系表征数据,其中,所述最佳路径为通过所述筛选策略识别出包含的间接关系表征数据的数量为最小值时的路径;
27、根据所述头部实体数据的实体位置向量、所述尾部实体数据的实体位置向量,以及所述头部实体数据和尾部实体数据间包含的最佳路径下的间接的关系表征数据构建所述包含语义信息的实体关系向量。
28、进一步的,所述实体抽取模型为基于crf算法的bert实体抽取模型,所述将所述待进行指代消解的文本输入预设的实体抽取模型,根据所述实体抽取模型抽取所述待进行指代消解的文本中包含的所有实体数据的步骤,具体包括:
29、根据所述实体抽取模型中的分词组件对所述待进行指代消解的文本进行分词处理,获得分词处理结果;
30、通过所述实体抽取模型中的词性分析组件对所述分词处理结果进行词性分析,获得所述分词处理结果中的名词字段;
31、根据所述实体抽取模型中的输出组件输出所述名词字段,完成对所述待进行指代消解的文本中包含的所有实体数据的抽取。
32、进一步的,所述根据所述待训练实体数据对应的包含语义信息的实体关系向量,对所述待进行指代消解的文本中包含的实体数据进行指代消解的步骤,具体包括:
33、从所述待训练实体数据中任选一个待训练实体数据作为对比实体数据;
34、获得所述对比实体数据对应的包含语义信息的实体关系向量,作为第一向量;
35、依次获得所述待训练实体数据中除所述对比实体数据之外,其他待训练实体数据分别对应的包含语义信息的实体关系向量,作为第二向量;
36、根据预设的相似度算法,计算所述第一向量和所述第二向量的相似度;
37、若所述相似度满足预设的相似度阈值,则以所述对比实体数据指代所述第二向量对应的待训练实体数据,以及以所述对比实体数据指代所述第二向量对应的待训练实体数据的同义词。
38、进一步的,所述根据预设的相似度算法,计算所述第一向量和所述第二向量的相似度的步骤,具体包括:
39、获取所述对比实体数据对应的由头部实体数据、关系表征数据和尾部实体数据三者拟合而成的第一向量;
40、获取所述第二向量对应的由头部实体数据、关系表征数据和尾部实体数据三者拟合而成向量数据;
41、采用余弦相似度算法,计算所述第一向量和所述第二向量中头部实体数据、关系表征数据和尾部实体数据的相似度;
42、将所述第一向量和所述第二向量中头部实体数据、关系表征数据和尾部实体数据的相似度作为所述第一向量和所述第二向量的相似度。
43、为了解决上述技术问题,本技术实施例还提供文本内容指代消解装置,采用了如下所述的技术方案:
44、一种文本内容指代消解装置,包括:
45、知识图谱获取模块,用于获取目标知识图谱;
46、知识图谱解析模块,用于解析所述目标知识图谱,得到所有实体数据以及所述所有实体数据间的关系表征数据;
47、实体关系向量获取模块,用于将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量,其中,所述包含语义信息的实体关系向量由头部实体数据、关系表征数据和尾部实体数据三者拟合而成;
48、文本获取模块,用于获得待进行指代消解的文本;
49、实体数据抽取模块,用于将所述待进行指代消解的文本输入预设的实体抽取模型,根据所述实体抽取模型抽取所述待进行指代消解的文本中包含的所有实体数据;
50、同义词归类整理模块,用于根据预设的同义词典对所述待进行指代消解的文本中包含的所有实体数据进行同义词归类整理,获得归类整理后的待训练实体数据;
51、监督学习模块,用于以所述包含语义信息的实体关系向量作为监督信号,将所述待训练实体数据输入到所述表示学习模型,获得所述待训练实体数据对应的包含语义信息的实体关系向量;
52、指代消解处理模块,用于根据所述待训练实体数据对应的包含语义信息的实体关系向量,对所述待进行指代消解的文本中包含的实体数据进行指代消解。
53、为了解决上述技术问题,本技术实施例还提供一种计算机设备,采用了如下所述的技术方案:
54、一种计算机设备,包括存储器和处理器,所述存储器中存储有计算机可读指令,所述处理器执行所述计算机可读指令时实现上述所述的文本内容指代消解方法的步骤。
55、为了解决上述技术问题,本技术实施例还提供一种计算机可读存储介质,采用了如下所述的技术方案:
56、一种计算机可读存储介质,所述计算机可读存储介质上存储有计算机可读指令,所述计算机可读指令被处理器执行时实现如上述所述的文本内容指代消解方法的步骤。
57、与现有技术相比,本技术实施例主要有以下有益效果:
58、本技术实施例所述文本内容指代消解方法,通过解析所述目标知识图谱,得到所有实体数据以及所述所有实体数据间的关系表征数据;将所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,获得包含语义信息的实体关系向量;获得待进行指代消解的文本;将待进行指代消解的文本输入预设的实体抽取模型,抽取待进行指代消解的文本中包含的所有实体数据;对待进行指代消解的文本中包含的所有实体数据进行同义词归类整理,获得待训练实体数据;将待训练实体数据输入到表示学习模型,并以所述包含语义信息的实体关系向量作为监督信号获得待训练实体数据对应的包含语义信息的实体关系向量;根据待训练实体数据对应的包含语义信息的实体关系向量,对待进行指代消解的文本中包含的实体数据进行指代消解。通过表示学习模型获得目标识别图谱中包含的实体关系向量作为监督信号,确定待进行指代消解的文本中所有实体数据间的实体关系向量,更好的辅助金融处理系统进行文本内容指代消解。
1.一种文本内容指代消解方法,其特征在于,包括下述步骤:
2.根据权利要求1所述的文本内容指代消解方法,其特征在于,所述解析所述目标知识图谱,得到所有实体数据以及所有实体数据间的关系表征数据的步骤,具体包括:
3.根据权利要求1所述的文本内容指代消解方法,其特征在于,在执行所述将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量的步骤之前,所述方法还包括:
4.根据权利要求1或3所述的文本内容指代消解方法,其特征在于,所述将所述所有实体数据以及所有实体数据间的关系表征数据输入预设的表示学习模型,根据所述表示学习模型的输出结果获得包含语义信息的实体关系向量的步骤,具体包括:
5.根据权利要求1所述的文本内容指代消解方法,其特征在于,所述实体抽取模型为基于crf算法的bert实体抽取模型,所述将所述待进行指代消解的文本输入预设的实体抽取模型,根据所述实体抽取模型抽取所述待进行指代消解的文本中包含的所有实体数据的步骤,具体包括:
6.根据权利要求1所述的文本内容指代消解方法,其特征在于,所述根据所述待训练实体数据对应的包含语义信息的实体关系向量,对所述待进行指代消解的文本中包含的实体数据进行指代消解的步骤,具体包括:
7.根据权利要求6所述的文本内容指代消解方法,其特征在于,所述根据预设的相似度算法,计算所述第一向量和所述第二向量的相似度的步骤,具体包括:
8.一种文本内容指代消解装置,其特征在于,包括:
9.一种计算机设备,其特征在于,包括存储器和处理器,所述存储器中存储有计算机可读指令,所述处理器执行所述计算机可读指令时实现如权利要求1至7中任一项所述的文本内容指代消解方法的步骤。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机可读指令,所述计算机可读指令被处理器执行时实现如权利要求1至7中任一项所述的文本内容指代消解方法的步骤。
