本技术涉及数据处理,尤其涉及一种数据处理方法、装置、电子设备及计算机可读介质。
背景技术:
1、目前,现有的金融大模型的常规应用部署方法,如果用户输入的提示词不经过适当的过滤步骤,直接输入到大模型中,因为大模型的训练语料来自于网络的海量数据,大模型存在很大的可能性包含负向的或者个人隐私相关的信息,如果输入的提示词也是相关的内容,那么存在很大的可能性大模型会从内部匹配到类似相关的内容,从而导致大模型对终端用户输出负向的或者包含个人隐私的内容,从而承担这种负向信息输出的风险和责任,数据安全性差。
技术实现思路
1、有鉴于此,本技术实施例提供一种数据处理方法、装置、电子设备及计算机可读介质,能够解决现有的直接根据用户输入金融大模型的提示词匹配相应的信息并输出匹配到的信息而导致的数据安全性差的问题。
2、为实现上述目的,根据本技术实施例的一个方面,提供了一种数据处理方法,包括:
3、响应于获取到提示词文本数据,调用知识蒸馏模型,以提取提示词文本数据中的动作词,确定动作词与预设类型库中的各个预设类型的语义相似度,基于语义相似度确定提示词文本数据的类型;
4、响应于类型对应于正向文本,识别提示词文本数据中的命名实体,其中,识别提示词文本数据中的命名实体,包括:将提示词文本数据进行词嵌入以得到提示词文本向量,调用命名实体画像,以将提示词文本向量与命名实体画像中的各个命名实体向量进行相似度匹配,根据相似度匹配结果数据确定提示词文本数据中的命名实体;
5、将命名实体与预设维度特征数据进行匹配,将匹配成功的命名实体确定为目标命名实体;
6、对目标命名实体执行匿名化替换,以得到匿名实体;
7、基于匿名实体更新提示词文本数据。
8、可选地,在调用知识蒸馏模型之前,方法还包括:
9、获取样本提示词文本数据和样本负向标签;
10、确定第一语言表示模型的第一模型层数,基于第一模型层数,确定第二语言表示模型的第二模型层数;
11、基于第一语言表示模型的模型层初始化第二语言表示模型的模型层,基于样本提示词文本数据和样本负向标签并行运行第一语言表示模型和第二语言表示模型,以得到第一语言表示模型的第一输出和第二语言表示模型的第二输出;
12、以第一输出为目标对第二输出计算交叉熵损失,以调整第二语言模型的模型参数直至交叉熵损失小于预设阈值,进而将训练得到的第二语言表示模型确定为知识蒸馏模型。
13、可选地,识别提示词文本数据中的命名实体,包括:
14、将提示词文本数据输入至微调语言表示模型,以调用微调语言表示模型中的线性层对对提示词文本数据中的文字进行分类,识别命名实体的开始文字和终止文字,以得到对应的命名实体。
15、可选地,将提示词文本数据输入至微调语言表示模型,包括:
16、对提示词文本数据进行嵌入式表示,以生成提示词文本数据向量;
17、将提示词文本数据向量输入至微调语言表示模型。
18、可选地,将命名实体与预设维度特征数据进行匹配,将匹配成功的命名实体确定为目标命名实体,包括:
19、将命名实体转换为对应的第一向量;
20、将预设维度特征数据转换为对应的各个第二向量;
21、计算第一向量与各个第二向量的余弦相似度,将大于预设阈值的余弦相似度对应的命名实体确定为目标命名实体。
22、可选地,数据处理方法还包括:
23、获取更新后的提示词文本数据并输入至大模型,以输出匹配结果数据。
24、另外,本技术还提供了一种数据处理装置,包括:
25、获取单元,被配置成响应于获取到提示词文本数据,调用知识蒸馏模型,以提取提示词文本数据中的动作词,确定动作词与预设类型库中的各个预设类型的语义相似度,基于语义相似度确定提示词文本数据的类型;
26、识别单元,被配置成响应于类型对应于正向文本,识别提示词文本数据中的命名实体,其中,识别提示词文本数据中的命名实体,包括:将提示词文本数据进行词嵌入以得到提示词文本向量,调用命名实体画像,以将提示词文本向量与命名实体画像中的各个命名实体向量进行相似度匹配,根据相似度匹配结果数据确定提示词文本数据中的命名实体;
27、匹配单元,被配置成将命名实体与预设维度特征数据进行匹配,将匹配成功的命名实体确定为目标命名实体;
28、匿名化替换单元,被配置成对目标命名实体执行匿名化替换,以得到匿名实体;
29、更新单元,被配置成基于匿名实体更新提示词文本数据。
30、可选地,数据处理装置还包括模型训练单元,被配置成:
31、获取样本提示词文本数据和样本负向标签;
32、确定第一语言表示模型的第一模型层数,基于第一模型层数,确定第二语言表示模型的第二模型层数;
33、基于第一语言表示模型的模型层初始化第二语言表示模型的模型层,基于样本提示词文本数据和样本负向标签并行运行第一语言表示模型和第二语言表示模型,以得到第一语言表示模型的第一输出和第二语言表示模型的第二输出;
34、以第一输出为目标对第二输出计算交叉熵损失,以调整第二语言模型的模型参数直至交叉熵损失小于预设阈值,进而将训练得到的第二语言表示模型确定为知识蒸馏模型。
35、可选地,识别单元进一步被配置成:
36、将提示词文本数据输入至微调语言表示模型,以调用微调语言表示模型中的线性层对对提示词文本数据中的文字进行分类,识别命名实体的开始文字和终止文字,以得到对应的命名实体。
37、可选地,识别单元进一步被配置成:
38、对提示词文本数据进行嵌入式表示,以生成提示词文本数据向量;
39、将提示词文本数据向量输入至微调语言表示模型。
40、可选地,匹配单元进一步被配置成:
41、将命名实体转换为对应的第一向量;
42、将预设维度特征数据转换为对应的各个第二向量;
43、计算第一向量与各个第二向量的余弦相似度,将大于预设阈值的余弦相似度对应的命名实体确定为目标命名实体。
44、可选地,更新单元进一步被配置成:
45、获取更新后的提示词文本数据并输入至大模型,以输出匹配结果数据。
46、另外,本技术还提供了一种数据处理电子设备,包括:一个或多个处理器;存储装置,用于存储一个或多个程序,当一个或多个程序被一个或多个处理器执行,使得一个或多个处理器实现如上述的数据处理方法。
47、另外,本技术还提供了一种计算机可读介质,其上存储有计算机程序,程序被处理器执行时实现如上述的数据处理方法。
48、为实现上述目的,根据本技术实施例的又一个方面,提供了一种计算机程序产品。
49、本技术实施例的一种计算机程序产品,包括计算机程序,程序被处理器执行时实现本技术实施例提供的数据处理方法。
50、上述发明中的一个实施例具有如下优点或有益效果:本技术通过响应于获取到提示词文本数据,调用知识蒸馏模型,以提取提示词文本数据中的动作词,确定动作词与预设类型库中的各个预设类型的语义相似度,基于语义相似度确定提示词文本数据的类型;响应于类型对应于正向文本,识别提示词文本数据中的命名实体,其中,识别提示词文本数据中的命名实体,包括:将提示词文本数据进行词嵌入以得到提示词文本向量,调用命名实体画像,以将提示词文本向量与命名实体画像中的各个命名实体向量进行相似度匹配,根据相似度匹配结果数据确定提示词文本数据中的命名实体;将命名实体与预设维度特征数据进行匹配,将匹配成功的命名实体确定为目标命名实体;对目标命名实体执行匿名化替换,以得到匿名实体;基于匿名实体更新提示词文本数据。可以有效控制负向信息进入大模型并引起负向的输出发生,提高有大模型参与的数据安全性。
51、上述的非惯用的可选方式所具有的进一步效果将在下文中结合具体实施方式加以说明。
1.一种数据处理方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,在所述调用知识蒸馏模型之前,所述方法还包括:
3.根据权利要求1所述的方法,其特征在于,所述识别所述提示词文本数据中的命名实体,包括:
4.根据权利要求3所述的方法,其特征在于,所述将所述提示词文本数据输入至微调语言表示模型,包括:
5.根据权利要求1所述的方法,其特征在于,所述将所述命名实体与预设维度特征数据进行匹配,将匹配成功的命名实体确定为目标命名实体,包括:
6.根据权利要求1所述的方法,其特征在于,所述方法还包括:
7.一种数据处理装置,其特征在于,包括:
8.根据权利要求7所述的装置,其特征在于,所述装置还包括模型训练单元,被配置成:
9.根据权利要求7所述的装置,其特征在于,所述识别单元进一步被配置成:
10.根据权利要求9所述的装置,其特征在于,所述识别单元进一步被配置成:
11.根据权利要求7所述的装置,其特征在于,所述匹配单元进一步被配置成:
12.根据权利要求7所述的装置,其特征在于,所述更新单元进一步被配置成:
13.一种数据处理电子设备,其特征在于,包括:
14.一种计算机可读介质,其上存储有计算机程序,其特征在于,所述程序被处理器执行时实现如权利要求1-6中任一项所述的方法。
15.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1-6中任一项所述的方法。
