本技术涉及计算机,具体而言,本技术涉及一种基于多智能体辩论的指令数据优化方法、装置、电子设备及存储介质。
背景技术:
1、在大语言模型指令微调数据优化这一任务上,以往工作已从指令的多样性、难度分布和所需指令量等多个角度进行研究。随着大语言模型构建成本的增加,人们越来越专注于探索具有成本效益的llm微调方法,以在微调过程中尽量减少指令数量。例如,一项工作利用chatgpt模型对52000条开源指令微调数据进行打分,并利用筛选出的9000条高质量数据进行指令微调。在另一项工作中,研究者采用1000条悉心收集并处理的问题与回复构建指令微调数据,在没有进行任何强化学习或人类偏好建模的情况下训练得到了效果良好的模型。这些研究均表明,对于大语言模型的指令微调而言,数据的质量比数量更重要,而如何自动化地构建高质量指令微调数据是值得研究的任务。
2、近年来,随着大语言模型基础能力的增强,“多智能体辩论”这一思想被逐渐应用于数据生成和评估任务。其核心在于采用多个语言模型构建同一任务场景中的不同角色,通过不断交流各自观点,最终得到超越单一模型输出的效果。如一项工作采用多个智能体来对相同指令生成答案,并在随后的迭代中让它们互相参考,以最终得到更完善的解决方案。另一项工作则通过多智能体辩论来缓解大语言模型自我反思过程中的“思维退化”(degeneration of thought,dot)问题,提高了下游任务的效果。
3、已有一系列工作从优化指令微调数据的角度开展研究,以利用更少的高质量数据构建得到性能更强的大语言模型。例如,设计了数据采集标准,从在线社区中采集并处理用户问答数据,以少量的高质量指令微调数据训练出了具有良好性能的大语言模型。以及提出的框架以少量人工构建的种子指令为起点,利用语言模型半自动地生成指令、输入和输出样本,在对无效或相似样本进行过滤后,再利用它们对原始模型进行微调。还有借助大语言模型chatgpt对现有的开源指令微调数据进行评价打分,通过设定人工阈值筛选出其中质量较高的部分数据,以此对大语言模型进行微调。
4、以上研究均验证了指令微调数据质量在大语言模型训练中的重要性,然而上述方法在数据的获取、过滤过程中,要么依赖于人工制定规则,要么并未完全发挥出大语言模型对文本的评价能力;
5、由上可知,如何提高基于多智能体辩论的指令数据优化的质量仍有待解决。
技术实现思路
1、本技术各提供了一种基于多智能体辩论的指令数据优化方法、装置、电子设备及存储介质,可以解决相关技术中存在的基于多智能体辩论的指令数据优化的质量不高的问题。所述技术方案如下:
2、根据本技术的一个方面,一种基于多智能体辩论的指令数据优化方法,包括:获取原始指令微调数据样本,其中,所述原始指令微调数据样本包括指令、输入以及输出;基于所述原始指令微调数据样本获取论题数据,并将所述论题数据输出到正方智能体以及反方智能体,其中,所述论题数据包括对应的给定陈述以及用于理解给定陈述的上下文;基于所述正方智能体与所述反方智能体对于论题数据进行辩论,若反方胜出,则对所述原始指令微调数据样本进行修改,否则不修改所述原始指令微调数据样本。
3、根据本技术的一个方面,一种基于多智能体辩论的指令数据优化装置,包括:
4、原始样本获取模块,用于获取原始指令微调数据样本,其中,所述原始指令微调数据样本包括指令、输入以及输出;
5、论题输出模块,基于所述原始指令微调数据样本获取论题数据,并用于将所述论题数据输出到正方智能体以及反方智能体,其中,所述论题数据包括对应的给定陈述以及用于理解给定陈述的上下文;
6、编辑模块,基于所述正方智能体与所述反方智能体对于论题数据进行辩论,若反方胜出,则用于对所述原始指令微调数据样本进行修改,否则不修改所述原始指令微调数据样本。
7、在一示例性实施例中,所述装置还包括但不限于:
8、正方第一轮发言获取模块,用于获取所述正方智能体基于所述论题数据输出的正方第一轮发言;
9、反方第一轮发言获取模块,用于获取所述反方智能体基于所述论题数据输出的反方第一轮发言;
10、第一轮判断模块,基于所述正方第一轮发言与反方第一轮发言用于判断所述正方智能体以及所述反方智能体辩论是否正确。
11、在一示例性实施例中,所述装置还包括但不限于:
12、第二轮发言获取模块,用于获取所述正方智能体的正方第二轮发言与所述反方智能体的反方第二轮发言;
13、第二轮可信度分数获取模块,用于获取所述正方智能体对所述反方第二轮发言的反方第二可信度分数以及所述对反方智能体对正方第二轮发言的正方第二可信度分数;
14、胜方确定模块,基于所述反方第二可信度分数与所述正方第二可信度分数用于确定胜方。
15、在一示例性实施例中,所述装置还包括但不限于:
16、可信度阈值调取模块,用于调取可信度阈值;
17、第二轮判断模块,用于判断所述反方第二轮可信度分数、所述正方第二轮可信度分数两者是否大于可信度阈值;
18、若所述反方第二轮可信度分数、所述正方第二轮可信度分数都低于所述可信度阈值,则进行下一轮辩论;
19、若所述反方第二轮可信度分数、所述正方第二轮可信度分数都高于所述可信度阈值,则再次进行本轮辩论;
20、若是所述反方第二轮可信度分数、所述正方第二轮可信度分数中只有一个高于所述可信度阈值,则确定分数低于所述可信度阈值为胜方。
21、在一示例性实施例中,所述装置还包括但不限于:
22、若所述正方智能体胜出,则对原始指令微调数据样本进行微调确定输出样本;
23、若所述反方智能体胜出,则获取所述反方智能体胜出的反方发言集合,其中,所述反方发言集合包括所述反方智能体的全部发言;
24、将所述反方发言集合与所述论题数据输入到第三智能体,获取第三智能体对于所述论题数据的修改意见;
25、基于所述修改意见对论题数据进行编辑获取对应的输出样本。
26、在一示例性实施例中,在所述正方可信度分数、所述反方可信度分数均一直低于所述可信度阈值时,其中,正方可信度分与反可信度分数为正方智能体与反方智能体在每轮辩论后获得的可信度分数,所述装置还包括但不限于:
27、轮次数据获取模块,用于获取所述正方智能体与所述反方智能体进行辩论的轮次数据;
28、轮次阈值调取模块,用于调取轮次阈值;
29、轮次判断模块,用于判断轮次数据是否小于所述轮次阈值,若是则进行辩论,否则停止辩论,并确定正方智能体胜出。
30、根据本技术的一个方面,一种电子设备,包括至少一个处理器以及至少一个存储器,其中,所述存储器上存储有计算机可读指令;所述计算机可读指令被一个或多个所述处理器执行,使得电子设备实现如上所述的基于多智能体辩论的指令数据优化方法。
31、根据本技术的一个方面,一种存储介质,其上存储有计算机可读指令,所述计算机可读指令被一个或多个处理器执行,以实现如上所述的基于多智能体辩论的指令数据优化方法。
32、根据本技术的一个方面,一种计算机程序产品,计算机程序产品包括计算机可读指令,计算机可读指令存储在存储介质中,电子设备的一个或多个处理器从存储介质读取计算机可读指令,加载并执行该计算机可读指令,使得电子设备实现如上所述的基于多智能体辩论的指令数据优化方法。
33、本技术提供的技术方案带来的有益效果是:具体来说,为了将人工指导纳入大语言模型驱动的多智能体辩论框架,将数据质量评估任务转化为阅读理解问题,从而能够灵活地将自定义的数据评估标准作为辩论题目。同时,结合了自由辩论与预设立场辩论的优点,提出了一种两阶段的辩论策略。在第一轮执行预设立场辩论,通过指派两名观点相反的正方智能体与反方智能体最大程度地提升辩论过程中的观点多样性;从第二轮开始,正方智能体与反方智能体执行自由辩论,通过相互评价与一个显式策略决定辩手的立场变更情况,以消除引入第三方智能体的评价偏差。此外,我们还在辩论结束后额外通过一名智能体以编辑的角色对未通过辩论环节的样本进行修改,以进一步提升数据样本的可用性,从而进一步提高对于数据样本的过滤优化,实现提高指令数据优化的质量。
34、在上述技术方案中,通过获取原始指令微调数据样本,然后基于原始指令微调数据样本获取论题数据,并将论题数据输出到正方智能体以及反方智能体,基于所述正方智能体与所述反方智能体对于论题数据进行辩论,若反方胜出,则对所述原始指令微调数据样本进行修改,否则不修改所述原始指令微调数据样本,通过将数据质量评估任务转化为阅读理解问题,从而能够灵活地将自定义的数据评估标准作为辩论题目,通过辩论的方式以胜方的论述内容对指令数据进行优化,可以提高指令数据优化适用性,实现提高指令数据优化的质量,从而能够有效地解决相关技术中存在的指令数据优化的质量不高的问题。
1.一种基于多智能体辩论的指令数据优化方法,其特征在于,包括:
2.如权利要求1所述的方法,其特征在于,在所述将所述论题数据输出到正方智能体以及反方智能体的方法中,所述方法还包括:
3.如权利要求2所述的方法,其特征在于,在所述正方智能体与所述反方智能体进行第二轮辩论之后,所述方法包括:
4.如权利要求2所述的方法,其特征在于,在所述基于所述反方第二轮可信度分数与所述正方第二轮可信度分数确定胜方的方法中,所述方法还包括:
5.如权利要求4所述的方法,其特征在于,在所述确定分数低于所述可信度阈值为胜方的方法中,所述方法还包括:
6.如权利要求4所述的方法,其特征在于,在所述正方可信度分数、所述反方可信度分数均一直低于所述可信度阈值时,其中,正方可信度分与反可信度分数为正方智能体与反方智能体在每轮辩论后获得的可信度分数,所述方法还包括:
7.一种基于多智能体辩论的指令数据优化装置,其特征在于,包括:
8.如权利要求7所述的装置,其特征在于,所述装置还包括:
9.一种电子设备,其特征在于,包括:至少一个处理器以及至少一个存储器,其中,
10.一种存储介质,其上存储有计算机可读指令,其特征在于,所述计算机可读指令被一个或多个处理器执行,以实现如权利要求1至6中任一项所述的基于多智能体辩论的指令数据优化方法。
