面向行为多样性的智能体测试方法及装置

    专利2026-09-22  21


    本发明属于计算机,尤其涉及一种面向行为多样性的智能体测试方法及装置。


    背景技术:

    1、对抗型游戏呈现了多个智能体互动的场景,每个智能体都在努力优化自己的个人目标,击败对手,并取得胜利。深度强化学习(drl)已经成为解决和理解对抗型游戏的一种开创性的方法。它的应用范围广泛,从在棋盘游戏中实现超级性能,到解决博弈问题、商业竞争、政治科学和资源分配任务等关键环境。drl为智能体提供了从大量数据中学习、适应动态环境和优化复杂目标的能力。然而,在对抗环境中的训练智能体过程是复杂的。

    2、在复杂的环境中,智能体的策略不仅需要适应一套静态的规则,而且还需要应对对手不断变化的策略。如果不能有效地处理,这可能导致智能体很脆弱,难以在不同的场景中推广。在商业竞争或智能博弈等关键情况下,不强大的智能体可能会导致可怕的后果,从经济损失到人类生命风险。

    3、目前一些方法是在扰动智能体的观察结果(即游戏环境),使智能体选择策略中的次优行为,从而导致其失败。然而,这些方法在现实场景中可能并不实用,因为改变物理环境,如在输入图像中引入像素噪声,往往具有挑战性。此外,这种方法可能不能有效地揭示与环境中的数字扰动无关的固有决策缺陷。另一些研究集中在训练对抗策略,在游戏中击败受害者智能体,以这种方式训练的对抗性策略可以暴露目标策略的决策弱点。然而,由于对抗性策略的训练是击败固定的受害者,专注于发现和利用最容易发现的弱点,同时可能忽略其他弱点,因此这样的方法所确定的弱点的多样性有限。一些研究则强调了测试多样性的重要性,但这些方法主要依赖于基于好奇心的方法来增强多样性,这可能不能提供直接的指导。在复杂任务和环境中,虽然这些方法可以提高好奇心的分数,但它们可能不能有效地增强已识别的决策缺陷的多样性。

    4、因此,目前迫切需要一种测试智能体的策略多样性的方法,特别是在安全攸关的场景中。


    技术实现思路

    1、针对上述问题,本发明提出一种面向行为多样性的智能体测试方法及装置。本发明构建测试智能体并设计约束条件,通过在训练中添加偏好的约束来动态调整测试智能体的策略,通过测试智能体与目标智能体进行交互,从而揭示目标智能体的多样的弱点。

    2、本发明采用的技术方案为:

    3、一种面向行为多样性的智能体测试方法,包括以下步骤:

    4、1)为双方智能体的相互对战行为设计约束条件,该双方智能体包括测试智能体和目标智能体;

    5、2)使用qmix算法对测试智能体进行训练,并记录目标智能体每场对战的状态序列;

    6、3)检查滑动窗口内目标智能体的状态序列的多样性是否充足;

    7、4)若多样性充足,则继续按照当前状态训练测试智能体;若多样性不足,则选择合适的约束条件应用于测试智能体的训练过程中;

    8、5)训练完成后在测试时,记录目标智能体的失效场景。

    9、进一步地,设计的约束条件包括:

    10、移动范围cmove:将智能体移动范围的边界限制为其默认值的50%;

    11、攻击范围将智能体攻击范围限制在其默认值的50%;

    12、攻击范围将智能体攻击范围限制在其默认值的150%;

    13、伤害值cdamage:将智能体每次攻击的伤害值限制在其默认损害的50%以下;

    14、双方智能体的血量值差chealth:限制双方智能体的血量值差异小于测试智能体的最大健康值的50%;

    15、双方智能体的距离限制双方智能体之间的距离小于攻击范围的50%;

    16、双方智能体的距离限制双方智能体之间的距离大于攻击范围的50%。

    17、进一步地,通过qmix模型实现qmix算法,该qmix模型包括两部分:

    18、代理网络,基于drqn网络构建,包含由mlp多层神经网络构成的输入层和输出层,以及由gru门控循环神经网络构成的中间层;该代理网络以当前时刻的智能体的观测值和前一时刻的智能体的动作作为输入,以当前时刻的智能体的值函数作为输出;

    19、混合网络,为前馈神经网络,以代理网络输出的当前时刻的智能体的值函数作为输入,以联合动作价值函数作为输出。

    20、进一步地,使用qmix算法对测试智能体进行训练的步骤包括:

    21、qmix模型通过设定评估网络和目标网络进行更新,其中评估网络用于计算当前状态的q值,目标网络用于计算目标q值;

    22、使用ε-greedy算法选择智能体的动作;

    23、通过评估网络计算每个智能体在给定状态下采取每个动作的估计的q值;

    24、通过目标网络计算每个智能体在下一个状态下采取的最优动作对应的目标q值;

    25、评估网络接收每个智能体选择的动作对应的q值作为输入,用于计算当前状态下每个动作的估计q值;目标网络接收每个智能体的目标q值;

    26、以q-learning方法计算目标值r+γ*qtot(target),其中r为得到的奖励值,γ为超参数,qtot(target)为目标q值;

    27、计算目标值与估计q值之差,得到td-error;

    28、将mask扩展为td-error相同的大小,并抹掉填充的经验的td-error,进行梯度清零,使用反向传播算法计算损失函数对于网络参数的梯度,使用该梯度更新目标网络的参数,使目标网络逼近真实q值。

    29、进一步地,检查滑动窗口内目标智能体的状态序列的多样性是否充足的步骤包括:

    30、计算大小为w的滑动窗口内包含的状态序列s与之前所有对战的状态序列s′之间的距离dis(s,s′),从中找出最小距离为ds′;

    31、若ds′大于预设的相似性阈值,则认为该状态序列s为一个新出现的失效轨迹;

    32、计算在滑动窗口范围内新出现的失效轨迹的频率freq=#seq/w,该频率代表多样性,其中#seq表示新出现的失效轨迹的数量;若freq大于预设的频率阈值,则表示多样性充足,否则表示多样性不足。

    33、进一步地,通过多样性检查模块来检查滑动窗口内目标智能体的状态序列的多样性是否充足。

    34、进一步地,选择合适的约束条件的步骤包括:

    35、记录历史测试过程中每个约束的多样性收益作为每个约束的全局偏好;

    36、实时记录滑动窗口内每个约束的违反情况来表示每个约束的局部偏好;

    37、将全局偏好和局部偏好进行加权求和,作为每个约束的总体偏好;

    38、根据该总体偏好,使用ε-greedy算法选择合适的约束。

    39、进一步地,通过约束选择模块选择合适的约束条件,该约束选择模块包括历史多样性收益分析模块和实时行为评估模块,其中历史多样性收益分析模块用于计算蒙恩约束的全局偏好、局部偏好和总体偏好;该实时行为评估模块用于实时记录约束的违反情况,计算最近的约束指标。

    40、进一步地,约束指标包括:测试智能体在给定的时间步长内离开受限移动范围的次数imove、在给定时间步长上的平均实际攻击范围iattack、测试智能体在给定时间步长上的平均伤害值idamage、在给定的时间步长上双方智能体的血量差值的平均值ihealth以及双方智能体在给定时间步长上的平均距离idistance。

    41、一种面向行为多样性的智能体测试装置,包括存储器和处理器,该存储器中存储有计算机程序,该处理器执行该计算机程序时实现上述方法的步骤。

    42、一种存储介质,存储有计算机程序,该计算机程序被运行时执行上述方法的步骤。

    43、与现有技术相比,本发明的有益效果如下:

    44、1)通过在训练中添加约束,作为明确的指导来训练不同策略的对抗智能体(即测试智能体),这种对抗型智能体可以揭示目标智能体的各种弱点;

    45、2)通过添加约束产生的对抗智能体的行为更加符合现实场景,能够为真实的场景提供更加合理的仿真环境。


    技术特征:

    1.一种面向行为多样性的智能体测试方法,其特征在于,包括以下步骤:

    2.如权利要求1所述的方法,其特征在于,设计的约束条件包括:

    3.如权利要求1所述的方法,其特征在于,通过qmix模型实现qmix算法,该qmix模型包括两部分:

    4.如权利要求3所述的方法,其特征在于,使用qmix算法对测试智能体进行训练的步骤包括:

    5.如权利要求1所述的方法,其特征在于,检查滑动窗口内目标智能体的状态序列的多样性是否充足的步骤包括:

    6.如权利要求1或5所述的方法,其特征在于,通过多样性检查模块来检查滑动窗口内目标智能体的状态序列的多样性是否充足。

    7.如权利要求1所述的方法,其特征在于,选择合适的约束条件的步骤包括:

    8.如权利要求7所述的方法,其特征在于,通过约束选择模块选择合适的约束条件,该约束选择模块包括历史多样性收益分析模块和实时行为评估模块,其中历史多样性收益分析模块用于计算蒙恩约束的全局偏好、局部偏好和总体偏好;该实时行为评估模块用于实时记录约束的违反情况,计算最近的约束指标。

    9.如权利要求8所述的方法,其特征在于,约束指标包括:测试智能体在给定的时间步长内离开受限移动范围的次数imove、在给定时间步长上的平均实际攻击范围iattack、测试智能体在给定时间步长上的平均伤害值idamage、在给定的时间步长上双方智能体的血量差值的平均值ihealth以及双方智能体在给定时间步长上的平均距离idistance。

    10.一种面向行为多样性的智能体测试装置,其特征在于,包括存储器和处理器,该存储器中存储有计算机程序,该处理器执行该计算机程序时实现权利要求1-9任一项所述方法的步骤。


    技术总结
    本发明提供一种面向行为多样性的智能体测试方法及装置,属于计算机技术领域,本发明构建测试智能体,并设计约束条件;训练测试智能体并基于滑动窗口检查目标智能体的状态序列的多样性;判断多样性是否充足,进而根据情况选择偏好的约束条件继续训练。本发明通过在训练中添加约束,作为明确的指导来训练不同策略的测试智能体,通过测试智能体可以揭示目标智能体的各种弱点。

    技术研发人员:马序言,王亚文,王俊杰,吴泊逾,闫熠光,李守斌,王青
    受保护的技术使用者:中国科学院软件研究所
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-102155.html

    最新回复(0)