手势识别方法、电子设备和计算机可读存储介质与流程

    专利2026-10-05  2


    本申请涉及计算机视觉,特别是涉及一种手势识别方法、电子设备和计算机可读存储介质。


    背景技术:

    1、随着计算机视觉领域的不断细化,对于手势识别也愈发得到重视,手势可以在无麦克风、难以收音、聋哑人群、远程指挥和人机交互等场景中有效地传递信息。现有技术中通常是采集训练数据并为训练数据设置标签,从而有监督地训练识别模型,由于手势具有动态变化的特征导致手势存在大量的组合,且不同场景下的手势区别较大,因此,常规的手势识别方法难以识别新的手势导致识别准确率较低,且在不同场景中进行手势识别时的鲁棒性较差。有鉴于此,如何提高手势识别的准确率和鲁棒性成为了亟待解决的问题。


    技术实现思路

    1、本申请主要解决的技术问题是提供一种手势识别方法、电子设备和计算机可读存储介质,能够提高手势识别的准确率和鲁棒性。

    2、为解决上述技术问题,本申请第一方面提供一种手势识别方法,该方法包括:获取至少一个分类描述文本和至少一个待分类骨架序列;其中,所述分类描述文本包括对手势的描述内容,所述待分类骨架序列是基于多个标注有关键点的手部图像得到的;将所有所述分类描述文本输入对比学习模型的文本编码器,将所有所述待分类骨架序列输入对比学习模型的图像编码器,得到所述对比学习模型输出的所述待分类骨架序列与所述分类描述文本的匹配结果,基于所述匹配结果,确定所述待分类骨架序列匹配的目标手势;其中,所述对比学习模型是利用训练骨架序列及其匹配的训练描述文本训练得到的,所述训练描述文本包括对所述训练骨架序列匹配的训练手势的描述内容。

    3、为解决上述技术问题,本申请第二方面提供一种电子设备,该电子设备包括:相互耦接的存储器和处理器,其中,所述存储器存储有程序数据,所述处理器调用所述程序数据以执行上述第一方面所述的方法。

    4、为解决上述技术问题,本申请第三方面提供一种计算机可读存储介质,其上存储有程序数据,所述程序数据被处理器执行时实现上述第一方面所述的方法。

    5、上述方案,获取至少一个分类描述文本和至少一个待分类骨架序列,其中,分类描述文本中包括对手势进行描述的描述内容,待分类骨架序列是基于多个对手部的关键点进行标注后的手部图像得到的,多个标注有关键点的手部图像组成的待分类骨架序列能够更优地反馈手势的动态变化,将所有分类描述文本输入对比学习模型的文本编码器,将所有待分类骨架序列输入对比学习模型的图像编码器,得到对比学习模型分析后输出的待分类骨架序列与分类描述文本之间的匹配结果,基于待分类骨架序列匹配到的分类描述文本中对手势的描述内容,得到待分类骨架序列匹配的目标手势。其中,对比学习模型是利用训练骨架序列及其匹配的训练描述文本训练得到的,训练描述文本包括对训练骨架序列匹配的训练手势的描述内容,因此,对比学习模型采用零样本学习方式进行训练,且在训练过程中能够学习描述文本的特征和骨架序列的特征之间的关联性,当待分类骨架序列中包括训练阶段未包括的手势时,或者将对比学习模型应用于不同场景中时,只要分类描述文本包括对手势的描述内容,对比学习模型仍能够对新的手势进行特征匹配,从而基于匹配结果准确识别出新的手势,提高手势识别的准确率和鲁棒性。



    技术特征:

    1.一种手势识别方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的方法,其特征在于,所述待分类骨架序列和所述训练骨架序列均经过预处理,所述预处理的过程包括:

    3.根据权利要求2所述的方法,其特征在于,所述基于多个所述手部图像上的关键点坐标,确定每个所述手部图像对应的静态特征和多个所述手部图像对应的动态特征,包括:

    4.根据权利要求2所述的方法,其特征在于,所述关键点坐标设置在三维关键点坐标系中,所述三维关键点坐标系基于所述手部图像上的部分关键点构建。

    5.根据权利要求1所述的方法,其特征在于,所述对比学习模型的训练过程包括:

    6.根据权利要求5所述的方法,其特征在于,所述将所有所述训练描述文本输入所述文本编码器,将所有所述训练骨架序列输入所述图像编码器,得到每个所述训练样本对中所述训练骨架序列和所述训练描述文本之间的预估匹配概率,包括:

    7.根据权利要求5所述的方法,其特征在于,相互匹配的所述训练骨架序列和所述训练描述文本对应有配对标签,对应有所述配对标签的所述训练样本对为训练正样本对,未对应所述配对标签的所述训练样本对为训练负样本对,所述收敛条件与所述训练正样本对的预估匹配概率以及所述训练负样本对的预估匹配概率相关。

    8.根据权利要求1所述的方法,其特征在于,所述将所有所述分类描述文本输入对比学习模型的文本编码器,将所有所述待分类骨架序列输入对比学习模型的图像编码器,得到所述对比学习模型输出的所述待分类骨架序列与所述分类描述文本的匹配结果,基于所述匹配结果,确定所述待分类骨架序列匹配的目标手势,包括:

    9.一种电子设备,其特征在于,包括:相互耦接的存储器和处理器,其中,所述存储器存储有程序数据,所述处理器调用所述程序数据以执行如权利要求1-8中任一项所述的方法。

    10.一种计算机可读存储介质,其上存储有程序数据,其特征在于,所述程序数据被处理器执行时实现如权利要求1-8中任一项所述的方法。


    技术总结
    本申请公开了一种手势识别方法、电子设备和计算机可读存储介质,该方法包括:获取至少一个分类描述文本和至少一个待分类骨架序列;其中,分类描述文本包括对手势的描述内容,待分类骨架序列是基于多个标注有关键点的手部图像得到的;将所有分类描述文本输入对比学习模型的文本编码器,将所有待分类骨架序列输入对比学习模型的图像编码器,得到对比学习模型输出的待分类骨架序列与分类描述文本的匹配结果,基于匹配结果,确定待分类骨架序列匹配的目标手势;其中,对比学习模型是利用训练骨架序列及其匹配的训练描述文本训练得到的,训练描述文本包括对训练骨架序列匹配的训练手势的描述内容。上述方案,能够提高手势识别的准确率和鲁棒性。

    技术研发人员:刘艳禹,刘忠耿
    受保护的技术使用者:浙江大华技术股份有限公司
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-102771.html

    最新回复(0)