本技术涉及计算机,尤其涉及一种基于自注意力机制和生成对抗网络的图像描述方法及装置。
背景技术:
1、图像描述任务的目标是输出给定图像的文字描述,描述语句必须包含图像中的关键对象和他们之间的关系,并且句子要符合语法及通顺连贯,因此这是一项极具挑战性的任务。
2、现有的图像描述方法主要是提取预设的图像区域特征;构建拓展层归一化的编码器和增强自注意力机制的解码器所形成的图像描述网络结构;设计训练方法,先通过交叉熵损失函数对图像描述模型进行模型训练,再通过基于强化学习的训练方法对图像描述网络结构进行模型优化,形成训练后的图像描述模型;输入待检索的图像,通过训练后的图像描述模型推理输出检测结果,生成单词组成一个能够描述输入图像的语句。
3、尽管现有图像描述方法已经取得了巨大成功,但是仍然存在一些局限:(1)目前的注意力机制仅是对跨模态(图像到文字)的共同注意力进行建模,而忽略了同一模态间(文字到文字)的自注意力;(2)现有的图像描述模型通常比较浅显,不能够理解不同对象之间的复杂关系,使得生成的描述较为简单;(3)使用cnn网络提取的区域视觉特征可能无法包含图像中的所有对象,从而导致生成描述时的视觉表示不充分。
技术实现思路
1、本技术提供一种基于自注意力机制和生成对抗网络的图像描述方法及装置,用以解决图像描述的准确性低、丰富不足以及整体关联性较弱的问题。
2、第一方面,本技术提供一种基于自注意力机制和生成对抗网络的图像描述方法,包括:
3、获取待生成语言描述的目标图像;
4、根据faster r-cnn和卷积神经网络对所述目标图像进行特征提取,得到第一图像特征向量;
5、将所述第一图像特征向量输入编码器-解码器框架中进行特征融合处理,得到目标图像特征向量;
6、根据所述目标图像特征向量和词向量库,生成第一描述语句,所述词向量库用于指示历史词向量和历史图像特征向量的对应关系;
7、根据所述第一描述语句和生成对抗网络,确定所述目标图像对应的目标描述语句。
8、可选的,所述目标图像包括:多个目标对象,所述根据faster r-cnn和卷积神经网络对所述目标图像进行特征提取,得到第一图像特征向量,包括:
9、根据所述faster r-cnn对目标图像进行目标检测分析,确定多个目标对象,并对多个目标对象进行位置提取,得到多个目标对象的坐标值;
10、根据所述卷积神经网络对每个目标对象进行特征提取,得到多个目标对象的卷积特征;
11、根据多个目标对象的坐标值和多个目标对象的卷积特征,确定第一图像特征向量。
12、可选的,所述编码器-解码器框架包括:自注意力模块和前馈神经网络模块模块,所述将所述第一图像特征向量输入编码器-解码器框架中进行特征融合处理,得到目标描述语句,包括:
13、将所述第一图像特征向量输入至编码器,根据所述自注意力模块对第一图像特征向量进行特征融合处理,得到第二图像特征向量;
14、根据所述前馈神经网络模块对所述第二图像特征向量进行特征拟合处理,得到目标图像特征向量。
15、可选的,所述根据所述目标图像特征向量和词向量库,生成第一描述语句,包括:
16、获取所述词向量库中所述目标图像特征向量对应的位置词向量;
17、将所述目标图像特征向量和所述位置词向量输入至所述编码器-解码器框架中,确定第一描述语句。
18、可选的,所述生成对抗网络包括:生成器、判别器以及语言评估模块,所述根据所述第一描述语句和生成对抗网络,确定所述目标图像对应的目标描述语句,包括:
19、根据所述生成器对所述第一描述语句进行图像生成处理,得到样本图像;
20、采用所述判别器对所述样本图像和所述目标图像进行数据分析,得到奖励值,所述奖励值用于指示样本图像与目标图像的相似值;
21、判断所述奖励值是否大于预设奖励值;
22、当所述奖励值大于所述预设奖励值时,根据所述语言评估模块对所述第一描述语句进行真实性分析,得到所述第一描述语句的cider值;
23、判断所述cider值是否大于预设cider值;
24、若所述cider值大于所述预设cider值,则确定所述第一描述语句为目标描述语句。
25、可选的,所述方法还包括:
26、当所述奖励值不大于所述预设奖励值时,控制所述生成器根据所述奖励值对所述第一描述语句进行优化处理,直至所述奖励值大于所述预设奖励值。
27、可选的,所述方法还包括:
28、若所述cider值不大于所述预设cider值,则重新根据所述faster r-cnn和所述卷积神经网络对所述目标图像进行特征提取,得到新的特征向量;
29、对所述新的特征向量进行特征融合处理,并根据融合处理后的特征向量确定所述目标图像对应的目标描述语句。
30、第二方面,本技术提供一种基于自注意力机制和生成对抗网络的图像描述装置,包括:
31、获取模块,用于获取待生成语言描述的目标图像;
32、处理模块,用于根据faster r-cnn和卷积神经网络对所述目标图像进行特征提取,得到第一图像特征向量;
33、所述处理模块,用于将所述第一图像特征向量输入编码器-解码器框架中进行特征融合处理,得到目标图像特征向量;
34、所述生成模块,用于根据所述目标图像特征向量和词向量库,生成第一描述语句,所述词向量库用于指示历史词向量和历史图像特征向量的对应关系;
35、所述确定模块,用于根据所述第一描述语句和生成对抗网络,确定所述目标图像对应的目标描述语句。
36、可选的,所述确定模块,还用于根据所述faster r-cnn对目标图像进行目标检测分析,确定多个目标对象;
37、所述处理模块,还用于并对多个目标对象进行位置提取,得到多个目标对象的坐标值;
38、所述处理模块,还用于根据所述卷积神经网络对每个目标对象进行特征提取,得到多个目标对象的卷积特征;
39、所述确定模块,还用于根据多个目标对象的坐标值和多个目标对象的卷积特征,确定第一图像特征向量。
40、可选的,所述处理模块,还用于将所述第一图像特征向量输入至编码器,根据所述自注意力模块对第一图像特征向量进行特征融合处理,得到第二图像特征向量;
41、所述处理模块,还用于根据所述前馈神经网络模块对所述第二图像特征向量进行特征拟合处理,得到目标图像特征向量。
42、可选的,所述获取模块,还用于获取所述词向量库中所述目标图像特征向量对应的位置词向量;
43、所述确定模块,还用于将所述目标图像特征向量和所述位置词向量输入至所述编码器-解码器框架中,确定第一描述语句。
44、可选的,所述基于自注意力机制和生成对抗网络的图像描述装置,还包括:判断模块;
45、所述处理模块,还用于根据所述生成器对所述第一描述语句进行图像生成处理,得到样本图像;
46、所述处理模块,还用于采用所述判别器对所述样本图像和所述目标图像进行数据分析,得到奖励值,所述奖励值用于指示样本图像与目标图像的相似值;
47、所述判断模块,还用于判断所述奖励值是否大于预设奖励值;
48、所述确定模块,还用于在所述奖励值大于所述预设奖励值时,根据所述语言评估模块对所述第一描述语句进行真实性分析,得到所述第一描述语句的cider值;
49、所述判断模块,还用于判断所述cider值是否大于预设cider值;
50、所述确定模块,还用于在所述cider值大于所述预设cider值,则确定所述第一描述语句为目标描述语句。
51、可选的,所述处理模块,还用于当所述奖励值不大于所述预设奖励值时,控制所述生成器根据所述奖励值对所述第一描述语句进行优化处理,直至所述奖励值大于所述预设奖励值。
52、可选的,所述处理模块,还用于在所述cider值不大于所述预设cider值,则重新根据所述faster r-cnn和所述卷积神经网络对所述目标图像进行特征提取,得到新的特征向量;
53、所述处理模块,还用于对所述新的特征向量进行特征融合处理,并根据融合处理后的特征向量确定所述目标图像对应的目标描述语句。
54、第三方面,本技术提供一种基于自注意力机制和生成对抗网络的图像描述设备,包括:
55、存储器;
56、处理器;
57、其中,所述存储器存储计算机执行指令;
58、所述处理器执行所述存储器存储的计算机执行指令,以实现如上述第一方面及第一方面各种可能的实现所述的基于自注意力机制和生成对抗网络的图像描述方法。
59、第四方面,本技术提供一种计算机存储介质,其特征在于,所述计算机存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如第一方面及第一方面各种可能的实现所述的基于自注意力机制和生成对抗网络的图像描述方法。
60、本技术提供的基于自注意力机制和生成对抗网络的图像描述方法,通过获取待生成语言描述的目标图像,根据faster r-cnn和卷积神经网络对所述目标图像进行特征提取,得到第一图像特征向量,将所述第一图像特征向量输入编码器-解码器框架中进行特征融合处理,得到目标图像特征向量,根据所述目标图像特征向量和词向量库,生成第一描述语句,所述词向量库用于指示历史词向量和历史图像特征向量的对应关系,根据所述第一描述语句和生成对抗网络,确定所述目标图像对应的目标描述语句;该方法提升了图像描述的准确性,增加了图像描述的丰富性和关联性。
1.一种基于自注意力机制和生成对抗网络的图像描述方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述目标图像包括:多个目标对象,所述根据faster r-cnn和卷积神经网络对所述目标图像进行特征提取,得到第一图像特征向量,包括:
3.根据权利要求1所述的方法,其特征在于,所述编码器-解码器框架包括:自注意力模块和前馈神经网络模块模块,所述将所述第一图像特征向量输入编码器-解码器框架中进行特征融合处理,得到目标描述语句,包括:
4.根据权利要求1所述的方法,其特征在于,所述根据所述目标图像特征向量和词向量库,生成第一描述语句,包括:
5.根据权利要求1所述的方法,其特征在于,所述生成对抗网络包括:生成器、判别器以及语言评估模块,所述根据所述第一描述语句和生成对抗网络,确定所述目标图像对应的目标描述语句,包括:
6.根据权利要求5所述的方法,其特征在于,所述方法还包括:
7.根据权利要求5所述的方法,其特征在于,所述方法还包括:
8.一种基于自注意力机制和生成对抗网络的图像描述装置,其特征在于,包括:
9.一种基于自注意力机制和生成对抗网络的图像描述设备,其特征在于,包括:处理器,以及与所述处理器通信连接的存储器;
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机执行指令,所述计算机执行指令被处理器执行时用于实现如权利要求1至7任一项所述的方法。
