本技术涉及计算机,具体而言,本技术涉及一种视频查询方法、及装置。
背景技术:
1、现有的视频查询方式通常是根据跨模态查询模型进行查询,比如,用户可以输入查询文本,通过跨模态查询模型来提取查询文本的文本特征,并进行跨模态匹配,确定对应的视频特征,从而筛选到符合要求的视频。
2、但是,现有的跨模态查询模型只能利用预先标注好文本与视频的对应关系的数据来进行模型训练,训练后的模型的识别准确率较低。
技术实现思路
1、本技术各实施例提供了一种视频查询方法、装置、电子设备及存储介质,可以提升视频查询的准确性。
2、所述技术方案如下:
3、第一方面,本技术提供了一种视频查询方法,所述方法包括:获取待分析的视频数据、视频数据的查询文本和视频数据的描述文本,所述描述文本包括视频描述信息;基于视频数据、查询文本和描述文本,提取视频数据的第一特征、描述文本的第二特征和查询文本的第三特征;依据第一特征、第二特征进行跨模态特征交互,使得视频数据的第一特征融合描述文本的额外语义信息,得到第四特征;依据第三特征和第四特征,训练跨模态查询模型,以依据训练好的跨模态查询模型进行视频查询。
4、优选的,所述方法还包括:获取训练数据,训练数据包括视频数据和查询文本的跨模态数据对;依据训练数据,训练跨模态查询模型。
5、优选的,所述描述文本还包括视频数据的视频标题信息,所述方法还包括:依据视频标题信息和训练数据中的视频数据组成跨模态数据对,确定扩充训练数据,以依据扩充训练数据对跨模态查询模型进行训练。
6、优选的,所述描述文本包括多个视频标题信息;所述依据视频标题信息和训练数据中的视频数据组成跨模态数据对,确定扩充训练数据,包括:评估多个视频标题信息之间的语义相似性,并结合视频数据对应的查询文本对视频标题信息进行过滤,得到目标视频标题;依据目标视频标题和训练数据中的视频数据组成跨模态数据对,确定扩充训练数据。
7、优选的,所述基于视频数据、查询文本和描述文本,提取视频数据的第一特征、描述文本的第二特征和查询文本的第三特征,包括:基于跨模态查询模型的视觉编码器对视频数据进行特征识别,确定视频数据的第一特征;基于跨模态查询模型的文本编码器对查询文本和描述文本进行特征识别,确定描述文本的第二特征和查询文本的第三特征。
8、优选的,所述依据第一特征、第二特征进行跨模态特征交互,使得视频数据的第一特征融合描述文本的额外语义信息,得到第四特征,包括:将第一特征、第二特征传递给跨模态查询模型的跨模态交互模块,所述跨模态交互模块基于共同注意力机制利用视频数据和视频描述信息之间的互补性进行特征融合;基于跨模态交互模块,使得视频数据的第一特征融合描述文本的额外语义信息,得到第四特征。
9、优选的,所述方法还包括:将视频数据的全部视频描述信息进行分组,并进行特征提取确定每组视频描述信息的描述表征;将各组视频描述信息的描述表征进行组合,得到全局描述表征;获取视频数据的全部查询文本,并进行特征提取确定全局查询表征;依据全局描述表征和全局查询表征,建立文本与文本之间的映射关系,以依据文本与文本之间的映射关系进行视频查询。
10、第二方面,本技术提供了一种视频查询方法,所述方法包括:获取文本类型的视频查询信息;将视频查询信息输入到训练好的跨模态查询模型中,确定目标视频数据,训练好的跨模态查询模型用于:对视频查询信息进行文本特征识别,确定查询文本向量;基于查询文本向量进行跨模态匹配,确定视频特征向量,以确定视频特征向量对应的目标视频数据;所述视频特征向量为融合了视频数据的描述文本的文本特征的向量,所述描述文本包括视频描述信息;反馈目标视频数据作为查询结果。
11、优选的,所述基于查询文本向量进行跨模态匹配,确定视频特征向量,包括:基于查询文本向量在文本向量空间中进行匹配,确定目标文本向量,并依据目标文本向量进行跨模态匹配,确定视频向量空间中与目标文本向量对应的的视频特征向量;或,基于查询文本向量在文本向量空间中进行匹配,确定第一文本向量,并依据文本与文本之间的映射关系,确定文本向量空间中与第一文本向量对应的第二文本向量,并依据第二文本向量进行跨模态匹配,确定视频向量空间中与第二文本向量对应的的视频特征向量,其中,文本与文本之间的映射关系依据视频数据的全部视频描述信息的全局描述表征和全部查询文本的全局查询表征确定。
12、第三方面,本技术提供了一种视频查询装置,所述装置包括:相关数据获取模块,用于获取待分析的视频数据、视频数据的查询文本和视频数据的描述文本,所述描述文本包括视频描述信息;数据特征提取模块,用于基于视频数据、查询文本和描述文本,提取视频数据的第一特征、描述文本的第二特征和查询文本的第三特征;数据特征融合模块,用于依据第一特征、第二特征进行跨模态特征交互,使得视频数据的第一特征融合描述文本的额外语义信息,得到第四特征;查询模型训练模块,用于依据第三特征和第四特征,训练跨模态查询模型,以依据训练好的跨模态查询模型进行视频查询。
13、根据本技术的一个方面,一种电子设备,包括至少一个处理器以及至少一个存储器,其中,所述存储器上存储有计算机可读指令;所述计算机可读指令被一个或多个所述处理器执行,使得电子设备实现如上所述的方法。
14、根据本技术的一个方面,一种存储介质,其上存储有计算机可读指令,所述计算机可读指令被一个或多个处理器执行,以实现如上所述的方法。
15、根据本技术的一个方面,一种计算机程序产品,计算机程序产品包括计算机可读指令,计算机可读指令存储在存储介质中,电子设备的一个或多个处理器从存储介质读取计算机可读指令,加载并执行该计算机可读指令,使得电子设备实现如上所述的方法。
16、本技术提供的技术方案带来的有益效果是:
17、本技术的方案可以应用在跨模态查询模型的训练场景中,现有的跨模态查询模型的训练通常是利用预先标注好的文本与视频的数据对(之间的映射关系)来进行特征提取、特征映射、基于标注进行模型调整,从而完成跨模态查询模型的训练。但是采用该方案只关注了文本和视频各自本身的特征来进行关联和学习,导致跨模态查询模型的查询结果准确度较低。本技术的方案可以在视频数据的特征中融合视频数据的描述文本(如视频标题、视频字幕、视频评论等)的额外语义信息,从而增强视频特征,进而训练跨模态查询模型,以使得训练好的跨模态查询模型的查询结果更加准确。
18、具体来说,本技术可以获取待分析的视频数据、视频数据的查询文本和视频数据的描述文本,其中,描述文本包括视频描述信息,视频描述信息可以包括视频数据相关的评论、字幕等。本方案可以利用跨模态查询模型的文本编码器和视觉编码器对文本和视频分别进行特征提取,得到视频数据的第一特征、描述文本的第二特征和查询文本的第三特征;之后,可以依据视频数据的第一特征和描述文本的第二特征进行特征融合,使得视频数据的第一特征融合描述文本的额外语义信息,对视频数据的第一特征进行增强,得到第四特征。进而依据第三特征和第四特征进行跨模态查询模型的训练。跨模态查询模型可以包括用于对文本进行特征提取的文本编码器、用于对图像进行特征提取的视觉编码器、用于学习文本特征和视觉特征之间的跨模态关系的匹配模块等;文本特征(如第三特征)可以存储在文本向量空间内,视觉特征(如第四特征)可以存储在视频向量空间内,以依据匹配模块来学习文本向量空间和视频向量空间之间的特征映射关系。本方案可以利用第三特征和增强后的第四特征来对跨模态查询模型的匹配模块进行训练。
1.一种视频查询方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述方法还包括:
3.根据权利要求2所述的方法,其特征在于,所述描述文本还包括视频数据的视频标题信息,所述方法还包括:
4.根据权利要求3所述的方法,其特征在于,所述描述文本包括多个视频标题信息;所述依据视频标题信息和训练数据中的视频数据组成跨模态数据对,确定扩充训练数据,包括:
5.根据权利要求1所述的方法,其特征在于,所述基于视频数据、查询文本和描述文本,提取视频数据的第一特征、描述文本的第二特征和查询文本的第三特征,包括:
6.根据权利要求1所述的方法,其特征在于,所述依据第一特征、第二特征进行跨模态特征交互,使得视频数据的第一特征融合描述文本的额外语义信息,得到第四特征,包括:
7.根据权利要求2所述的方法,其特征在于,所述方法还包括:
8.一种视频查询方法,其特征在于,所述方法包括:
9.根据权利要求8所述的方法,其特征在于,所述基于查询文本向量进行跨模态匹配,确定视频特征向量,包括:
10.一种视频查询装置,其特征在于,所述装置包括:
