一种基于UniEVA模型的异常行为检测系统及方法

    专利2026-08-18  10


    本发明属于行为识别,具体涉及一种基于unieva模型的异常行为检测系统及方法。


    背景技术:

    1、异常行为识别是计算机视觉领域的一项重要研究,特别是在视频监控和安全系统中,此项技术发挥着关键作用。视频中的异常行为,如跌倒、打架等,若未及时检测和处理,可能对公共安全产生不良影响,引发事故,造成不可估量的人身及财产损失。所以,在视频行为识别的应用领域,针对行人异常行为的准确识别尤为关键。目前在行为识别算法中,有两种主流模型,即卷积神经网络和vit(vision transformer)。卷积神经网络能够通过小范围的卷积操作减少局部冗余,从而降低计算复杂性。vit通过自注意力机制来比较全局相似度,实现了长距离目标关联。

    2、卷积神经网络和vit在视频行为识别中有各自的局限性,卷积神经网络在处理视频时,由于其局部感知的设计,难以有效捕捉长距离的依赖关系,这可能限制了其对视频中复杂行为的准确理解。另一方面,vit通过全局自注意力机制在一定程度上能够捕捉长距离依赖性,但计算所有令牌之间的相似关系可能导致较大的计算冗余,尤其在浅层网络中可能无法充分编码局部特征。


    技术实现思路

    1、针对现有技术的不足,本发明设计一种基于unieva模型的异常行为检测系统及方法,既兼顾行为识别的高准确性又保证实时性。

    2、一种基于unieva模型的异常行为检测系统,包含:局部模块、全局模块、融合模块和分类器;

    3、所述局部模块包含局部时域多头关系聚合器lt_mhra和视觉编码器eva-clip,所述视觉编码器eva-clip包含全局空域多头关系聚合器gs_mhra和前馈网络ffn;所述全局建模模块包含动态位置嵌入dpe、交叉多头关系聚合器c_mhra和前馈网络ffn;所述分类器包含全连接层和softmax激活函数;

    4、其中,局部模块利用局部时域多头关系聚合器lt_mhra得到时序建模特征,利用视觉编码器eva-clip中的全局空域多头关系聚合器gs_mhra得到图像中的空间建模特征,最后通过前馈网络进行变换得到局部特征;全局模块利用动态位置嵌入对局部特征进行深度可分离卷积操作使其隐式地学习和编码输入序列的位置信息,利用交叉多头关系聚合器提取全局时空关系,最后通过前馈网络变换得到全局特征;融合模块采用顺序方式将局部特征和全局特征融合集成为最终视频表示p;最终利用分类器对视频表示p行为分类;

    5、一种基于unieva模型的异常行为检测方法,基于上述一种基于unieva模型的异常行为检测系统实现,具体包括以下步骤:

    6、步骤1:获取监控视频流,并利用时间下采样和3d卷积将视频流投影为一个包含m个令牌的矩阵zin,输入到局部模块用于局部建模,得到局部特征zl,具体如下:

    7、步骤1.1:将包含m个令牌的矩阵zin∈rm×c通过批归一化bn得到x;其中每个令牌是一个特征维度为c的特征向量,m=t×w×h(t、h和w分别表示视频的帧数,图片帧的高度和宽度);接下来,将x输入到局部时域多头关系聚合器lt_mhra,它通过多头注意力机制学习局部3d邻域内的相邻帧之间的时序关系,得到局部时序信息lt_mhra(x);最后将局部时序信息lt_mhra(x)与矩阵zin相加,得到时序建模特征zt;其中bn表示批归一化batchnormalization;计算公式为:

    8、x=bn(zin)

    9、zt=lt_mhra(x)+zin

    10、进一步地,将x输入到局部时域多头关系聚合器lt_mhra,得到局部时序信息lt_mhra(x),具体为:

    11、局部时域多头关系聚合器lt_mhra通过学习n个头的关系聚合结果,得到n个关系矩阵rn(x),然后将n个关系矩阵拼接形成一个更大的关系矩阵,再通过学习的参数矩阵u进行线性变化将这个大的关系矩阵整合,得到多头关系聚合结果lt_mhra(x);对于关系矩阵rn(x),通过可学习参数矩阵描述令牌xi与邻域内其他令牌xj之间的局部关系,其中每个元素是一个关于令牌i和令牌j之间关系的权重函数;然后将每个头n的原始令牌x通过线性变换映射到特定的特征空间,使其表示令牌之间的关系,其中vn(x)表示线性变换;然后通过将局部关系描述矩阵与vn(x)相乘计算得到关系聚合器rn(x);其中i(i∈{1,2,…,m})表示当前令牌的索引,j表示与当前令牌i相邻的其他令牌的索引,表示邻域的范围,即与当前令牌i相关的其他令牌的索引集合,t×1×1表示在时间维度上的局部关注,u∈rc×c表示一个形状为c×c的实数域矩阵,n表示多头机制中的头数,n表示多头机制中的头的索引,即第n个头;计算公式为:

    12、

    13、

    14、lt_mhra(x)=concat(r1(x);r2(x);...;rn(x))u

    15、步骤1.2:利用视觉编码器eva-clip对图像中的空间关系进行建模;

    16、利用全局空域多头关系聚合器gs_mhra得到空间关系,具体为:

    17、首先将zt通过层归一化ln得到y,然后输入到全局空域多头关系聚合器gs_mhra,它通过多头注意力机制同时关注图像中的不同区域,并学习这些区域之间的关系,得到全局空间信息gs_mhra(y);最后将全局空间信息gs_mhra(y)与时序建模特征zt相加,得到空间特征zs;其中ln表示层归一化layer normalization;计算公式为:

    18、y=ln(zt)

    19、zs=gs_mhra(y)+zt

    20、进一步地,将y输入到全局空域多头关系聚合器gs_mhra,得到全局空间信息,具体为:

    21、全局空域多头关系聚合器gs_mhra通过学习n个头的关系聚合结果,得到n个关系矩阵rn(y),然后将n个关系矩阵拼接形成一个更大的关系矩阵,再通过学习的参数矩阵u对它进行线性变化将这个大的关系矩阵整合,得到多头关系聚合结果gs_mhra(x);对于关系矩阵rn(y),通过对单帧1×h×w中不同位置的令牌之间进行相似性的计算得到可学习参数矩阵对于每个头n通过线性变换vn(y)将原始令牌y转换为上下文向量,然后通过将与vn(y)相乘计算得到关系聚合器rn(y);其中yi和yj分别表示在单帧1×h×w中不同位置的令牌,yj′表示相邻令牌的位置,i(i∈{1,2,…,m})表示当前令牌的索引,j(j∈{1,2,…,m-1})表示与当前令牌不同位置的索引,j′∈ω1×h×w表示与yi在当前帧中相邻的其他令牌的集合;qn(·)表示查询向量,“t”表示转置,表示表示键向量,它们是不同的线性投影;计算公式为:

    22、

    23、

    24、gs_mhra(x)=concat(r1(y);r2(y);...;rn(y))u

    25、步骤1.3:利用前馈网络(ffn)对zs进行线性变化,具体为:

    26、首先将zs通过层归一化ln得到ln(zs),然后输入到前馈网络ffn进行线性变换得到ffn(ln(zs)),最后将ffn的输出与zs相加,得到局部特征zl;其中前馈网络ffn由gelu分开的两个线性投影组成,ln表示层归一化(layer normalization);计算公式为:

    27、zl=ffn(ln(zs))+zs

    28、步骤2:对于局部特征zl,利用全局模块对zl进行全局建模,得到全局特征zg;所述全局模块,包含动态位置嵌入dpe、交叉多头关系聚合器c_mhra和前馈网络ffn,具体为:

    29、步骤2.1:将局部模块的输出zl输入到动态位置嵌入dpe中,通过深度可分离卷积dwconv操作,dwconv在处理输入特征zl时,首先通过深度卷积,对zl的每个通道进行独立卷积操作,然后通过逐点卷积,对深度卷积的输出进行1x1的卷积操作,将通道间的特征整合起来,形成最终的深度可分离卷积结果dpe(zl);使其隐式地学习和编码输入序列的位置信息,将位置信息融入表示中;然后将动态位置嵌入的结果dpe(zl)与原始局部模块输出zl相加得到输出zc;计算公式为:

    30、dpe(zl)=dwconv(zl)

    31、zc=dpe(zl)+zl

    32、步骤2.2:首先将zc和可学习的查询q分别进行层归一化ln处理,得到e和f,然后输入到交叉多头关系聚合器c_mhra,它通过建模查询q与所有时空标记zc之间的依赖关系,将可学习的查询q转换为全局视频表示信息zst;其中ln表示层归一化layer normalization,查询向量q是通过学习得到的可学习参数;计算公式为:

    33、zst=c_mhra(e,f)

    34、e=ln(q)

    35、f=ln(zc)

    36、进一步地,将e和f输入到交叉多头关系聚合器c_mhra,得到全局视频表示信息,具体为:

    37、交叉多头关系聚合器c_mhra通过学习n个头的关系聚合结果,得到n个关系矩阵然后将n个关系矩阵拼接形成一个更大的关系矩阵,再通过学习的参数矩阵u线性变化将这个大的关系矩阵整合,得到多头关系聚合结果c_mhra(e,f);在计算关系矩阵的过程中,利用交叉注意力机制计算查询e与视频序列中的时空位置标记fj之间的关联程度得到最后,通过线性变换vn(f)将原始令牌f转换为上下文向量,然后通过将上下文向量与关系计算的结果相乘,得到关系聚合器其中,qn(e)t和kn(fj)是线性投影的结果,表示查询向量和键向量,j表示序列中的某个具体位置,j′∈ωt×h×w表示所有可能的时空位置;计算公式为:

    38、

    39、

    40、

    41、步骤2.3:将zst层归一化ln得到ln(zst),然后输入到前馈网络ffn进行变换得到fn(ln(zst)),最后将ffn的输出与zst相加,得到全局特征zg;其中前馈网络ffn由gelu分开的两个线性投影组成,ln表示层归一化layer normalization;计算公式为:

    42、zg=ffn(ln(zst))+zst

    43、步骤3:利用融合模块对局部特征zl和全局特征zg进行特征融合以获得更全面的图像,具体为:

    44、给定来自局部模块的特征全局模块将可学习查询qi转换为视频特征计算公式为然后采用顺序方式进行功效和效率方面的融合,将来自所有全局模块的视频特征集成为最终视频表示p;顺序方式是将前一个全局块中的视频特征作为当前全局模块qi中的查询特征,其中

    45、步骤4:利用分类器对视频表示p行为分类,具体为:

    46、将融合模块获得的视频表示p输入到分类器,得到每个类别的概率分布,最后选择具有最高概率的类别作为最终的预测结果输出。其中分类器包括全连接层和softmax激活函数。

    47、本发明有益技术效果:

    48、本发明的目的就是提出一种基于unieva模型的异常行为检测方法,包含局部模块、全局模块、融合模块和分类器。局部模块利用开源预训练图像大模型eva-clip成功设计了轻量的时序建模模块,能够更全面地理解视频中特定对象的动作和位置关系;全局模块能够捕捉整个视频序列中的长期时空依赖关系,保证模型理解整个视频的动作背景、场景变化以及对象之间的全局关系;然后利用融合模块对其特征融合,得到最终视频表示p;最后利用分类器对其行为分类,识别出具体异常行为。

    49、与现有技术相比,本发明提出速度更快、精度更高的一种基于unieva模型的异常行为检测方法,本发明提出的技术方案不需要复杂的图像预训练过程,有利于实际应用,与vit方法相比,大大降低了模型的复杂度,与卷积神经网络的方法相比,也大大提升了模型的精度。


    技术特征:

    1.一种基于unieva模型的异常行为检测系统,其特征在于,包含:局部模块、全局模块、融合模块和分类器;

    2.根据权利要求1所述的一种基于unieva模型的异常行为检测系统,其特征在于,所述局部模块利用局部时域多头关系聚合器lt_mhra得到时序建模特征,利用视觉编码器eva-clip中的全局空域多头关系聚合器gs_mhra得到图像中的空间建模特征,最后通过前馈网络进行变换得到局部特征;全局模块利用动态位置嵌入对局部特征进行深度可分离卷积操作使其隐式地学习和编码输入序列的位置信息,利用交叉多头关系聚合器提取全局时空关系,最后通过前馈网络变换得到全局特征;融合模块采用顺序方式将局部特征和全局特征融合集成为最终视频表示p;最终利用分类器对视频表示p行为分类。

    3.一种基于unieva模型的异常行为检测方法,基于上述权利要求1一种基于unieva模型的异常行为检测系统实现,其特征在于,具体包括以下步骤:

    4.根据权利要求1所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤1具体为:

    5.根据权利要求4所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤1.1将x输入到局部时域多头关系聚合器lt_mhra,得到局部时序信息lt_mhra(x),具体为:

    6.根据权利要求4所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤1.2将y输入到全局空域多头关系聚合器gs_mhra,得到全局空间信息,具体为:

    7.根据权利要求3所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤2具体为:

    8.根据权利要求7所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤2.2将e和f输入到交叉多头关系聚合器c_mhra,得到全局视频表示信息,具体为:

    9.根据权利要求3所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤3具体为:

    10.根据权利要求3所述的一种基于unieva模型的异常行为检测方法,其特征在于,步骤4具体为:


    技术总结
    本发明公开了一种基于UniEVA模型的异常行为检测系统及方法,属于行为识别技术领域;所述系统包括局部模块、全局模块、融合模块和分类器;首先使用时间下采样和3D卷积将视频流投影为一个包含M个令牌的矩阵,输入到局部模块用于局部建模,得到局部特征,能够更全面地理解视频中特定对象的动作和位置关系;再利用全局模块对其进行全局建模,得到全局特征,能够捕捉整个视频序列中的长期时空依赖关系,理解整个视频的动作背景、场景变化以及对象之间的全局关系;然后利用融合模块进行特征融合,得到最终视频表示;最后利用分类器对其行为分类,识别出具体异常行为;本发明针对复杂环境具有较高识别精度,对维护公共场所安全具有很高的研究价值和意义。

    技术研发人员:雷为民,李雨航,李漫,张伟,景庆阳,张鹏
    受保护的技术使用者:东北大学
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-100734.html

    最新回复(0)