网页开采行为识别方法、装置、设备、存储介质及产品与流程

    专利2026-08-16  7


    本发明涉及网络安全,尤其涉及一种网页开采行为识别方法、装置、设备、存储介质及产品。


    背景技术:

    1、目前,网页开采行为识别的方式主要采用基于单一黑名单特征的检测技术,该技术存在基于已知网页为样本,将整个页面作为分析对象导致的引入过多干扰信息,从而产生误报率高的问题。因此,如何提高网页开采行为识别的准确率,成为一个亟待解决的问题。


    技术实现思路

    1、本发明的主要目的在于提供了一种网页开采行为识别方法、装置、设备、存储介质及产品,旨在解决如何提高网页开采行为识别的准确率的技术问题。

    2、为实现上述目的,本发明提供了一种网页开采行为识别方法,所述网页开采行为识别方法包括以下步骤:

    3、获取待识别网页对应的有效的网页源代码;

    4、确定各类开采家族对应的开采函数规则集;

    5、对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别。

    6、可选地,所述获取待识别网页对应的有效的网页源代码的步骤,具体包括:

    7、获取待识别网页对应的初始源代码中的脚本代码;

    8、获取所述初始源代码引用的脚本文件;

    9、将所述脚本代码和所述脚本文件作为所述待识别网页对应的有效的网页源代码。

    10、可选地,所述获取所述初始源代码引用的脚本文件的步骤,具体包括:

    11、获取所述初始源代码引用的本地服务器的第一脚本文件;

    12、获取所述初始源代码引用的远程服务器的第二脚本文件;

    13、将所述第一脚本文件和所述第二脚本文件作为所述初始源代码引用的脚本文件。

    14、可选地,所述确定各类开采家族对应的开采函数规则集的步骤,具体包括:

    15、获取各类开采家族提供的预设开采脚本;

    16、对各预设开采脚本进行特征提取,并根据提取到的特征构造所述各类开采家族对应的开采函数规则集。

    17、可选地,所述对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别的步骤,具体包括:

    18、对所述有效的网页源代码和所述开采函数规则集进行匹配,获得匹配结果;

    19、根据所述匹配结果确定所述待识别网页对应的开采脚本,并识别所述开采脚本所属的开采家族,以对所述待识别网页进行开采行为识别。

    20、可选地,所述对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别的步骤之后,还包括:

    21、确定所述待识别网页对应的开采线程;

    22、通过开采线程识别模型对所述开采线程进行识别,所述开采线程识别模型基于支持向量机模型训练得到。

    23、此外,为实现上述目的,本发明还提供一种网页开采行为识别装置,所述网页开采行为识别装置包括:

    24、代码获取模块,用于获取待识别网页对应的有效的网页源代码;

    25、信息确定模块,用于确定各类开采家族对应的开采函数规则集;

    26、行为识别模块,用于对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别。

    27、此外,为实现上述目的,本发明还提出一种网页开采行为识别设备,所述网页开采行为识别设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的网页开采行为识别程序,所述网页开采行为识别程序配置为实现如上文所述的网页开采行为识别方法的步骤。

    28、此外,为实现上述目的,本发明还提出一种存储介质,所述存储介质上存储有网页开采行为识别程序,所述网页开采行为识别程序被处理器执行时实现如上文所述的网页开采行为识别方法的步骤。

    29、此外,为实现上述目的,本发明还提出一种计算机程序产品,所述计算机程序产品包括网页开采行为识别程序,所述网页开采行为识别程序被处理器执行时实现如上文所述的网页开采行为识别方法的步骤。

    30、本发明通过获取待识别网页对应的有效的网页源代码,然后确定各类开采家族对应的开采函数规则集,再对有效的网页源代码和开采函数规则集进行匹配,并根据匹配结果对待识别网页进行开采行为识别。本发明通过获取待识别网页对应的有效的网页源代码,能够将有效的网页源代码作为识别开采行为的源代码,解决将整个待识别页面作为分析对象导致的在进行开采行为识别时引入过多干扰信息的问题,再对有效的网页源代码和各类开采家族对应的开采函数规则集进行匹配,并根据匹配结果准确地对待识别网页进行开采行为识别,准确得到待识别网页对应的有效的网页源代码中存在的开采脚本及其所属的开采家族。



    技术特征:

    1.一种网页开采行为识别方法,其特征在于,所述网页开采行为识别方法包括以下步骤:

    2.如权利要求1所述的网页开采行为识别方法,其特征在于,所述获取待识别网页对应的有效的网页源代码的步骤,具体包括:

    3.如权利要求2所述的网页开采行为识别方法,其特征在于,所述获取所述初始源代码引用的脚本文件的步骤,具体包括:

    4.如权利要求1所述的网页开采行为识别方法,其特征在于,所述确定各类开采家族对应的开采函数规则集的步骤,具体包括:

    5.如权利要求1所述的网页开采行为识别方法,其特征在于,所述对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别的步骤,具体包括:

    6.如权利要求1~5中任一项所述的网页开采行为识别方法,其特征在于,所述对所述有效的网页源代码和所述开采函数规则集进行匹配,并根据匹配结果对所述待识别网页进行开采行为识别的步骤之后,还包括:

    7.一种网页开采行为识别装置,其特征在于,所述网页开采行为识别装置包括:

    8.一种网页开采行为识别设备,其特征在于,所述设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的网页开采行为识别程序,所述网页开采行为识别程序配置为实现如权利要求1至6中任一项所述的网页开采行为识别方法的步骤。

    9.一种存储介质,其特征在于,所述存储介质上存储有网页开采行为识别程序,所述网页开采行为识别程序被处理器执行时实现如权利要求1至6中任一项所述的网页开采行为识别方法的步骤。

    10.一种计算机程序产品,其特征在于,所述计算机程序产品包括网页开采行为识别程序,所述网页开采行为识别程序被处理器执行时实现如权利要求1至6中任一项所述的网页开采行为识别方法的步骤。


    技术总结
    本发明属于网络安全技术领域,公开了一种网页开采行为识别方法、装置、设备、存储介质及产品。本发明通过获取待识别网页对应的有效的网页源代码,然后确定各类开采家族对应的开采函数规则集,再对有效的网页源代码和开采函数规则集进行匹配,并根据匹配结果对待识别网页进行开采行为识别。本发明能够将有效的网页源代码作为识别开采行为的源代码,解决将整个待识别页面作为分析对象导致的在进行开采行为识别时引入过多干扰信息的问题,再对有效的网页源代码和各类开采家族对应的开采函数规则集进行匹配,并根据匹配结果准确地对待识别网页进行开采行为识别,准确得到待识别网页对应的有效的网页源代码中存在的开采脚本及其所属的开采家族。

    技术研发人员:屈林波,刘亮,顾骧,顾强,孙小娟
    受保护的技术使用者:中国移动通信集团江苏有限公司
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-100673.html

    最新回复(0)