文本合并方法、文本识别装置、电子设备和存储介质与流程

    专利2026-09-29  6


    本申请涉及文本处理,特别是涉及文本合并方法、文本识别装置、电子设备和存储介质。


    背景技术:

    1、文本检测识别以及文本分块等技术是一种将输入图像中具有连续语义信息的文本框进行合并的技术。

    2、当前方法对于图像中的文本框检测时,输出的文本框经常出现文本语义断裂的情况,对实际使用带来极大的不便,且后续文本框的合并速度较慢。


    技术实现思路

    1、本申请提供的文本合并方法、文本识别装置、电子设备和存储介质,能够快速合并图像文本框中文本行内容,得到具有连续语义信息的文本内容。

    2、为了解决上述技术问题,本申请第一方面提供了一种文本合并方法,该方法包括:获取待识别图像中的至少两个文本框信息;其中,每个文本框信息内包括一文本行内容;获取每个文本框信息对应的文本行特征,得到至少两个文本行特征;根据至少两个文本行特征之间的相似度,合并对应的文本行内容,得到待识别图像中具有连续语义信息的文本内容。

    3、为了解决上述技术问题,本申请第二方面提供了一种文本识别装置,该文本识别装置包括:第一获取模块,用于获取待识别图像中的至少两个文本框信息;其中,每个文本框信息内包括一文本行内容;第二获取模块,用于获取每个文本框信息对应的文本行特征,得到至少两个文本行特征;合并模块,用于根据至少两个文本行特征之间的相似度,合并对应的文本行内容,得到待识别图像中具有连续语义信息的文本内容。

    4、为了解决上述技术问题,本申请第三方面提供了一种电子设备,包括相互耦接的存储器和处理器,存储器中存储有程序指令,处理器用于执行程序指令以实现上述第一方面提供的方法。

    5、为了解决上述技术问题,本申请第四方面提供了一种计算机可读存储介质,存储有能够被处理器运行的程序指令,程序指令用于实现上述第一方面提供的方法。

    6、本申请提供的文本合并方法、文本识别装置、电子设备和存储介质,通过文本行特征之间的相似度并行计算,能够快速合并图像文本框中文本行内容,得到具有连续语义信息的文本内容,且无需对文本行排序合并,避免了排序错误造成合并错误的情况,提供了合并准确度。



    技术特征:

    1.一种文本识别方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的方法,其特征在于,所述获取每个所述文本框信息对应的文本行特征,得到至少两个文本行特征,包括:

    3.根据权利要求2所述的方法,其特征在于,每一所述文本框信息具有对应的所述文本内容的行位置信息和语义特征;所述拼接所述图像特征和所述至少两个文本框信息,得到融合特征,包括:

    4.根据权利要求2所述的方法,其特征在于,所述从所述融合特征中获取所述文本行特征,得到所述至少两个文本行特征,包括:

    5.根据权利要求4所述的方法,其特征在于,所述文本行合并模型基于transformer网络构建。

    6.根据权利要求1所述的方法,其特征在于,所述根据所述至少两个所述文本行特征之间的相似度,合并对应的所述文本行内容,得到所述待识别图像中具有连续语义信息的文本内容,包括:

    7.根据权利要求1所述的方法,其特征在于,每一所述文本框信息具有对应的所述文本内容和语义特征,所述获取待识别图像中的至少两个文本框信息,包括:

    8.一种文本识别装置,其特征在于,所述文本识别装置包括:

    9.一种电子设备,其特征在于,包括相互耦接的存储器和处理器,所述存储器中存储有程序指令,所述处理器用于执行所述程序指令以实现权利要求1至7任一项所述的文本识别方法。

    10.一种计算机可读存储介质,其特征在于,存储有能够被处理器运行的程序指令,所述程序指令用于实现权利要求1至7任一项所述的文本识别方法。


    技术总结
    本申请公开了文本合并方法、文本识别装置、电子设备和存储介质,该方法包括:获取待识别图像中的至少两个文本框信息;其中,每个文本框信息内包括一文本行内容;获取每个文本框信息对应的文本行特征,得到至少两个文本行特征;根据至少两个文本行特征之间的相似度,合并对应的文本行内容,得到待识别图像中具有连续语义信息的文本内容。上述方案,能够快速合并图像文本框中文本行内容,得到具有连续语义信息的文本内容。

    技术研发人员:高宏宇,张建树,刘丹,魏思
    受保护的技术使用者:科大讯飞股份有限公司
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-102512.html

    最新回复(0)