图片生成方法、装置、系统、设备及存储介质与流程

    专利2026-07-06  25


    本申请涉及图像处理,尤其涉及一种图片生成方法、装置、系统、设备及存储介质。


    背景技术:

    1、随着文生图大模型的发展,用户可以根据自身的需求,生成所期望的图片。但文生图大模型生成的图片是随机性的,不一定执行一次图片生成操作就能满足用户的需求,有时候需要多次执行图片生成操作才能满足用户的需求。

    2、现有技术中,一般采用点击按钮或者语音输入的方式,再次生成图片,但是现有技术的方式操作不够便捷、轻松。并且对于生成的图片内容和质量较差时,还得需要点击按钮或语音重新输入描述内容,增加了交互复杂性。


    技术实现思路

    1、本申请提供一种图片生成方法、装置、系统、设备及存储介质,用以解决现有技术中在多次生成图片时产生的交互过程繁琐的缺陷,实现了交互过程的简单化和便捷化。

    2、根据本申请实施例的第一方面,提供了一种图片生成方法,所述方法包括:

    3、在基于用户提供的待生成图片的描述信息生成第一图片后,检测用户执行的动作;

    4、确定与所述用户执行的动作对应的图片生成要求,所述图片生成要求表示基于所述待生成图片的描述信息重新生成图片时所应满足的要求;

    5、按照所述图片生成要求,生成与所述待生成图片的描述信息对应的第二图片。

    6、根据本申请实施例第一方面提供的图片生成方法,确定与所述用户执行的动作对应的图片生成要求,包括:

    7、当检测到用户执行第一动作时,确定与所述第一动作对应的第一图片生成要求,所述第一图片生成要求表示基于所述待生成图片的描述信息重新生成图片;

    8、当检测到用户执行第二动作时,确定与所述第二动作对应的第二图片生成要求,所述第二图片生成要求表示基于所述待生成图片的描述信息以及预设图片生成要求重新生成图片。

    9、根据本申请实施例第一方面提供的图片生成方法,当检测到用户执行第一动作时,按照所述第一图片生成要求,生成与所述待生成图片的描述信息对应的第二图片,包括:

    10、生成包括所述待生成图片的描述信息的第一图片生成提示指令,并将所述第一图片生成提示指令输入预训练的文生图大模型,得到所述文生图大模型按照所述第一图片生成提示指令生成的第二图片;

    11、当检测到用户执行第二动作时,按照所述第二图片生成要求,生成与所述待生成图片的描述信息对应的第二图片,包括:

    12、生成包括所述待生成图片的描述信息以及预设图片生成要求的第二图片生成提示指令,并将所述第二图片生成提示指令输入所述预训练的文生图大模型,得到所述文生图大模型按照所述第二图片生成提示指令生成的第二图片。

    13、根据本申请实施例第一方面提供的图片生成方法,所述预设图片生成要求,包括重新生成的第二图片相对于所述第一图片的优化要求。

    14、根据本申请实施例第一方面提供的图片生成方法,所述检测用户执行的动作,包括检测用户执行的手势动作;

    15、所述第一动作包括第一手势动作,所述第二动作包括第二手势动作。

    16、根据本申请实施例第一方面提供的图片生成方法,检测用户执行的手势动作,包括:

    17、从用户视频数据中检测用户是否执行设定手势动作;

    18、当检测到用户执行所述设定手势动作时,确定用户执行所述设定手势动作的频率;

    19、当用户执行所述设定手势动作的频率小于设定频率阈值时,确定用户执行所述第一手势动作;

    20、当用户执行所述设定手势动作的频率大于或等于设定频率阈值时,确定用户执行所述第二手势动作。

    21、根据本申请实施例的第二方面,提供了一种图片生成装置,包括:

    22、检测模块,用于在基于用户提供的待生成图片的描述信息生成第一图片后,检测用户执行的动作;

    23、确定模块,用于确定与所述用户执行的动作对应的图片生成要求,所述图片生成要求表示基于所述待生成图片的描述信息重新生成图片时所应满足的要求;

    24、生成模块,用于按照所述图片生成要求,生成与所述待生成图片的描述信息对应的第二图片。

    25、根据本申请实施例的第三方面,提供了一种文生图系统,所述系统包括:

    26、图像采集设备和第一处理器;

    27、所述图像采集设备用于采集用户视频数据;

    28、所述第一处理器,用于在基于用户提供的待生成图片的描述信息生成第一图片后,从所述图像采集设备采集的用户视频数据中检测用户执行的动作;确定与所述用户执行的动作对应的图片生成要求,所述图片生成要求表示基于所述待生成图片的描述信息重新生成图片时所应满足的要求;按照所述图片生成要求,生成与所述待生成图片的描述信息对应的第二图片。

    29、根据本申请实施例的第四方面,提供了一种电子设备,包括存储器、第二处理器及存储在存储器上并可在第二处理器上运行的计算机程序,所述第二处理器执行所述程序时实现如上述任一种所述的图片生成方法。

    30、根据本申请实施例的第五方面,提供了一种非暂态计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时实现如上述任一种所述的图片生成方法。

    31、本申请实施例提供了一种图片生成方法、装置、系统、设备及存储介质,通过在基于用户提供的待生成图片的描述信息生成第一图片后,检测用户执行的动作;确定与用户执行的动作对应的图片生成要求,该图片生成要求表示基于待生成图片的描述信息重新生成图片时所应满足的要求;按照图片生成要求,生成与待生成图片的描述信息对应的第二图片,可见,本申请能够基于用户的动作来触发图片的重新生成,无需用户执行多次点击图片生成按钮的操作,或多次语音输入的操作,图片生成的整个交互过程更便捷,使得图片生成效率更高,另外,本申请基于用户执行的动作得到重新生成图片时所满足的要求,使得重新生成的第二图片更符合用户要求,提高了图片生成的效果。



    技术特征:

    1.一种图片生成方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的图片生成方法,其特征在于,确定与所述用户执行的动作对应的图片生成要求,包括:

    3.根据权利要求2所述的图片生成方法,其特征在于,当检测到用户执行第一动作时,按照所述第一图片生成要求,生成与所述待生成图片的描述信息对应的第二图片,包括:

    4.根据权利要求2或3所述的图片生成方法,其特征在于,所述预设图片生成要求,包括重新生成的第二图片相对于所述第一图片的优化要求。

    5.根据权利要求2或3所述的图片生成方法,其特征在于,所述检测用户执行的动作,包括检测用户执行的手势动作;

    6.根据权利要求5所述的图片生成方法,其特征在于,检测用户执行的手势动作,包括:

    7.一种图片生成装置,其特征在于,所述装置包括:

    8.一种图片生成系统,其特征在于,所述系统包括:

    9.一种电子设备,包括存储器、第二处理器及存储在存储器上并可在第二处理器上运行的计算机程序,其特征在于,所述第二处理器执行所述程序时实现如权利要求1至6任一项所述的图片生成方法。

    10.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,该计算机程序被处理器执行时实现如权利要求1至6任一项所述的图片生成方法。


    技术总结
    本申请提供一种图片生成方法、装置、系统、设备及存储介质,方法包括:在基于用户提供的待生成图片的描述信息生成第一图片后,检测用户执行的动作;确定与所述用户执行的动作对应的图片生成要求,所述图片生成要求表示基于所述待生成图片的描述信息重新生成图片时所应满足的要求;按照所述图片生成要求,生成与所述待生成图片的描述信息对应的第二图片。本申请用以解决现有技术中在多次生成图片时产生的交互过程繁琐的缺陷,实现了交互过程的简单化和便捷化。

    技术研发人员:胡梦芹,刘晓飞,吴乐,童李,王亚伟,王朝绿,和卫民,雷琴辉,刘俊峰,梅林海,刘权,王士进,刘聪,胡国平
    受保护的技术使用者:科大讯飞股份有限公司
    技术研发日:
    技术公布日:2024/4/29
    转载请注明原文地址:https://wp.8miu.com/read-98767.html

    最新回复(0)