多模态问答方法、装置、电子设备及计算机可读存储介质与流程
技术特征:
1.一种多模态问答方法,其特征在于,所述方法包括:
2.根据权利要求1所述的多模态问答方法,其特征在于,所述对所述图像信息进行特征提取得到图像文本信息和图像描述信息,包括:
3.根据权利要求2所述的多模态问答方法,其特征在于,所述将所述图片编码信息输入至预训练的多头注意力机制模型的文本解码器,得到所述图像描述信息,包括:
4.根据权利要求2所述的多模态问答方法,其特征在于,所述将所述图像信息输入至预训练的光学字符识别模型,得到所述图像文本信息,包括:
5.根据权利要求1所述的多模态问答方法,其特征在于,所述对所述表格信息进行转换处理得到表格文本信息,包括:
6.根据权利要求1所述的多模态问答方法,其特征在于,所述将所述问题关联信息输入至预训练的自注意力机制模型,得到问题解答结果后,所述方法还包括:
7.根据权利要求1所述的多模态问答方法,其特征在于,所述根据所述图像文本信息、所述图像描述信息、所述表格文本信息、所述初始文本信息和所述关系类别文本确定上下文信息,包括:
8.一种多模态问答装置,其特征在于,包括:
9.一种电子设备,包括:存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至7中任意一项所述的多模态问答方法。
10.一种计算机可读存储介质,存储有计算机可执行指令,其特征在于,所述计算机可执行指令用于执行权利要求1至7中任意一项所述的多模态问答方法。
技术总结
本申请涉及金融科技技术领域,提供了一种多模态问答方法、装置、电子设备及计算机可读存储介质,方法包括:对图像信息进行特征提取得到图像文本信息和图像描述信息,以及,对表格信息进行转换处理得到表格文本信息;将图像特征向量和文本特征向量输入至预训练的关系生成模型,得到关系类别文本;将上下文信息和获取得到的用户问题进行拼接得到问题关联信息;将问题关联信息输入至预训练的自注意力机制模型,得到问题解答结果。通过上述技术方案,突破解答的问题的局限性,给用户带来了更加良好的使用体验。
技术研发人员:舒畅,陈又新
受保护的技术使用者:平安科技(深圳)有限公司
技术研发日:
技术公布日:2024/12/2
文档序号 :
【 40202346 】
技术研发人员:舒畅,陈又新
技术所有人:平安科技(深圳)有限公司
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
技术研发人员:舒畅,陈又新
技术所有人:平安科技(深圳)有限公司
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
