一种基于多模态特征融合的视频分类方法、装置及介质
技术特征:
1.一种基于多模态特征融合的视频分类方法,其特征在于,包括:
2.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,第l-1个自对齐融合层的目标融合特征矩阵表示为:
3.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,更新后的第l-1个自对齐融合层输出的目标图像特征矩阵表示为:
4.根据权利要求3所述的基于多模态特征融合的视频分类方法,其特征在于,第l个自对齐融合层的目标图像特征矩阵和第一融合特征矩阵表示为:
5.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,初始融合特征矩阵表示为:
6.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,待分类视频的分类结果表示为:
7.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,待分类视频的图像特征矩阵的获取过程包括:
8.根据权利要求1所述的基于多模态特征融合的视频分类方法,其特征在于,待分类视频的音频特征矩阵的获取过程包括:
9.一种基于多模态特征融合的视频分类装置,其特征在于,包括:
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-8任一项所述的基于多模态特征融合的视频分类方法的步骤。
技术总结
本发明属于视频分类技术领域,涉及一种基于多模态特征融合的视频分类方法、装置及介质;将待分类视频的图像特征矩阵和音频特征矩阵拼接并输入至第一多层感知机,输出初始融合特征矩阵;将图像特征矩阵、音频特征矩阵和初始融合特征矩阵输入至沿正传播方向依次串联的L个自对齐融合层进行中期融合;将第L个自对齐融合层输出的目标图像特征矩阵中的cls token向量、目标音频特征矩阵中的cls token向量和融合特征矩阵拼接后,进行后期融合,并输入至第三多层感知机,从而对待分类视频进行分类,本申请提供的视频分类方法通过多阶段特征融合充分融合了不同模态的特征信息,提高了视频分类结果准确性。
技术研发人员:王宁,吴明辉,顾文超,周浩杰,吴秦
受保护的技术使用者:江南大学
技术研发日:
技术公布日:2024/12/2
文档序号 :
【 40201906 】
技术研发人员:王宁,吴明辉,顾文超,周浩杰,吴秦
技术所有人:江南大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
技术研发人员:王宁,吴明辉,顾文超,周浩杰,吴秦
技术所有人:江南大学
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
