首页  专利技术  电子电路装置的制造及其应用技术

一种高质量直播营销文本识别方法

2026-08-04 15:00:02 179次浏览
一种高质量直播营销文本识别方法

本发明涉及电子商务商品数据挖掘领域,尤其涉及一种高质量直播营销文本识别方法。


背景技术:

1、近年来,电子商务的发展迅速,消费者可以在网上购买各种商品,在购买的过程中,评价对消费者的购买意愿有着很大影响,特别是高质量评价。根据一项由brightlocal于2019年进行的调查,约90%的消费者表示他们在购买产品或服务之前会查看在线评价。而且,88%的消费者表示他们会信任在线评价,就像信任朋友或家人的建议一样。根据一项由spiegel research center于2017年进行的研究,具有五星高质量评价的产品比没有评价或低评价的产品销售额高近四倍。根据一项由moz于2018年进行的研究,与没有评价的产品相比,具有高质量评价的产品在搜索引擎结果页面上的排名更高。据2015年nielsen公司对全球22个国家的30000名在线购物者的调查显示,85%的消费者在网上购买商品前会在网站上查看其他消费者的评价,其中,50%的消费者表示他们只会购买有高质量评价的商品。另一份调查显示,根据某调查公司在某一时间对1000名消费者进行的问卷调查,96%的消费者认为电商高质量评价对他们的购物决策有重要影响,87%的消费者认为评价的真实性和可信度对他们的购物决策有很大的影响。此外,82%的消费者会选择购买有高质量评价的商品,63%的消费者会放弃购买无评价或评价较差的商品。这些数据表明,电商评价是否高质量对消费者的购买决策有着至关重要的影响,低质量评价会干扰消费者的购买决策,使其难以判断商品的真实质量,从而导致消费者选择不当的商品,高质量评价则能更清楚的展示出商品的实际参数情况,会让消费者对商品有着更清楚的了解,进而选择到消费者需要的商品,因此,有必要开发一种有效的方法来识别和提取电商平台商品评价中的高质量评价,来帮助消费者做出正确的消费选择。


技术实现思路

1、为了解决上述问题,本发明提供了一种高质量直播营销文本识别方法,收集商品评价的评价文本、评价附图、评价时间,以及商品款式和商品详情参数图;针对在一较长时间内的评价,人工挑选出一些高质量评价,标注为高质量评价的评论文本和图片,并划分训练集与测试集;通过利用训练集中的评价文本、商品款式和评价附图,对注意力生成对抗网络attngan进行训练,得到评价文本生成商品预测图片的模型q,通过对利用模型q对评价文本生成的商品预测图和实际评价附图以及商品详情参数图进行相似度的匹配提取,得到待测评价的图文相关置信度w1;利用评价数据集中每个评价时间下的评价积(评价数量和评价分值的乘积)通过emd-lstm进行训练,通过拟合历史评价时间的评价积来预测待测评价的评价时间下应有的评价积值,通过比较实际的评价积和预测的评价积的差值,得出待测评价的评价积置信度w2。通过对利用文本生成的图像和评价附图、商品详情参数图的相似度比较得到的置信度w1以及通过emd-lstm预测评价时间-评价积曲线得到评价积置信度w2,对两种置信度进行加权平均得到该评价的高质量置信度w,包括如下步骤:

2、根据已有的评论信息,对在一较长时间内的评价,人工挑选出一些高质量评价,标注认定为高质量评价的评论文本和图片的特征,并划分训练集与测试集;已有评论信息的评价时间、评价评分、评价数量作为数据集的一部分。

3、针对高质量评价集中的文本以及商品款式进行分析,通过transformer基于文本的实体属性提取特征,构造评论文本特征集r1。

4、针对高质量评价集中的图片进行分析,基于transformer对图片进行目标检测并提取特征,构造评论图片特征集r2。

5、将高质量评价集中的文本特征集r1和图片特征集r2,采用基于attngan的方法,获得高质量数据集中每个文本特征和图片特征进行对应匹配,对生成器和判别器进行训练,构建基于文本生成图片的函数模型q。

6、具体的:生成器g负责根据文本特征生成一张商品预测图,而判别器d则负责判断这张图片的质量,也就是判断是真实样本还是生成的虚假样本,通过逐步的迭代,最终生成器g可以生成越来越逼真的图像,而判别器d则可以更加精准的判断图片的真假。当固定生成器g的时候,最大化v(g,d)的含义是使得对于真实数据x来源于真实数据分布pdatas,判别器d(x)的输出接近于1;而对于生成器g生成的数据g(z),判别器d(g(z))的输出接近于0。这意味着通过优化判别器d的参数,使其能够有效地区分真实数据和生成数据。当固定判别器d时,最小化v(g,d)的目标是使得生成器g生成的数据g(z)的分布接近于真实数据分布pdatas,从而使得判别器d很难区分生成数据和真实数据。这时,通过优化生成器g的参数,使其生成的数据在统计上与真实数据尽可能接近。

7、通过这种左右互博的迭代过程,生成器g可以逐步学习生成更加逼真的图像,而判别器d则可以更精准地判断图像的真实性,从而达到生成器和判别器互相优化,最终生成高质量图像的目的。

8、

9、

10、用文本生成图片模型q对每一个待评测的评价进行评论文本分析,生成图片v1,基于faster-cnn对文本生成图片v1、评论图片v2、商品详情参数图片v3分别进行特征提取,得到特征向量{t1,t2,t3}。

11、通过得到的文本生成图片特征t1、评论图片特征t2、商品参数图片特征t3,通过dbscan密度聚类算法聚类得到v1、v2、v3三图的族内特征t4,利用余弦相似度分别计算t4与t1、t2、t3的关联程度矩阵{u1,u2,u3},得到高质量评价的图文相关匹配置信度w1。

12、基于emd-lstm的待测评价的评价积置信度检测,以该时间段下的评价积(评价个数*平均评分)建立平面坐标系的y轴,评价时间为x轴,建立评价积-评价时间分布函数,通过emd-lstm进行对历史评价时间的评价积进行拟合,得到评价的时间分布预测函数p,并预测待测评价的评价时间下的评价积p(t)。

13、具体的:emd-lstm预测可以分为两部分,emd分解和lstm预测,通过emd分解算法将评价积-评价时间曲线分解为n个模函数(imf1,imf2,…,imfn)和res,把每个imfi和res分别建立lstm模型,再将预测结果进行叠加,得到最终预测结果,并用方均根误差进行模型预测评价。方均根误差表达式:

14、

15、在某时刻通过评价时间分布预测模型计算得到的预测评价积p(t)与待测评价的评价时间段所对应的实际的评价积s(t)的差值m构成的函数m(m),来进评价积置信度w2的计算。其中,

16、m=p(t)-s(t)(1)

17、

18、由某个时间点的图文相关匹配置信度w1和时间序列置信度w2的得到该时刻下某条消费者评价为高质量评价的置信度w。通过对高质量评价数据集的置信度计算,得到最低判定为高质量评价的置信度值。

19、

20、其中,f1是图文相关匹配置信度对应的权重,f2时间序列置信度对应的权重。

21、本发明有益效果为:本发明采用了一种高质量直播营销文本识别方法,收集商品评价的评价文本、评价附图、评价时间,以及商品款式和商品详情图;人工挑选出一些高质量评价,标注认定为高质量评价的评论文本和图片以及高质量评价的时间,通过注意力生成对抗网络attngan训练出的文本生成图片模型q进行文本生成图片;通过对利用文本生成的图像和评价附图、商品详情图的进行相似度比较计算得到的置信度w1;以及通过emd-lstm拟合时间-评价积曲线预测待测评价的评价时间对应的预测评价积p(t)和实际评价积s(t)的差值得到评价积置信度w2,通过评价中的评价文本、评价图片、评价时间以及商品详情图这些多模态的特征共同作用于高质量评价的检测提取,可以更好地提取出更合理的高质量评价。

文档序号 : 【 40201858 】

技术研发人员:吴辉,王平,徐新胜,吴松泽,张艺,陈昕航,王修晖,王乐
技术所有人:中国计量大学

备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
吴辉王平徐新胜吴松泽张艺陈昕航王修晖王乐中国计量大学
一种基于大数据的特殊动作识别系统的制作方法 一种基于鲁棒优化的医疗急救资源调度方法
相关内容