一种数学公式识别模型用数据增强方法

本发明涉及公式识别,尤其涉及一种数学公式识别模型用数据增强方法。
背景技术:
1、数学公式识别技术是纸质文献电子化转录领域的一项关键技术,其意义和应用价值不容忽视,由于数学公式通常包含复杂的结构和符号,例如上下标、分数线、根号以及各种数学符号的组合,使得数学公式难以被直接录入电子设备,尤其是当涉及到手写或印刷体文献中的公式时,传统的文本输入方法和光学字符识别技术往往难以准确识别和处理。
2、数学公式识别研究不仅在学术和教育领域内具有重要价值,也为其他领域的光学字符识别技术的进步提供了宝贵的经验和技术积累。手写体识别技术面临的挑战包括字迹多样性、书写风格的个性化差异等,这些问题的解决对于提高光学字符识别技术的准确性和鲁棒性具有指导意义,也促进了整个光学字符识别领域的技术进步。
3、传统的数学公式识别通常包括字符分割、字符识别和结构重组三个主要部分。而数学公式的latex序列通常比图像描述任务中的文字要长得多。这种差异主要源于数学公式的复杂性和灵活性。相较于自然语言描述的对象,数学公式通常包含更多的符号、运算符和结构。因此,为了准确地表示数学公式,需要更长的序列长度来捕捉其丰富的信息和结构,这是与图像描述任务相比的一个显著特点,常规的编码器解码器框架通常很难应对长序列问题,注意力机制则可以很好的应对这种情况,因为注意力机制可以使模型在解码时注意应该注意的地方,尽管注意力机制可以在一定程度上缓和长序列给编码器解码器模型带来的问题,但是常规的注意力机制可能会出现过度注意或缺失注意的问题,也就是模型在解码阶段重复注意了某个特征,使得模型做了错误的解码输出。
4、基于深度学习的数学公式识别模型通常依赖于数据集,im2latex-100k是一个著名的印刷体数学公式识别数据集,提供了大量的训练样本,从而有助于训练复杂的深度学习模型。而crohme数据集用于手写数学公式识别,其样本量相对较小,训练样本数量约为10k,且多样性大。由于训练数据的限制,数学公式模型可能会过度学习这些有限样本中的特定模式和噪声,而无法有效地泛化到新的、未见过的样本上。因此我们需要数据增强技术来把现有的一些数据集进行加强和去噪,增强数量和多样性。
5、数据增强技术是一种常用的方法,通过人为地增加训练数据的多样性来对抗过拟合。在离线手写数学公式图像识别中,人们采用了多种数据增强方法,如仿射变换、透视变换和随机弹性变形等,以生成新的训练样本。这些方法可以在一定程度上增加数据的多样性,提高模型的泛化能力。然而,尽管数据增强有助于模型更好地学习变化和扰动下的数学公式表示,但当前方法仍存在局限性。特别是,如果数据增强技术主要增加了样本的视觉多样性而没有充分覆盖数学公式的语义多样性,模型可能会过度学习训练样本中的具体语义内容,导致在复杂或未见过的数学公式上的泛化性能下降,这种现象被称为公式语义信息的过拟合。
技术实现思路
1、本发明所要解决的技术问题是克服现有技术中存在的不足,提供一种数学公式识别模型用数据增强方法。
2、本发明是通过以下技术方案予以实现:
3、一种数学公式识别模型用数据增强方法,包括如下步骤:
4、s1.获取crohme数据集中的在线公式数据,并获取所述在线公式数据中每个字符的类别和位置;
5、s2.对所述在线公式数据中的样本进行数据预处理;
6、s3.对所述在线公式数据中每个字符做判断,并进行字符替换;
7、s4.对进行字符替换后的公式整体做缩放、旋转变换,并更新当前公式对应的latex序列。
8、根据上述技术方案,优选地,步骤s2中,所述数据预处理包括数据降噪、数据规范化。
9、根据上述技术方案,优选地,步骤s2中,所述数据降噪包括:删除间隔紧密的坐标点、以及沿直线密集分布的点。
10、根据上述技术方案,优选地,步骤s2中,所述数据规范化包括:计算坐标点在水平和垂直轴上的投影中心;计算所述投影中心的标准偏差;基于所述投影中心和标准偏差对坐标点进行归一化。
11、根据上述技术方案,优选地,步骤s2中,计算坐标点在水平和垂直轴上的投影中心,
12、
13、其中:ω表示数学公式中所有线段集合,
14、表示由(x1,y1)和(x2,y2)构成的线段l长度,
15、p"(l)和p$(l)则分别表示线段l在x轴和y轴的投影长度,即:
16、
17、根据上述技术方案,优选地,步骤s2中,计算所述投影中心的标准偏差,
18、dx(l)=∫l(x-μx)2dl,
19、得到x轴上的标准偏差,
20、
21、根据上述技术方案,优选地,步骤s2中,基于所述投影中心和标准偏差对坐标点进行归一化,其中:
22、
23、根据上述技术方案,优选地,步骤s3中,如果是分式的分割符号则放入分式数组做上下部分的内容互换;如果是可替换字符组中的字符,则进行字符替换。
24、根据上述技术方案,优选地,步骤s3中,对可替换字符组进行分类,在同类字符组中进行所述字符替换,再对所有字符从错切、缩放、旋转和透视变换中的多种进行随机组合变化。
25、本发明的有益效果是:
26、本发明是基于字符标注数据集的数据增强方法,充分利用了crohme在线数据集带有字符位置和类别标注的特性,首先对crohme数据做降噪处理和规范化,去除了数据的噪声,减少模型受到错误信息的影响,更易于模型学习和提取特征,也方便了后续的字符替换和分式结构上下内容互换;
27、对已有公式中的字符做同类型的随机替换,并且在遇到分式结构时互换了上下的内容的操作,改变了公式的语义信息,扩充了数据样本语义的多样性;对局部字符和全局公式做形变,模拟了手写公式的不同风格,有助于提升模型的泛化能力;对公式图像的latex标签做规范化处理,去除了无用信息,也避免了同一种特征对应多种输出的情况。
技术特征:
1.一种数学公式识别模型用数据增强方法,其特征在于,包括如下步骤:
2.根据权利要求1所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,所述数据预处理包括数据降噪、数据规范化。
3.根据权利要求2所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,所述数据降噪包括:删除间隔紧密的坐标点、以及沿直线密集分布的点。
4.根据权利要求2或3所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,所述数据规范化包括:计算坐标点在水平和垂直轴上的投影中心;计算所述投影中心的标准偏差;基于所述投影中心和标准偏差对坐标点进行归一化。
5.根据权利要求4所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,计算坐标点在水平和垂直轴上的投影中心,
6.根据权利要求5所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,计算所述投影中心的标准偏差,
7.根据权利要求6所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s2中,基于所述投影中心和标准偏差对坐标点进行归一化,其中:
8.根据权利要求1或2所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s3中,如果是分式的分割符号则放入分式数组做上下部分的内容互换;如果是可替换字符组中的字符,则进行字符替换。
9.根据权利要求8所述一种数学公式识别模型用数据增强方法,其特征在于,步骤s3中,对可替换字符组进行分类,在同类字符组中进行所述字符替换,再对所有字符从错切、缩放、旋转和透视变换中的多种进行随机组合变化。
技术总结
本发明涉及一种数学公式识别模型用数据增强方法,包括如下步骤:获取CROHME数据集中的在线公式数据,并获取在线公式数据中每个字符的类别和位置;对在线公式数据中的样本进行数据预处理;对在线公式数据中每个字符做判断,并进行字符替换,再公式整体做缩放、旋转变换,并更新当前公式对应的LaTeX序列。本发明是基于字符标注数据集的数据增强方法,充分利用了CROHME在线数据集带有字符位置和类别标注的特性,通过降噪处理和规范化,去除了数据的噪声,减少模型受到错误信息的影响,更易于模型学习和提取特征,对局部字符和全局公式做形变,模拟了手写公式的不同风格,改变了公式的语义信息,扩充了数据样本语义的多样性,有助于提升模型的泛化能力。
技术研发人员:李明楚,张济同
受保护的技术使用者:大连理工大学人工智能大连研究院
技术研发日:
技术公布日:2024/12/2
技术研发人员:李明楚,张济同
技术所有人:大连理工大学人工智能大连研究院
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
