一种故障预测方法、程序产品、装置及介质与流程

本发明涉及故障监测,特别是涉及一种故障预测方法、程序产品、装置及介质。
背景技术:
1、在服务器目前的架构中,硬盘被视为最重要的部件之一。并且据统计,在服务器的所有部件中,硬盘的发生故障概率的占比要远大其他部件。而当硬盘出现故障时,会导致业务数据丢失、服务停止、服务器宕机等严重问题。所以如何在硬盘发生故障前准确预测硬盘是否将要发生故障,并提前更换故障硬盘,是提高服务器运行可靠性的关键。
2、在相关技术中,目前已存在一种硬盘故障的预测方法。该方法通过硬盘的各种特征数据和硬盘的剩余寿命指标训练长短期记忆网络(long short-term memory,lstm)模型以建立硬盘特征数据与硬盘剩余寿命之间的关系。进而在进行硬盘故障预测时,可以将硬盘的特征数据输入至训练好的lstm模型中,预测该硬盘的剩余寿命曲线,从而辅助判断该硬盘是否将要出现故障。
3、但是,剩余寿命指标只能反映硬盘真实健康状态的一小部分。在实际应用中,存在很多硬盘的剩余寿命还很多,但已经出现故障的情况。仅用剩余寿命指标判断硬盘是否将要发生故障过于偏颇,导致对硬盘故障的预测准确性较差,并不能满足实际需要。
4、所以,现在本领域的技术人员亟需要一种故障预测方法,用于解决传统硬盘故障预测方案准确性差的问题。
技术实现思路
1、本发明的目的是提供一种故障预测方法、程序产品、装置及介质,以解决传统硬盘故障预测方案准确性差的问题。
2、为解决上述技术问题,本发明提供一种故障预测方法,包括:
3、获取待测数据集;其中,所述待测数据集中包括多组特征数据,每一组所述特征数据唯一对应一个预测对象。
4、建立数据空间,并将所述待测数据集中的各组所述特征数据映射至所述数据空间中;其中,所述数据空间的维度与所述特征数据的种类总数一致。一组所述特征数据对应所述数据空间中的一个数据点,每一种所述特征数据的值为所述数据点在所述数据空间中对应维度上的坐标。
5、根据所述数据空间中各所述数据点的分布情况,确定各所述预测对象是否故障。
6、在一种可能的实施例中,所述建立数据空间,并将所述待测数据集中的各组所述特征数据映射至所述数据空间中包括:
7、以所述待测数据集作为根节点、每组所述特征数据作为一个数据点,对所述根节点进行切割,以生成二叉树;其中,每一次切割选取所述特征数据中的一种特征数据作为切割特征,将目标节点中的所有数据点切割成两部分,以作为所述目标节点的两个子节点;第一次切割的所述目标节点为所述根节点,后续切割的所述目标节点为所述二叉树中未进行切割过的所述子节点,重复切割至所述二叉树的每一个所述子节点均无法继续切割。
8、所述根据所述数据空间中各所述数据点的分布情况,确定各所述预测对象是否故障包括:
9、针对每一所述预测对象,根据所述预测对象对应的数据点在所述二叉树中的高度确定所述预测对象的异常分数;其中,所述预测对象对应的数据点在所述二叉树中的高度与所述异常分数呈负相关关系。
10、根据所述异常分数,确定各所述预测对象是否故障。
11、在一种可能的实施例中,以所述待测数据集作为根节点、每组所述特征数据作为一个数据点,对所述根节点进行切割,以生成二叉树包括:
12、将所述待测数据集拆分成多个子样本数据集。
13、针对每一所述子样本数据集,以所述子样本数据集作为根节点、每组所述特征数据作为一个数据点,对所述根节点进行切割以生成子二叉树。
14、根据各所述子二叉树,得到第一森林模型。
15、则针对每一所述预测对象,根据所述预测对象对应的数据点在所述二叉树中的高度确定所述预测对象的异常分数包括:
16、根据所述预测对象对应的数据点在所述第一森林模型中所有所述子二叉树中的平均高度,确定所述预测对象的异常分数。
17、在一种可能的实施例中,根据所述预测对象对应的数据点在所述第一森林模型中所有所述子二叉树中的平均高度,确定所述预测对象的异常分数包括:
18、确定所述预测对象对应的数据点在所述第一森林模型中所有所述子二叉树中的平均高度,记为第一高度。
19、确定所述第一森林模型中所有所述子二叉树的平均高度,记为第二高度;
20、根据所述第一高度和所述第二高度之比,确定所述异常分数。
21、其中,所述第一高度和所述第二高度之比与所述异常分数呈负相关关系。
22、在一种可能的实施例中,所述异常分数由第一公式确定,所述第一高度由第二公式确定,所述第二高度由第三公式确定。
23、其中,所述第一公式为:
24、;
25、f(x,d)表示所述异常分数;a(l(x))表示所述第一高度;g(d)表示所述第二高度。
26、所述第二公式为:
27、;
28、x表示所述预测对象对应的数据点;l(x)表示所述预测对象对应的数据点在一个所述子二叉树中的高度;d表示所述第一森林模型中所述子二叉树的总数。
29、所述第三公式为:
30、;
31、其中,c表示调和数,所述调和数为一个常量系数。
32、在一种可能的实施例中,在生成所述子二叉树时,还包括:
33、若所述子二叉树满足停止生长条件,则停止切割,视为当前所述子二叉树生成完毕。
34、其中,所述停止生长条件为:所述目标节点仅包含一个数据点,或所包含的各数据点的所有特征数据的值均相等,或所述子二叉树的高度达到预设的高度阈值。
35、在一种可能的实施例中,将所述待测数据集拆分成多个子样本数据集包括:
36、随机选取n个所述预测对象对应的p个所述特征数据作为一个所述子样本数据集;其中,n<m,p<q,m为所述待测数据集中包含所述预测对象的总数,q为所述待测数据集中包含特征数据种类的总数。
37、重复执行上一步骤,直至所述待测数据集中任一所述预测对象的任一种特征数据均被归属于至少一个所述子样本数据集中。
38、其中,随机生成所述子样本数据集时,以减少各所述子样本数据集之间重叠的数据为目标条件。
39、在一种可能的实施例中,在根据所述异常分数,确定各所述预测对象是否故障之后,本方法还包括:
40、判断本次对所述预测对象是否故障的预测结果是否准确。
41、若不准确,则调整所述高度阈值;和/或,调整所述子样本数据集的总数,并重新拆分所述待测数据集,以得到特定个数的所述子样本数据集。
42、在一种可能的实施例中,根据所述异常分数,确定各所述预测对象是否故障包括:
43、判断所述预测对象的所述异常分数是否超过预设的异常分数阈值。
44、若是,则确定所述预测对象故障。
45、若否,则确定所述预测对象正常。
46、在一种可能的实施例中,本方法还包括:
47、获取样本数据集;其中,所述样本数据集包括多组历史特征数据,每一组所述历史特征数据唯一对应一个历史对象;所述历史对象为与所述预测对象属于同一类型的对象,各所述历史对象存在唯一对应的故障标记。
48、以所述样本数据集作为根节点、每组所述特征数据作为一个数据点,对所述根节点进行切割,以生成所述二叉树。
49、针对每一所述历史对象,根据所述历史对象对应的数据点在所述二叉树中的高度确定所述历史对象的异常分数。
50、基于各所述历史对象对应的所述异常分数和所述故障标记,确定所述异常分数阈值;其中,基于所述异常分数阈值识别出的、故障的所述历史对象,占所有被标记为故障的所述历史对象中的比例超过预设比例。
51、在一种可能的实施例中,所述预测对象为服务器中的硬盘。
52、所述特征数据为所述硬盘的健康状态信息。
53、所述待测数据集包括:所述服务器中所有所述硬盘对应的所有所述健康状态信息。
54、在一种可能的实施例中,在根据所述异常分数,确定各所述预测对象是否故障之后,本方法还包括:
55、若所述硬盘故障,则在硬盘状态可视化界面中以第一颜色标记该所述硬盘。
56、若所述硬盘未发生故障,则判断所述硬盘对应的所述异常分数是否超过预设的警戒分数阈值;其中,所述警戒分数阈值小于所述异常分数阈值。
57、若超过,则在所述硬盘状态可视化界面中以第二颜色标记该所述硬盘。
58、若未超过,则在所述硬盘状态可视化界面中以第三颜色标记该所述硬盘。
59、在一种可能的实施例中,所述预测对象为服务器中的各个部件。
60、所述特征数据为所述部件的状态参数;其中,所述状态参数包括:温度、电压、电流和功耗。
61、所述待测数据集包括:所述服务器中所有所述部件对应的所有所述状态参数。
62、为解决上述技术问题,本发明还提供一种计算机程序产品,包括计算机程序/指令,所述计算机程序/指令被处理器执行时实现如上所述的故障预测方法的步骤。
63、为解决上述技术问题,本发明还提供一种故障预测装置,包括:
64、存储器,用于存储计算机程序。
65、处理器,用于执行所述计算机程序时实现如上所述的故障预测方法的步骤。
66、为解决上述技术问题,本发明还提供一种非易失性存储介质,所述非易失性存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如上所述的故障预测方法的步骤。
67、本发明提供的一种故障预测方法,将待测数据集中的每一组特征数据(唯一对应一个预测对象)看做是q维空间中的一个数据点,q维空间的维度即对应q个不同种类的特征数据,一个数据点在任一维度上的坐标也即为该数据点对应于该维度的特征数据值。基于上述空间抽象过程,可以将待测数据集抽象成分散在q维空间中的m个数据点。
68、容易知道的是,一般情况下,一个服务器上健康硬盘的数量远大于故障硬盘的数量。且健康硬盘特征数据的值总是处于一个特定范围内,而对于故障硬盘的特征数据,则其取值无上述限制(对于其他场景一般也适用,例如服务器中各部件故障预测,特征参数为温度、电压、电流、功耗等)。反映到上述的空间抽象中,也即健康对象对应的数据点在q维空间中分布更加集中,而故障对象对应的数据点在q维空间中分布更加离散。基于这一原理,可以根据各数据点和其他数据点之间的分布关系确定该数据点对应预测对象是否故障。若数据点明显被孤立于其他数据点,则可认为该预测对象故障的可能性越高。同理,若数据点分布越集中,则说明这部分数据点对应的预测对象故障的可能性越低。
69、综上所述,本方法将故障预测问题转换成了数理统计上的数据点分布情况判断问题,从而实现可以将预测对象的多种特征数据纳入预测用的参数范围,从而进行更综合、更全面的故障预测。例如,在对硬盘进行故障预测时,本方法可以将硬盘的所有自我检测、分析和报告技术(self-monitoring, analysis, and reporting technology,smart)参数均作为进行故障预测依据的特征数据,包含剩余寿命指标以及更多其他可以表征硬盘不同层面性能和健康状态的指标参数,从而实现更准确的故障预测。同时,本方法实现的故障预测也不局限于基于预测对象的某一参数或指标进行预测,可以针对不同预测对象、基于其任意的多个不同特征数据实现故障预测,具有更高的通用性、泛用性和灵活性。
70、本发明提供的计算机程序产品、故障预测装置、及非易失性存储介质,与上述方法对应,效果同上。
技术研发人员:孔涛,张东,董李渊,李锋
技术所有人:济南浪潮数据技术有限公司
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
