一种知识库构建方法和装置与流程

本发明涉及计算机,尤其涉及一种知识库构建方法和装置。
背景技术:
1、随着海量数据的增长,搭建知识库能够有助于个人、组织或企业更好地管理和利用知识库的信息资源,从而有效地组织、存储和检索大量的知识和信息。
2、相关技术中的知识库构建方法,对于异常数据的处理不完善,知识库中存在错误信息,且无法自动获取并更新知识库,不能实现知识库的自行创建。
技术实现思路
1、有鉴于此,本发明实施例提供一种知识库构建方法和装置,能够实现知识库的自行构建,并对异常关键词进行检测和纠正,提升知识库的准确性,提高信息的可访问性和可用性,进而提升检索效率和准确率。
2、为实现上述目的,根据本发明实施例的一个方面,提供了一种知识库构建方法,包括:
3、获取预设时间段的多条对话数据,从每条对话数据中识别出与所述对话数据对应的各个关键词;
4、对所述多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别;
5、对于每个类别对应的各个关键词,根据所述类别的预设条件对所述各个关键词进行异常检测,并对检测出的异常关键词进行纠正,从而更新所述类别对应的各个关键词;
6、根据每个类别及其对应的各个关键词构建知识库。
7、可选地,根据所述类别的预设条件对所述各个关键词进行异常检测,包括:
8、获取所述类别对应的类别词典,并将所述关键词与所述类别词典进行匹配;
9、响应于所述关键词与所述类别词典匹配失败,判定所述关键词为异常关键词。
10、可选地,对检测出的异常关键词进行纠正,包括:
11、响应于所述关键词与所述类别词典匹配失败,生成与所述关键词对应的多个候选词;
12、对于每个候选词,将所述候选词与所述类别词典进行匹配,利用匹配成功的候选词替换所述关键词。
13、可选地,生成与所述关键词对应的多个候选词,包括:
14、根据编辑距离算法和预设距离生成与所述关键词对应的多个候选词。
15、可选地,从每条对话数据中识别出与所述对话数据对应的各个关键词,包括:
16、对于每条对话数据,从所述对话数据中解析出文本数据;
17、利用自然语言处理技术对所述文本数据进行处理,得到每条文本数据对应的多个词语;
18、对于每个词语,计算所述词语在所述文本数据中的词频-逆向文件频率;
19、根据每个词语在所述文本数据中的词频-逆向文件频率,从所述多个词语中筛选出与所述对话数据对应的各个关键词。
20、可选地,对所述多条对话数据对应的各个关键词进行聚类之前,还包括:
21、对于每条对话数据对应的每个关键词,计算所述关键词与所述对话数据之间的匹配度;
22、将匹配度低于预设匹配度阈值的关键词进行删除。
23、可选地,对所述多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别,包括:
24、初始化多个聚类中心;
25、执行以下聚类过程:对于每个关键词,计算所述关键词与每个聚类中心之间的距离,将所述关键词加入距离最小的聚类中心对应的聚类中,从而得到多个聚类,每个聚类对应一种类别;根据每个聚类中的各个关键词更新各个聚类中心;
26、循环执行所述聚类过程,直至迭代结束,得到每个关键词所属的类别。
27、根据本发明实施例的再一个方面,提供了一种知识库构建装置,包括:
28、获取模块,获取预设时间段的多条对话数据,从每条对话数据中识别出与所述对话数据对应的各个关键词;
29、聚类模块,对所述多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别;
30、检测模块,对于每个类别对应的各个关键词,根据所述类别的预设条件对所述各个关键词进行异常检测,并对检测出的异常关键词进行纠正,从而更新所述类别对应的各个关键词;
31、构建模块,根据每个类别及其对应的各个关键词构建知识库。
32、根据本发明实施例的另一个方面,提供了一种电子设备,包括:
33、一个或多个处理器;
34、存储装置,用于存储一个或多个程序,
35、当所述一个或多个程序被所述一个或多个处理器执行,使得所述一个或多个处理器实现本发明提供的知识库构建方法。
36、根据本发明实施例的还一个方面,提供了一种计算机可读介质,其上存储有计算机程序,所述程序被处理器执行时实现本发明提供的知识库构建方法。
37、上述发明中的一个实施例具有如下优点或有益效果:本发明实施例的知识库构建装置,首先获取预设时间段的多条对话数据,然后识别出每条对应数据对应的各个关键词;再对多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别;对于每个类别对应的各个关键词,利用该类别的预设条件对各个关键词进行异常检测,并对检测出的异常关键词进行纠正,更新每个类别对应的各个关键词,以根据每个类别及其对应的各个关键词构建知识库。该方法能够实现知识库的自行构建,并实现知识库的实时更新;通过对关键词进行异常检测和纠正,提升知识库的准确性,进而提升检索效率和准确率,提升信息的可访问性和可用性。
38、上述的非惯用的可选方式所具有的进一步效果将在下文中结合具体实施方式加以说明。
技术特征:
1.一种知识库构建方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,根据所述类别的预设条件对所述各个关键词进行异常检测,包括:
3.根据权利要求2所述的方法,其特征在于,对检测出的异常关键词进行纠正,包括:
4.根据权利要求3所述的方法,其特征在于,生成与所述关键词对应的多个候选词,包括:
5.根据权利要求1所述的方法,其特征在于,从每条对话数据中识别出与所述对话数据对应的各个关键词,包括:
6.根据权利要求1所述的方法,其特征在于,对所述多条对话数据对应的各个关键词进行聚类之前,还包括:
7.根据权利要求1所述的方法,其特征在于,对所述多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别,包括:
8.一种知识库构建装置,其特征在于,包括:
9.一种电子设备,其特征在于,包括:
10.一种计算机可读介质,其上存储有计算机程序,其特征在于,所述程序被处理器执行时实现如权利要求1-7中任一所述的方法。
技术总结
本发明公开了一种知识库构建方法和装置,涉及计算机技术领域。该方法的一具体实施方式包括:获取预设时间段的多条对话数据,从每条对话数据中识别出与所述对话数据对应的各个关键词;对所述多条对话数据对应的各个关键词进行聚类,得到每个关键词所属的类别;对于每个类别对应的各个关键词,根据所述类别对所述各个关键词进行异常检测,并对检测出的异常关键词进行纠正,从而更新所述类别对应的各个关键词;根据每个类别及其对应的各个关键词构建知识库。该实施方式实现知识库的自行构建,并对异常关键词进行检测和纠正,提升知识库的准确性,提高信息的可访问性和可用性,进而提升检索效率和准确率。
技术研发人员:李冬雪
受保护的技术使用者:北京京东拓先科技有限公司
技术研发日:
技术公布日:2024/12/2
技术研发人员:李冬雪
技术所有人:北京京东拓先科技有限公司
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
