一种异常数据检测方法、装置、设备和可读存储介质与流程

    技术2026-07-04  12


    本发明涉及数据处理,尤其涉及一种异常数据检测方法、装置、设备和可读存储介质。


    背景技术:

    1、目前,检测医疗保险异常主要通过解析医保政策文件以及总结业务经验来构建规则库,通过规则库检测疑似医保异常群体。但随着异常行为的不断翻新,越发隐秘,形式从个体到团伙,总体呈现出跨地区、电子化的特点,对医保异常行为的直观判断越来越困难,通过规则库的方式筛选医保异常行为也存在规则滞后、复杂度提高的问题。


    技术实现思路

    1、为解决现有存在的技术问题,本发明实施例提供一种异常数据检测方法、装置、设备和可读存储介质。

    2、为达到上述目的,本发明实施例的技术方案是这样实现的:

    3、第一方面,本发明实施例提供一种异常数据检测方法,包括:

    4、获得多个用户的第一数据,所述第一数据包括各用户对应的医疗保险使用相关的数据;

    5、基于所述第一数据获得至少一组目标地点集合,以及确定每组目标地点集合关联的多个目标用户;其中,每组目标地点集合中均包括具有关联关系的多个使用地点,所述目标用户在所述多个使用地点均具有医疗保险使用记录;

    6、根据所述多个目标用户在使用时间和使用地点上的相似度确定第一特征数据,以及根据所述第一数据确定与所述多个目标用户各自的个人特征和/或医疗保险使用情况相关的第二特征数据;

    7、基于所述第一特征数据和所述第二特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,根据所述至少一组目标地点集合各自对应的聚类结果确定表示异常的第二数据。

    8、上述方案中,所述基于所述第一数据获得至少一组目标地点集合,包括:基于所述多个第一数据确定各个用户的使用地点;对所述多个用户各自对应的使用地点进行数据挖掘,获得使用地点对应的频繁项集;所述频繁项集包括至少一个频繁项,每一频繁项均包括多个使用地点;根据所述频繁项集确定所述至少一组目标地点集合。

    9、上述方案中,所述根据所述多个目标用户在使用时间和使用地点上的相似度确定第一特征数据,包括:根据每个目标用户对应的使用地点和使用时间确定每个目标用户对应的特征矩阵,所述特征矩阵中每个元素表征所述目标用户在所述元素对应的使用时间和使用地点是否存在医疗保险使用记录;基于所述多个目标用户各自对应的特征矩阵确定相似度矩阵,所述相似度矩阵表征所述多个目标用户在使用时间和使用地点上的相似程度;对所述相似度矩阵进行特征降维处理,获得每个目标用户对应的第一特征数据。

    10、上述方案中,所述基于所述多个目标用户各自对应的特征矩阵确定相似度矩阵,包括:确定所述多个目标用户各自对应的特征矩阵之间的汉明距离,基于所述汉明距离确定所述相似度矩阵。

    11、上述方案中,所述根据所述第一数据确定与所述多个目标用户各自的个人特征和/或医疗保险使用情况相关的第二特征数据,包括:根据所述第一数据确定每个目标用户的第三数据,所述第三数据包括目标用户的个人特征、医疗保险使用类型和医疗保险使用频次中的至少一种;对每个目标用户的第三数据进行量化处理和/或归一化处理,获得每个目标用户对应的第二特征数据。

    12、上述方案中,所述基于所述第一特征数据和所述第二特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,包括:对所述第一特征数据和所述第二特征数据进行特征融合,获得第三特征数据,基于所述第三特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果。

    13、上述方案中,所述基于所述第三特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,包括:采用训练完成的聚类模型对所述多个目标用户各自对应的第三特征数据进行处理,获得每组目标地点集合对应的聚类结果;所述聚类模型基于样本数据集完成训练,所述样本数据集中包括多个用户对应的样本数据和所述样本数据对应的标签数据,所述标签数据表征对应的用户是否存在异常的医保行为。

    14、上述方案中,所述方法还包括:基于所述样本数据集对所述聚类模型的模型参数进行网格搜索,确定满足第一条件的模型参数,所述模型参数至少包括聚类半径、最小密度、所述第一特征数据对应的第一权重和所述第二特征数据对应的第二权重;其中,所述第一条件包括聚类簇的纯度最大、兰德系数最大和轮廓系数最大中的至少一种。

    15、第二方面,本发明实施例提供一种异常数据检测装置,包括数据获取模块、数据处理模块、特征处理模块和聚类处理模块;其中,

    16、所述数据获取模块,用于获得多个用户的第一数据,所述第一数据包括各用户对应的医疗保险使用相关的数据;

    17、所述数据处理模块,用于基于所述第一数据获得至少一组目标地点集合,以及确定每组目标地点集合关联的多个目标用户;其中,每组目标地点集合中均包括具有关联关系的多个使用地点,所述目标用户在所述多个使用地点均具有医疗保险使用记录;

    18、所述特征处理模块,用于根据所述多个目标用户在使用时间和使用地点上的相似度确定第一特征数据,以及根据所述第一数据确定与所述多个目标用户各自的个人特征和/或医疗保险使用情况相关的第二特征数据;

    19、所述聚类处理模块,用于基于所述第一特征数据和所述第二特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,根据所述至少一组目标地点集合各自对应的聚类结果确定表示异常的第二数据。

    20、上述方案中,所述数据处理模块,用于基于所述多个第一数据确定各个用户的使用地点,对所述多个用户各自对应的使用地点进行数据挖掘,获得使用地点对应的频繁项集;所述频繁项集包括至少一个频繁项,每一频繁项均包括多个使用地点;以及根据所述频繁项集确定所述至少一组目标地点集合。

    21、上述方案中,所述特征处理模块,用于根据每个目标用户对应的使用地点和使用时间确定每个目标用户对应的特征矩阵,所述特征矩阵中每个元素表征所述目标用户在所述元素对应的使用时间和使用地点是否存在医疗保险使用记录;基于所述多个目标用户各自对应的特征矩阵确定相似度矩阵,所述相似度矩阵表征所述多个目标用户在使用时间和使用地点上的相似程度;以及对所述相似度矩阵进行特征降维处理,获得每个目标用户对应的第一特征数据。

    22、上述方案中,所述特征处理模块,用于确定所述多个目标用户各自对应的特征矩阵之间的汉明距离,基于所述汉明距离确定所述相似度矩阵。

    23、上述方案中,所述特征处理模块,用于根据所述第一数据确定每个目标用户的第三数据,所述第三数据包括目标用户的个人特征、医疗保险使用类型和医疗保险使用频次中的至少一种;以及对每个目标用户的第三数据进行量化处理和/或归一化处理,获得每个目标用户对应的第二特征数据。

    24、上述方案中,所述聚类处理模块,用于对所述第一特征数据和所述第二特征数据进行特征融合,获得第三特征数据,基于所述第三特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果。

    25、上述方案中,所述聚类处理模块,用于采用训练完成的聚类模型对所述多个目标用户各自对应的第三特征数据进行处理,获得每组目标地点集合对应的聚类结果;所述聚类模型基于样本数据集完成训练,所述样本数据集中包括多个用户对应的样本数据和所述样本数据对应的标签数据,所述标签数据表征对应的用户是否存在异常的医保行为。

    26、上述方案中,所述装置还包括模型获取模块,用于基于所述样本数据集对所述聚类模型的模型参数进行网格搜索,确定满足第一条件的模型参数,所述模型参数至少包括聚类半径、最小密度、所述第一特征数据对应的第一权重和所述第二特征数据对应的第二权重;其中,所述第一条件包括聚类簇的纯度最大、兰德系数最大和轮廓系数最大中的至少一种。

    27、第三方面,本发明实施例提供一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现前述异常数据检测方法的步骤。

    28、第四方面,本发明实施例提供一种计算机可读存储介质,其上存储有计算机程序,该程序被处理器执行时实现前述异常数据检测方法的步骤。

    29、本发明实施例提供的一种异常数据检测方法、装置、设备和可读存储介质,基于多个用户的医疗保险使用相关的数据挖掘相似的地点组合,并对医疗保险使用的不同场景的时间数据和地点数据进行融合,有效提升对多时间多地点的医疗保险异常的群体的挖掘能力,并在聚类时增加与用户个人特征和/或医疗保险使用情况相关的附加特征,提升了对医疗保险使用异常数据进行挖掘的准确性。


    技术特征:

    1.一种异常数据检测方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的方法,其特征在于,所述基于所述第一数据获得至少一组目标地点集合,包括:

    3.根据权利要求1所述的方法,其特征在于,所述根据所述多个目标用户在使用时间和使用地点上的相似度确定第一特征数据,包括:

    4.根据权利要求3所述的方法,其特征在于,所述基于所述多个目标用户各自对应的特征矩阵确定相似度矩阵,包括:

    5.根据权利要求1所述的方法,其特征在于,所述根据所述第一数据确定与所述多个目标用户各自的个人特征和/或医疗保险使用情况相关的第二特征数据,包括:

    6.根据权利要求1至5任一项所述的方法,其特征在于,所述基于所述第一特征数据和所述第二特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,包括:

    7.根据权利要求6所述的方法,其特征在于,所述基于所述第三特征数据对所述多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,包括:

    8.根据权利要求7所述的方法,其特征在于,所述方法还包括:

    9.一种异常数据检测装置,其特征在于,所述装置包括数据获取模块、数据处理模块、特征处理模块和聚类处理模块;其中,

    10.一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现权利要求1至8任一项所述方法的步骤。

    11.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现权利要求1至8任一项所述方法的步骤。


    技术总结
    本发明实施例公开了一种异常数据检测方法、装置、设备和可读存储介质,方法包括:获得多个用户的第一数据,第一数据包括各用户对应的医疗保险使用相关的数据;基于第一数据获得至少一组目标地点集合,确定每组目标地点集合关联的多个目标用户;根据多个目标用户在使用时间和使用地点上的相似度确定第一特征数据,根据第一数据确定与多个目标用户各自的个人特征和/或医疗保险使用情况相关的第二特征数据;基于第一特征数据和第二特征数据对多个目标用户进行聚类,获得每组目标地点集合对应的聚类结果,根据至少一组目标地点集合各自对应的聚类结果确定表示异常的第二数据。

    技术研发人员:羊威,王础,李旭川,鲁红霞,王磊
    受保护的技术使用者:中国移动通信有限公司研究院
    技术研发日:
    技术公布日:2024/10/24
    转载请注明原文地址:https://symbian.8miu.com/read-44657.html

    最新回复(0)