本发明涉及一种基于组合算法异常医疗就诊行为的识别系统,属于医疗大数据数据治理领域。
背景技术:
1、国家医保是社会保障体系的重要组成部分,对于维护社会公平、促进社会稳定、保障人民健康等方面起到了重要的作用。现有医疗就诊系统中,存在滥用医保资源、恶意盗刷医保、频繁就医、医保借用等违法行为,违反《医疗保障基金使用监督条例》,不仅会对个人造成财产损失,还会对社会造成不良影响。为防止各种欺诈骗保行为,减少人为核查的成本,发明一种识别参保人是否存在异常就诊行为的方法至关重要。
2、同时,识别异常就诊数据对于医学研究和临床实践具有重要意义,它可以帮助科研人员从大量的医疗数据中识别出不符合常规模式或预期的数据,以提高科研结果的准确性;也能够辅助研究人员发现新的疾病、治疗反应、患者行为或其他医疗事件的异常变化,从而为医学研究和临床实践提供有价值的信息。例如,通过对异常就诊数据的分析,研究人员可以发现某种疾病的发病率或就诊次数的异常波动,进而深入研究该疾病的病因、发病机制和治疗方法,从而为临床决策提供有力支持。
3、为了有效检测这些异常数据,研究者们提出了一系列的技术和方法。之前,基于统计学的方法被广泛应用,通过对医疗大数据的统计特征进行分析,寻找数据分布中的异常值。如今,随着人工智能技术的发展,基于机器学习和深度学习的方法也逐渐成为异常就诊行为数据检测的研究热点。因此,将统计学方法与机器学习方法进行组合,将更加准确可靠地检测出这些异常数据;及时识别和处理这些异常就诊数据,除了可以有效保障医疗保险的合理运行,对于提高医疗质量和患者安全也至关重要。
技术实现思路
1、本发明的目的是:提供一种系统,可以更加有效地检测出异常数据,旨在解决医疗机构、社会医疗保险的运营损失的问题,进一步完善各个医疗卫生信息系统的医疗数据;也为医疗大数据临床研究提供更准确的研究数据、提供更有价值的医疗信息。
2、为了达到上述目的,本发明的技术方案是提供了一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,包括:
3、患者数据信息采集单元,用于接收医疗机构发送的所有医疗数据,所述医疗数据为就诊患者在一次医疗就诊服务中产生的所有数据,包括患者个人基础信息、就诊诊断信息、医嘱/处方信息、手术记录信息、实验室检查信息、影像检查信息,构建患者个人信息数据库和医疗信息库;
4、患者个人信息处理单元,用于对患者个人信息数据库中的患者信息数据进行信息选择、数据处理、记录清洗以及信息合并,从而获得患者个人信息集合,其中,通过信息选择从患者个人信息数据库中选择患者身份信息相关的字段构建患者基本信息基础表;通过数据处理对患者基本信息基础表中数据进行数据清洗、有效值提取和数据规范化;通过记录清洗对数据处理后的患者个人信息数据进行去重以及舍弃数据质量较低的患者信息数据;通过信息合并将同一患者在不同就诊时期产生的不同患者个人信息记录合并,最终获得患者个人信息集合表;
5、患者医疗就诊信息筛选单元,用于根据目标患者,在医疗信息库中提取患者在一定的预设时间内的医疗就诊信息,医所述疗就诊信息包括诊断信息、用药信息和手术记录信息;
6、患者医疗就诊信息划分与统计单元,用于基于患者筛选信息,以患者为单位,构建患者基本信息集合和就诊信息集合,其中:
7、基本信息集合,为从患者个人信息集合表中随机抽取m个患者的人口统计学信息,另外通过获取公安信息库中的人口死亡状态,所形成的基本信息集合表;
8、就诊信息集合,为以患者为识别单位,在预设时间范围内,按照以全部就诊、以疾病编码分组,两种方式进行就诊次数统计,相应的,完成开药次数和手术次数的统计,最终形成的诊断信息集合表、用药信息集合表、手术信息集合表;
9、异常识别模型,用于计算当前患者的异常分值score,将异常分值score与设定的异常阈值比较,以判断当前患者是否存在异常就诊行为;所述异常识别模型进一步包括异常算法组合模型单元、单特征识别模型单元、多特征识别模型单元、异常程度划分单元,其中:
10、异常算法组合模型单元,采用基于统计学的箱型图、3sigma原则,基于聚类模型的k-means,以及基于树模型的孤立森林模型,设置权重分配,组合使用作为异常识别算法;
11、单特征识别模型单元,针对采用异常算法组合模型单元识别获得的当前特征,获得该特征的异常分值;
12、多特征识别模型单元,针对患者就诊次数、开药次数、手术次数异常识别问题,将患者明细数据进行数据信息处理,按照疾病种类或手术类型、就诊年份进行统计,形成nfeature个特征,采用单特征识别模型单元获得的每一个特征的异常分值,然后取所有特征异常分值的最大值,作为当前患者的异常分值score;
13、异常程度划分单元,将异常分值score与预先设置的患者异常阈值进行比较,判断该患者是否存在异常情况。
14、优选地,所述患者个人信息处理单元中,所述数据处理包括以下步骤:
15、对姓名、证件号码、就诊卡号进行统一英文大小写、非有效字符清除或转换、统一符号等操作;
16、对不同类型的证件号码进行数据标准化与数据修复;
17、对证件号码缺失值进行填充,当证件号码缺失而就诊卡号符合各不同类型证件号码合法性校验时,完成缺失值补充;
18、对就诊卡类型通过关联就诊卡号的按照卡号编码规则识别完成标准化;
19、对性别进行值域统一;
20、对出生日期进行统一格式处理。
21、优选地,所述患者个人信息处理单元中,进行记录清洗时,包括若关键信息为空,则判断为数据质量较低,不能完成患者身份识别,将当前数据舍弃,并完成重复样本数据剔除操作。
22、优选地,所述患者个人信息处理单元中,进行所述信息合并时,按照医保卡数据应用逻辑,将相同就诊卡号+卡类型认定为同一患者,按照以下优先级完成同一患者的证件信息统一:
23、出现多个不同证件类型,优先取zjhmsfz,zjhmsfz表示证件类型为身份证的证件号码;
24、出现多个合法身份证号码,优先取substr(zjhm,7,8)=csrq,其中,substr()表示提取字符串方法,从指定位置开始,并返回指定数量的字符,zjhm表示证件号码,此处为身份证号码,csrq表示出生日期;
25、出现多个合法身份证号码,首先计算统计各个号码出现的次数占比,记为属性gratio1,优先取max(gratio1);
26、当出现多个合法身份证号码,按照更新时间进行倒序排序记为属性grank1,优先取min(grank1);
27、出现多个非身份证的其他类型的合法证件号码,首先计算各个证件号码出现的次数占比,记为属性gratio2,取max(gratio2);当gratio2一致,按照更新时间进行倒序排序记为属性grank2,优先取min(grank2);
28、若上述情况以外,不再进行统一化处理;当证件信息缺失时,通过就诊卡完成填充;
29、按照非医保卡数据应用逻辑,将相同就诊机构+就诊卡号+卡类型认定为同一患者,信息合并逻辑同医保卡;
30、将认为拥有相同zjhm的为同一患者,生成患者唯一标识。
31、优选地,在所述患者医疗就诊信息划分与统计单元中,针对任一患者pi,首先计算在预设时间范围内的总就诊次数zcount和总就诊卡数量kcount,其次根据国际疾病分类icd-10,按照就诊年份形成就诊次数判别矩阵di,如下:
32、
33、相应的,按照《国家基本药物分类目录》和国家手术操作分类icd-9-cm-3,完成开药次数判别矩阵mi和手术次数判别矩阵oi。
34、优选地,所述异常算法组合模型单元所采用的箱型图上边界计算公式如下:
35、iqr=q3-q1
36、upperlimit_box=q3+1.5*iqr
37、
38、其中,q1为25%分位数,q3为75%分位数,xi为特征x的第i个元素;
39、所采用的3sigma原则上边界计算公式如下:
40、
41、upperlimit_σ=μ+3σ
42、
43、其中,n为该特征样本个数。
44、优选地,所述异常算法组合模型单元采用基于聚类模型的k-means算法计算异常分值,其中,初始设置簇的数目k,最大迭代次数n,具体步骤如下:
45、步骤1、随机选取k个聚类质心点,形成k个簇c(k),其每类质心点:
46、μ1,μ2,...,μk∈μ(k)
47、步骤2、针对特征数据集d中每个样本xi,计算它到每个质心的距离,并将其分到距离最小的聚类质心μj所对应的簇c(j)中:
48、c(j)=argminj||xi-μj||2,j∈1,2,..k,xi∈d
49、步骤3、对于每个簇c(j),重新计算该簇质心的值,m为该簇样本个数:
50、
51、步骤4、重复步骤2和步骤3直到算法收敛或达到最大迭代次数n;
52、步骤5、质心最大的簇的所有样本的异常分值scorek-means=1,其余簇的样本的异常分值scorek-means=0。
53、优选地,所述异常算法组合模型单元采用基于树模型的孤立森林算法计算异常分值,首先确定数据集d,确定构建孤立树个数t,采用不放回的随机采样抽取部分样本作为子样本集d′,通过递归构建每一棵孤立树,并行完成指定个数的孤立树后,集合为孤立森林,计算异常分值score,具体公式如下:
54、
55、
56、h(x)=e+c(t.size)
57、其中:n为样本数;e为样本x从树的根节点到叶节点的过程中经历的边的个数,即split次数;t.size表示和样本x同在一个叶子节点的样本个数;h(x)表示样本x在某孤立树中的路径长度,e(h(x))表示样本x在所有树中路径长度的平均值;c(n)是树的平均路径长度;h(i)是调和数,近似为ln(i)+γ,γ为欧拉常数;对于结果大于0.5的样本,异常分值score孤立森林=1,其余样本异常分值score孤立森林=0。
58、优选地,所述异常算法组合模型单元通过设置权重分配,组合使用作为异常识别算法,以减少单一方法的局限性和误差率,具体公式如下:
59、
60、其中,scoref范围为[0,1],分值越大,异常可能性越大。
61、优选地,所述异常程度划分单元,设置的患者异常阈值上限upper和下限lower,将患者的异常分值score与上限upper和下限lower进行比较,若异常分值score大于等于上限upper,判定该患者为异常人群;若异常分值score小于上限upper、大于等于下限lower,无法判断该患者是否异常,为其打上疑似标记,留待人工查验;若异常分值score小于下限lower,判定该患者记录不属于异常人群。
62、通过本发明提供的系统,基于患者唯一标识对应的患者在预设范围内的就诊记录,判断患者是否存在异常就诊行为,包括但不限于异常就诊卡数、异常就诊频次、异常开药数量等异常行为数据,能够准确、高效的自动定位与预警参保人,有力保障个人与公共卫生财产;同时,非正常就诊行为的的监控,也为临床大数据科研提供了更为准确有效的数据,减小研究结果偏差。
63、本发明的优点在于:第一,对患者数据进行了规范的数据清洗和数据校验,进一步提升了数据质量;第二,提供了医疗大数据模型中一些基本的数据标准与结构化的方法与流程;第三,针对不同异常场景,根据疾病种类、手术类型、就诊地区等设计构建多特征模型,从而多维度地进行模型分析;然后,采用基于统计学的箱型图和3sigma原则、基于聚类模型的k-means算法和基于树模型的孤立森林算法,将四种算法通过权重分配组合使用,判断异常值,避免了单一算法的局限性和提高了异常识别的准确性;最后,本发明使用了《医联工程联网医院信息采集》,以下简称为“临床诊疗”为基础数据源,可以广泛应用于医疗卫生信息系统中。
1.一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,包括:
2.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述患者个人信息处理单元中,所述数据处理包括以下步骤:
3.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述患者个人信息处理单元中,进行记录清洗时,包括若关键信息为空,则判断为数据质量较低,不能完成患者身份识别,将当前数据舍弃,并完成重复样本数据剔除操作。
4.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述患者个人信息处理单元中,进行所述信息合并时,按照医保卡数据应用逻辑,将相同就诊卡号+卡类型认定为同一患者,按照以下优先级完成同一患者的证件信息统一:
5.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,在所述患者医疗就诊信息划分与统计单元中,针对任一患者pi,首先计算在预设时间范围内的总就诊次数zcount和总就诊卡数量kcount,其次根据国际疾病分类icd-10,按照就诊年份形成就诊次数判别矩阵di,如下:
6.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述异常算法组合模型单元所采用的箱型图上边界计算公式如下:
7.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述异常算法组合模型单元采用基于聚类模型的k-means算法计算异常分值,其中,初始设置簇的数目k,最大迭代次数n,具体步骤如下:
8.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述异常算法组合模型单元采用基于树模型的孤立森林算法计算异常分值,首先确定数据集d,确定构建孤立树个数t,采用不放回的随机采样抽取部分样本作为子样本集d′,通过递归构建每一棵孤立树,并行完成指定个数的孤立树后,集合为孤立森林,计算异常分值score,具体公式如下:
9.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述异常算法组合模型单元通过设置权重分配,组合使用作为异常识别算法,以减少单一方法的局限性和误差率,具体公式如下:
10.如权利要求1所述的一种基于组合算法异常医疗就诊行为的识别系统,其特征在于,所述异常程度划分单元,设置的患者异常阈值上限upper和下限lower,将患者的异常分值score与上限upper和下限lower进行比较,若异常分值score大于等于上限upper,判定该患者为异常人群;若异常分值score小于上限upper、大于等于下限lower,无法判断该患者是否异常,为其打上疑似标记,留待人工查验;若异常分值score小于下限lower,判定该患者记录不属于异常人群。
