本发明涉及数据共享,更具体地说,涉及一种基于大数据的数据共享仓构建方法。
背景技术:
1、数据共享仓支持各种数据库的能力、支持实时和离线的数据同步能力;主要内容按照业务特点对同步过来的数据进行清洗加工,然后以宽表的形式对外提供服务;数据集成是数仓的特性,所以数仓需要具备数据集成的能力;数据集成它不等价于数据同步平台,数据同步只是数据集成的第一步,数据集成的目的是为了打通数据孤岛,从而更好地支持企业的数据决策,数仓打破数据孤岛的方式是将各个业务系统数据集中到一个统一的、集中的数据仓库;
2、公开号为cn112199431a的中国专利提出了一种基于元数据进行数据共享的方法及数据共享系统,方法包括读取数据库的表以及er关系形成基础的元数据,并添加注释建立er关系,删除元数据中的无用表和字段;获取页面数据资源目录和目录与数据库中表的映射关系,生成查询sq l;对数据集构建dataframe,数据集之间通过dataframe进行关联并配置数据共享任务;加载配置文件,并制作容器镜像推送镜像至私有镜像仓库,部署程序发布数据共享任务;数据共享机构完成注册并提交请求,完成数据共享密钥分配并接收数据配置信息进行数据共享;
3、但是在实际的使用过程中,自动识别无用表和字段可能不够准确,可能会错误地删除重要数据,元数据注释的自动化可能不够详尽或准确,而且对于数据源的评估数据是共享仓构建的基础,现有的方式很难保证元数据的相关性和准确性。
技术实现思路
1、为解决上述问题,本阀门提出了一种基于大数据的数据共享仓构建方法,包括以下步骤:
2、步骤一:识别获取关键数据源并进行分类,确保关键数据源的相关性和准确性;
3、步骤二:创建数据目录,映射页面数据资源目录与数据库表,实施数据优化措施,提高查询效率;
4、步骤三:配置数据共享任务,定义灵活的数据发布策略并且实时监控系统,确保系统的透明度和可追踪性;
5、步骤四:进行加密策略优化和密钥管理,保障数据共享过程的透明度和合规性。
6、优选的,所述识别获取关键数据源并进行分类的步骤包括:
7、数据源识别,获取得到业务需求和数据使用情况,并且确定数据源列表;
8、数据抽取和元数据提取;
9、实现定义业务规则,并对提取的数据进行数据重要性评估;
10、对数据进行分类;
11、对无用数据进行清洗。
12、优选的,所述对提取的数据进行数据重要性评估的过程如下:
13、获取得到定义业务规则中每个字段的重要性评分qi;
14、根据公式wi=σ(α*qi)+(β*e)计算获取得到每个提取后的数据的重要性评估值wi,完成对提取的每个数据进行数据重要性评估,其中α和β为预设的比例系数,e为每个提取后数据的其他指标评分。
15、优选的,所述每个字段的重要性评分qi的获取方式如下,具体为:
16、根据公式qi=(γ1*ti)+(γ2*yi)+(γ3*ui),计算获取得到每个字段的重要性评分qi,其中γ1、γ2和γ3为预设的比例系数,ti为第i个字段的使用频率评分、yi是第i个字段的业务关键度评分,ui是第i个字段的查询频率评分。
17、优选的,所述对数据进行分类的具体过程如下:
18、获取得到每个数据的业务关键度评分pi;
19、获取得到每个数据的使用频率评分ai;
20、获取得到每个数据的数据类型适应性评分si;
21、根据公式di=(δ1*pi)+(δ2*ai)+(δ3*si),获取得到第i个数据的分类值di,其中δ1、δ2和δ3为预设的比例系数;需要说明的是,在本实施例中,δ1、δ2和δ3的取值可以为0.293、0.397和0.310;
22、事先设定一个分类值的阈值范围,将分类值di和分类值的阈值范围进行对比,如果分类值di大于分类值的阈值范围,则判断第i个数据为第一分类,如果分类值di位于分类值的阈值范围中,则判断第i个数据为第二分类,如果分类值di小于分类值的阈值范围,则判断第i个数据为第三分类。
23、优选的,所述对无用数据进行清洗的方式如下,具体为:
24、事先设定每个提取后的数据的重要性评估值的最低阈值,将每个提取后的数据的重要性评估值wi和最低阈值进行对比,如果重要性评估值wi小于最低阈值,则判断该数据为无用数据。
25、优选的,所述确保关键数据源的相关性和准确性的具体方式如下:
26、数据源评估:评估数据源的质量,包括数据源审查和数据源监控,数据源审查:定期审查数据源以确保其持续符合业务需求、数据源监控:实施监控机制,跟踪数据源的性能和数据质量;
27、数据源反馈:建立反馈机制,收集用户对数据源的反馈。
28、优选的,所述数据源评估的具体方式如下:
29、根据公式计算获取得到数据源的相关度评分k;
30、根据公式获取得到数据源的准确度评分j,其中数据总数为数据源中的数据总数,错误数据总数为通过校验发现的不一样的数据;
31、根据公式m=(ρ1*g)+(ρ2*j),计算获取得到数据源的综合度评分m,其中ρ1和ρ2为预设的比例系数;
32、事先设定一个综合度评分的阈值,如果综合度评分m小于综合度评分的阈值,则进行数据源反馈,如果综合度评分m大于或者等于综合度评分的阈值,则正常使用数据源。
33、优选的,所述数据源反馈的具体方式如下:
34、获取得到用户的反馈值n;
35、事先设定一个用户的反馈值的阈值,如果用户的反馈值n小于反馈值的阈值,则进行问题分类、优先级排序并且制定行动计划。
36、优选的,所述数据源优化的具体方式如下:
37、问题识别:
38、资源评估
39、解决方案设计:
40、行动计划制定:
41、风险评估:
42、沟通计划:
43、执行与监控:
44、反馈循环。
45、有益效果:通过自动识别无用表和字段可能不够准确,避免错误地删除重要数据,数据注释更加详尽或准确,可以保证元数据的相关性和准确性。
1.一种基于大数据的数据共享仓构建方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述识别获取关键数据源并进行分类的步骤包括:
3.根据权利要求2所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述对提取的数据进行数据重要性评估的过程如下:
4.根据权利要求3所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述每个字段的重要性评分qi的获取方式如下,具体为:
5.根据权利要求4所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述对数据进行分类的具体过程如下:
6.根据权利要求3所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述对无用数据进行清洗的方式如下,具体为:
7.根据权利要求1所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述确保关键数据源的相关性和准确性的具体方式如下:
8.根据权利要求7所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述数据源评估的具体方式如下:
9.根据权利要求8所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述数据源反馈的具体方式如下:
10.根据权利要求9所述的一种基于大数据的数据共享仓构建方法,其特征在于,所述数据源优化的具体方式如下:
