本发明属于基因预测,具体涉及一种基于pca建立的作物多性状全基因组预测方法及系统。
背景技术:
1、目前全基因组选择(gs)在作物育种方面的应用大多数是基于单个性状的表型值建立预测模型,然而,在实际育种过程中,需要对多个性状进行同时选择。在这种情况下,目前的基于单个性状的全基因组选择(gs)方法,需要对多个性状逐一进行预测计算,耗时耗力,很难应用到实际的育种上。此外,尽管作物的许多性状之间存在一定的关联,但只依赖单个性状表型值建立的gs预测模型在实际育种应用中不可避免的会出现预测偏差,影响选择的效果。
2、此外,提高gs的预测精度一直是gs技术从理论研究走进实际育种应用的关键,此前研究为提高对某一目标性状的预测精度试着开展多性状联合预测,提出了一种基于选择指数的gs方法。选择指数可利用性状间的遗传相关性构建一个综合指标进行多性状的联合选择,但如果遗传关联估计不准确,可能导致选择指数不精确,影响选择效果。
技术实现思路
1、针对现有技术的不足,本发明提供一种基于pca建立的作物多性状全基因组预测方法及系统,通过pca聚合多个相关性状,从而进行数据降维,以此既可以达到同时选育多个相关性状的效果,提高gs预测效率。
2、为实现上述目的,本发明提供了如下方案:
3、一种基于pca建立的作物多性状全基因组预测方法,包括以下步骤:
4、基于基因分型测序,对预设作物群体进行基因分型,获得基因型数据;
5、基于随机抽样,将完成基因分型的所述预设作物群体划分为建模群体和预测群体;
6、对所述建模群体进行表型测定,获得相关性状表型,并对所述相关性状表型进行pca分析,获得表型值;
7、结合所述表型值与所述基因型数据,构建岭回归最佳线性无偏预测模型;
8、将所述预测群体的基因型数据代入所述岭回归最佳线性无偏预测模型,进行全基因组预测,获得作物多性状全基因组预测结果。
9、优选的,获得所述基因型数据的方法为:
10、获得预设作物群体的原始基因序列数据,并对所述原始基因序列数据进行过滤,将过滤后的所述原始基因序列数据与已知参考基因序列数据进行比对,获得比对结果;
11、基于所述比对结果,进行snp检测,获得snp检测结果;
12、基于所述snp检测结果,获得所述基因型数据。
13、优选的,所述相关性状表型包括预设作物群体的株高、穗位高、抽雄日期、吐丝日期和授粉日期。
14、优选的,获得表型值的方法为:
15、基于相关性状表型,构建数据集,并对数据集中的每个相关性状表型进行标准化处理;
16、基于标准化后的相关性状表型构建协方差矩阵,计算所述协方差矩阵的特征值以及所述特征值对应的特征向量;
17、将所述特征值按降序排列,选择前k个最大的特征值以及对应的特征向量,构建矩阵;
18、基于所述矩阵,将标准化后的相关性状表型转换到低维空间,获得pc分数;
19、基于所述pc分数,获得若干关联的所述表型值。
20、优选的,构建岭回归最佳线性无偏预测模型的方法为:
21、基于所述表型值,获得表型向量;
22、基于所述基因型数据,获得基因型协变量矩阵;
23、基于表型向量以及基因型协变量矩阵,建立岭回归最佳线性无偏预测模型。
24、本发明还提供一种基于pca建立的作物多性状全基因组预测系统,其用于实现所述方法,包括:
25、基因型获取模块,用于基于基因分型测序,对预设作物群体进行基因分型,获得基因型数据;
26、群体划分模块,用于基于随机抽样,将完成基因分型的所述预设作物群体划分为建模群体和预测群体;
27、表型测定模块,用于对所述建模群体进行表型测定,获得相关性状表型,并对所述相关性状表型进行pca分析,获得表型值;
28、预测模型构建模块,用于结合所述表型值与所述基因型数据,构建岭回归最佳线性无偏预测模型;
29、预测模块,用于将所述预测群体的基因型数据代入所述岭回归最佳线性无偏预测模型,进行全基因组预测,获得作物多性状全基因组预测结果。
30、优选的,所述基因型获取模块包括:
31、比对单元,用于获得预设作物群体的原始基因序列数据,并对所述原始基因序列数据进行过滤,将过滤后的所述原始基因序列数据与已知参考基因序列数据进行比对,获得比对结果;
32、snp检测单元,用于基于所述比对结果,进行snp检测,获得snp检测结果;
33、基因型数据获取单元,用于基于所述snp检测结果,获得所述基因型数据。
34、优选的,所述表型测定模块包括:
35、标准化单元,用于基于相关性状表型,构建数据集,并对数据集中的每个相关性状表型进行标准化处理;
36、协方差矩阵构建单元,用于基于标准化后的相关性状表型构建协方差矩阵,计算所述协方差矩阵的特征值以及所述特征值对应的特征向量;
37、矩阵构建单元,用于将所述特征值按降序排列,选择前k个最大的特征值以及对应的特征向量,构建矩阵;
38、pc分数获取单元,用于基于所述矩阵,将标准化后的相关性状表型转换到低维空间,获得pc分数;
39、表型值获取单元,用于基于所述pc分数,获得若干关联的所述表型值。
40、与现有技术相比,本发明的有益效果为:本发明通过对多个高遗传力性状的表型值进行pca分析以研究性状变量之间的关系和性状变异的因素。从高度相关的复杂表型性状中提取关键信息,同时保留最多的变异性或信息,用pca分析所得的pc得分替代多个相关性状表型值,以进行数据聚合降维,并对噪声进行过滤,从而简单快速的对多性状进行全基因组选择,减少预测分析过程,提高预测效率,并提高预测精度和预测稳定性。
1.一种基于pca建立的作物多性状全基因组预测方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于pca建立的作物多性状全基因组预测方法,其特征在于,获得所述基因型数据的方法为:
3.根据权利要求1所述的基于pca建立的作物多性状全基因组预测方法,其特征在于,所述相关性状表型包括预设作物群体的株高、穗位高、抽雄日期、吐丝日期和授粉日期。
4.根据权利要求1所述的基于pca建立的作物多性状全基因组预测方法,其特征在于,获得表型值的方法为:
5.根据权利要求1所述的基于pca建立的作物多性状全基因组预测方法,其特征在于,构建岭回归最佳线性无偏预测模型的方法为:
6.一种基于pca建立的作物多性状全基因组预测系统,其特征在于,用于实现权利要求1-5任一项所述的方法,包括:
7.根据权利要求6的基于pca建立的作物多性状全基因组预测系统,其特征在于,所述基因型获取模块包括:
8.根据权利要求6的基于pca建立的作物多性状全基因组预测系统,其特征在于,所述表型测定模块包括:
