通过机器学习开发基于作物基因型的抗病表型精准预测方法

刘琪 ,  左世敏 ,  彭沙莎 ,  张昊 ,  彭烨 ,  李魏 ,  熊叶辉 ,  林润茂 ,  冯志明 ,  李慧慧 ,  杨俊 ,  王国梁 ,  康厚祥

工程(英文) ›› 2024, Vol. 40 ›› Issue (9) : 100 -110.

PDF (5876KB)
工程(英文) ›› 2024, Vol. 40 ›› Issue (9) : 100 -110. DOI: 10.1016/j.eng.2024.03.014
研究论文

通过机器学习开发基于作物基因型的抗病表型精准预测方法

作者信息 +

Development of Machine Learning Methods for Accurate Prediction of Plant Disease Resistance

Author information +
文章历史 +
PDF (6016K)

摘要

传统作物病害抗病表型筛选方法既费时又昂贵。基因组选择为提高效率提供了具有潜力的解决方案,但准确预测作物对重大病害的抗病性仍具挑战性。在本研究中,我们评估了八种不同的机器学习(ML)方法,包括随机森林分类(RFC)、支持向量分类(SVC)、轻量级梯度提升机(lightGBM)、随机森林分类结合亲缘关系(RFC_K)、支持向量分类结合亲缘关系(SVC_K)、轻量级梯度提升机结合亲缘关系(lightGBM_K)、深度神经网络基因组预测(DNNGP)和密集连接卷积网络(DenseNet),用于预测植物抗病性。结果表明,本研究开发的三种结合亲缘关系(K)的机器学习方法实现了高预测准确率。具体而言,这些方法在训练和应用于水稻多样性群体Ⅰ(RDPI)时,对水稻稻瘟病(RB)抗病性的预测准确率最高达95%,对水稻黑条矮缩病毒(RBSDV)和水稻纹枯病(RSB)抗病性的预测准确率达85%。此外,整合亲缘关系的模型在预测麦瘟病(WB)和小麦条锈病(WSR)抗病性的准确率分别达90%和93%。为了评估模型的通用性,我们将训练的模型用于预测另一个独立水稻群体RDPII中品种的稻瘟病抗病性,同时,使用喷雾接种法评估水稻多样性群体Ⅱ(RDPII)品种的抗病性,将预测结果与喷雾接种结果进行比较,准确率达91%,这表明随机森林分类结合亲缘关系、支持向量分类结合亲缘关系和轻量级梯度提升机结合亲缘关系均可准确预测植物对重大病害的抗病性。本研究开发的方法不仅为预测病害抗性提供了有价值的策略,还为使用机器学习简化基于基因组的作物育种开辟了道路。

Abstract

The traditional method of screening plants for disease resistance phenotype is both time-consuming and costly. Genomic selection offers a potential solution to improve efficiency, but accurately predicting plant disease resistance remains a challenge. In this study, we evaluated eight different machine learning (ML) methods, including random forest classification (RFC), support vector classifier (SVC), light gradient boosting machine (lightGBM), random forest classification plus kinship (RFC_K), support vector classification plus kinship (SVC_K), light gradient boosting machine plus kinship (lightGBM_K), deep neural network genomic prediction (DNNGP), and densely connected convolutional networks (DenseNet), for predicting plant disease resistance. Our results demonstrate that the three plus kinship (K) methods developed in this study achieved high prediction accuracy. Specifically, these methods achieved accuracies of up to 95% for rice blast (RB), 85% for rice black-streaked dwarf virus (RBSDV), and 85% for rice sheath blight (RSB) when trained and applied to the rice diversity panel I (RDPI). Furthermore, the plus K models performed well in predicting wheat blast (WB) and wheat stripe rust (WSR) diseases, with mean accuracies of up to 90% and 93%, respectively. To assess the generalizability of our models, we applied the trained plus K methods to predict RB disease resistance in an independent population, rice diversity panel II (RDPII). Concurrently, we evaluated the RB resistance of RDPII cultivars using spray inoculation. Comparing the predictions with the spray inoculation results, we found that the accuracy of the plus K methods reached 91%. These findings highlight the effectiveness of the plus K methods (RFC_K, SVC_K, and lightGBM_K) in accurately predicting plant disease resistance for RB, RBSDV, RSB, WB, and WSR. The methods developed in this study not only provide valuable strategies for predicting disease resistance, but also pave the way for using machine learning to streamline genome-based crop breeding.

关键词

预测植物抗病性 / 基因组选择 / 机器学习 / 全基因组关联分析

Key words

Predicting plant disease resistance / Genomic selection / Machine learning / Genome-wide association study

引用本文

引用格式 ▾
刘琪,左世敏,彭沙莎,张昊,彭烨,李魏,熊叶辉,林润茂,冯志明,李慧慧,杨俊,王国梁,康厚祥. 通过机器学习开发基于作物基因型的抗病表型精准预测方法[J]. 工程(英文), 2024, 40(9): 100-110 DOI:10.1016/j.eng.2024.03.014

登录浏览全文

4963

注册一个新账户 忘记密码

1 引言

由各种病原体(如真菌、细菌、病毒及其他微生物)引起的严重病害是导致作物减产的主要因素之一。例如,分别由真菌病原体Magnaporthe oryzaeM. oryzae)和Rhizoctonia solaniR.solani)引起的水稻稻瘟病(RB)和水稻纹枯病(RSB),使得全球水稻减产[12]。水稻黑条矮缩病毒(RBSDV)由飞虱传播,严重影响中国及其他东亚国家的水稻产量[3]。麦瘟病(WB)和小麦条锈病(WSR)分别由真菌麦瘟菌和小麦条锈菌引起,对全球小麦生产安全构成重大威胁[45]。

防治水稻和小麦病害的最经济有效且环保的方法是种植含有抗病基因(R基因)的抗病品种[3,57]。R基因介导的抗病性在经过多年大面积种植后往往会丧失抗性,仅仅依靠作物品种中是否存在已知R基因来评估不同水稻或小麦品种的抗病性,通常难以获得好的评估结果。

随着植物基因分型变得更加经济,重要农作物(包括水稻、小麦和玉米等)成千上万的基因型已完成鉴定并公开发表[810]。全基因组关联分析(GWAS)方法通过对成百上千的基因型与重要性状表型之间的关联,能高效地定位性状,已成为研究作物性状的有力工具[1112]。GWAS已在水稻和小麦中鉴定出数百个标记-性状关联位点(MTA)。例如,GWAS已鉴定出12个与细菌性褐斑病相关的位点[13]、11个与细菌性叶条病相关的位点[14]、27个与纹枯病相关的位点[15]、15个与水稻稻曲病相关的位点[16],以及200多个与稻瘟病相关位点[1719]。近期研究表明,这些位点不仅包含显性抗病基因,还包含感病基因[20]。此外,微生物组塑造基因(M基因)在赋予植物广谱病害抗性方面也可发挥关键作用[21]。这些发现提示,综合考虑所有抗病性相关位点可能比单纯依赖少数已知R基因在作物抗病性预测中更为准确高效。然而,在作物育种中如何充分选择和利用好这些位点仍具有挑战性。

过去二十年,不同基因组选择(GS)模型已被应用于作物育种[22]。GS模型能够根据基因型估计育种值(GEBVs),从而缩短育种周期并提高选择的准确性[2324]。GS工具还可以基于全基因组关联分析获得的分子标记数据进行分析,例如,GMStool通过合适的关联分析和机器学习(ML)模型确定最佳标记数量,并选择最优预测模型[25]。在水稻和玉米育种中,育种者将GWAS获得的性状关联位点整合到GS模型中,显著提升了重要农艺性状的预测准确率[2627]。

随着数据规模和复杂性的迅速增加,迫切需要引入机器学习算法,以有效处理指数级增长的生物基因组数据并探索复杂生物学过程[2829]。机器学习方法在多个生物学领域取得了显著进展,包括复杂蛋白质工程[30]和癌症早期检测[31]等。此外,机器学习也在农业领域得到广泛应用,促进了植物复杂性状的精准预测。这为新型作物品种的培育提供了经济且高效的策略,大大提高了育种人员工作效率[3233]。

各种非参数机器学习方法已广泛应用于植物基因组选择,其中包括支持向量机(SVMs)、再生核希尔伯特空间(RKHSs)、神经网络(NNs)和随机森林(RFs)等[3436]。将机器学习方法融入基因组选择能够提高重要性状的预测准确率,如大豆产量[37]、小麦谷物产量和蛋白质含量[38]等。机器学习也可用于植物病害抗病性预测,如小麦锈病[39]、小麦赤霉病[40]和玉米叶斑病[41]等。一项研究利用机器学习方法对小麦抗病性进行基因组选择,发现使用RKHS方法对赤霉病抗性的预测准确率最高达到57.50% [35]。此外,被称为多层感知器(MLP)的深度神经网络也被用于预测小麦赤霉病抗病性[42],以及玉米灰斑病和玉米小斑病[43]抗病性。在水稻中,贝叶斯和最佳线性无偏预测(GBLUP)模型被用于预测稻瘟病抗病性,不同品系的预测准确率范围为15%~72% [44]。

在本研究中,我们整合了全基因组关联分析结果、病害抗性表型及种群亲缘关系(K)信息,开发了三种新型机器学习模型,即随机森林分类结合亲缘关系(RFC_K)、支持向量分类结合亲缘关系(SVC_K)和轻量级梯度提升机结合亲缘关系(lightGBM_K)。我们将这三种模型与其他五种机器学习方法进行了比较,结果表明,RFC_K、SVC_K和lightGBM_K模型在多种病害预测中表现出较高的准确率:水稻抗稻瘟病的预测准确率高达95%,而水稻抗黑条矮缩病和水稻抗纹枯病的预测准确率均为85%。此外,这些模型在麦瘟病和小麦条锈病预测中的准确率也高达90%和93%。为验证模型的通用性,我们将其应用于一个独立的水稻群体——水稻多样性群体II(RDPII),通过与喷雾接种结果对比,表明模型对稻瘟病抗病性的预测准确率达到了90%。本研究不仅为RB、RBSDV、RSB、WB和WSR病害抗性的预测提供了有效策略,也为利用机器学习简化基因组驱动的作物育种开辟了新途径。

2 材料与方法

2.1 植物和真菌材料

水稻多样性群体I(RDPI)是一个包含来自全世界各地的共413个水稻(Oryza sativa L.)资源[45,46]的群体。RDPI的表型数据来自于我们之前的研究,涵盖了温室条件下使用两株M. oryzae菌株(RO1-1和RB22)进行的稻瘟病喷雾接种表型[17],以及在河南省开封市和山东省鱼台县两个试验田的水稻黑条矮缩病发病表型[47],同时包括温室条件下使用三株R. solani菌株(1-YN7、2-MH12和A-GN43)进行的水稻纹枯病接种表型[6]。国际玉米和小麦改良中心(CIMMYT)的全球小麦育种计划包含六组小麦群体,其中麦瘟病和小麦条锈病的表型数据已发表并可公开获取[48]。水稻多样性群体II则包含来自92个国家的1445个水稻资源[49]。在本研究中,我们从广东省农业科学院获得了RDPII的核心集合,共计581个水稻资源。用于接种的M. oryzae菌株RO1-1和RB22均保存于本研究团队实验室。

2.2 喷雾接种鉴定评估水稻稻瘟病抗病性

对RDPII中581个水稻品种的三周龄幼苗进行喷雾接种,将浓度为5 × 105个孢子∙mL-1M. oryzae菌株RO1-1和RB22孢子溶解在0.1%的Tween溶液中。接种后六天,根据0~9级稻瘟病抗病性评估标准(0:无症状;1:小的封闭性病斑;2:数目较多小病斑;3:小的椭圆形病斑,灰色中心;4:扩展的椭圆形病斑;5:部分病斑形成斑块,病斑面积覆盖10%到25%;6:病斑面积覆盖26%~50%;7:病斑面积覆盖51%~75%;8:病斑面积覆盖76%~90%;9:病斑面积超过90%或完全叶片坏死)评估病害严重程度。其中0~3级表示高抗病性,6~9级表示高感病性。每个水稻品种均进行三次生物重复[19,50]。本研究中,将高抗病性和高感病性品种用于模型的构建和评估。

2.3 为ML筛选水稻和小麦抗病相关的单核苷酸多态性(SNP)位点

采用先前描述的方法进行全基因组关联分析 [17,51]。使用Tassel 5.0软件,并基于包含亲缘关系和群体结构矩阵的混合线性模型(MLM)[52]进行分析。在GWAS过程中,过滤掉微等位频率(MAF)小于或等于0.05的SNP位点。通过分析不同p值阈值标准下的结果,最终选择最适合构建机器学习模型的SNP。

2.4 训练模型中水稻和小麦品种选择方法

我们采用两种方法来选择用于模型训练的水稻和小麦品种。第一种方法是随机选择,将品种随机分为训练集和测试集,未被选入训练集的品种则作为测试集。第二种方法是基于亲缘关系树进行选择。为此,我们首先构建了品种的距离树,然后使用Perl脚本挑选代表性品种,单次训练时避免选取亲缘关系过于密切的品种。在训练集和测试集按3∶1的比例划分时,通过聚类分析将遗传距离相近的水稻或小麦品种归入同一类,以确定训练集的构成。所有系统发育树均使用分子进化遗传学分析(MEGA)v7.0软件构建[53],并通过tvBOT工具对系统发育树进行可视化处理,以提高清晰度和呈现效果[54]。

2.5 构建不同的机器学习模型

2.5.1 随机森林分类(RFC)和RFC_K模型

RFC算法是一种基于决策树的机器学习算法,它通过将多个决策树拟合到数据集的不同子集,并通过投票机制整合各决策树的预测结果,从而提升预测准确率[55]。在本研究中,我们导入了Python中sklearn包的RandomForestClassifier模块,并采用默认参数构建了RFC分类模型。此外,通过在训练集中加入亲缘关系信息,我们进一步构建了RFC_K模型[56]。

2.5.2 支持向量分类器(SVC)和SVC_K模型

SVC是一种强大的数据分类方法。SVC是支持向量机(SVM)的一种应用,通过在高维特征空间中最大化决策边界之间的间隔,直接从训练数据中构建决策函数,从而实现高效的分类。这种分类策略能够最大限度地减少分类错误,并在处理有限数据集时提高模型的泛化能力[5758]。在本研究中,我们导入了Python中sklearn包的SVC模块,采用默认参数进行模型训练。同时,通过在训练集中引入亲缘关系信息,构建了SVC_K模型。

2.5.3 轻量级梯度提升机(lightGBM)和lightGBM_K模型

LightGBM是基于梯度提升决策树(GBDT)的一种算法,通过使用基于直方图的算法优化训练速度和内存使用[59]。通过采用叶子导向的增长策略和深度限制,lightGBM在叶子顶部引入了最大深度限制,以防止过拟合,从而确保高效性。在本研究中,通过导入Python中的lightgbm包中的LGBMClassifier模块,并采用默认参数建立lightGBM模型。此外,通过分析训练集中的亲缘关系,建立了lightGBM_K模型。

2.5.4 深度神经网络基因组预测(DNNGP)模型

DNNGP是一种基于卷积神经网络(CNN)架构的模型,包含一个输入层、三个卷积层、一个批量归一化层、两个dropout层、一个展平层、一个全连接层以及一个输出层。该模型以基因组标记(或其他组学数据)作为输入,CNN层作为核心计算组件。为了增强模型的鲁棒性并防止过拟合,DNNGP采用了修正线性单元(ReLU)激活函数、L2正则化、批量归一化和dropout层。此外,该架构还包含回调函数,有助于在训练过程中优化模型性能[60]。

2.5.5 密集连接卷积网络(DenseNet)模型

DenseNet是一种卷积神经网络架构,其特点是每一层与密集块中的所有其他层紧密连接[61]。这种设计有效解决了梯度消失问题,促进了特征传播,并通过重复利用大量特征,最大限度地减少了模型的参数量。在由L层组成的DenseNet201网络中,每层的输出都作为所有后续层的输入,形成了总计L(L+1)/2个连接[62]。这种独特的连接方式不仅缓解了训练过程中的梯度消失问题,还促成了更加紧凑的模型设计,提升了泛化能力。对于个体基因型数据,首先利用p值阈值从GWAS结果中筛选出SNP,然后采用独热(one-hot)编码方法,将SNP转化为编码(A = ‘0001’; T = ‘0010’; G = ‘0100’; C = ‘1000’; R/Y/M/K/S/W/N = ‘0000’)。然后,利用Perl的SVG模块脚本将这些编码转换为图形,并使用个体的表型[易感病性(S)或高抗病性(R)]对这些图形进行分类。我们使用了其中的DenseNet121网络,并进行了相应的修改,该网络包含121层。所有分析均在Linux系统中的PyTorch框架中进行。

2.6 模型验证

模型验证采用了10折交叉验证(CV)方法。具体过程为将训练集划分为10个等量的子集(折),每个折包含相同数量的品种。使用Python中sklearn包的分层折叠函数(CV = 10)实现这一划分[56]。在每次交叉验证实验中,一个折作为验证集,其余九个折则用于构建训练集,从而保证每个样本均在训练和测试阶段中使用[63]。为确保结果的一致性和可重复性,模型采用了默认参数设置,以避免在参数调整过程中可能引入的任何主观性因素。

在分类任务中(本研究涉及RFC、RFC_K、SVC、SVC_K、lightGBM 和 lightGBM_K模型),常用的模型性能评估指标包括准确率、精确率和召回率。准确率表示正确预测样本占总样本的比例;精确率衡量分类器在预测正样本时的准确性;召回率则反映实际正样本被正确识别的比例。F1得分则是精确率和召回率的加权平均值,能够提供对模型准确性和召回能力的平衡评估。对于深度学习(DL)方法(DNNGP和DenseNet),我们使用准确率作为主要评估指标,并通过测试集上的平均准确率来评估模型的泛化能力。

A c c u r a c y = T P + T N T P + T N + F P + F N
P r e c i s i o n = T P T P + F P
R e c a l l = T P T P + F N
F 1 - s c o r e = 2 × P r e c i s i o n × R e c a l l P r e c i s i o n + R e c a l l

式中,TP表示真阳性检出;TN表示真阴性检出;FP表示假阳性检出;FN表示假阴性检出。此外,受试者工作特征曲线(ROC)用于可视化分类器的性能,显示了真阳性率与假阳性率之间的关系[64]。ROC曲线下的面积(AUC)则是用于量化分类器性能的指标,其值范围从0到1,值越接近1表明模型性能越好。AUC值被广泛用作评估分类器预测能力的标准[65]。所有ROC曲线的生成均通过Python中sklearn包的roc_curve和roc_auc_score函数完成,并采用默认参数。

3 结果

3.1 预测植物抗病性的机器学习方法

我们建立了一套分析流程,包含数据集的构建[图1(a)和(b)]、三个融合亲缘关系的机器学习模型(RFC_K、SVC_K和lightGBM_K)[图1(c)]的建立、模型验证[图1(d)]、在其他独立的水稻群体中利用这些模型进行预测并通过喷雾接种鉴定其真实抗病性[图1(e)]。用水稻稻瘟病抗病性举例:我们首先建立了包含水稻基因型和稻瘟病抗病表型的数据集,其中品种通过亲缘关系筛选,品种SNP数据通过GWAS结果筛选[17],如图1(a)和(b);接下来,我们使用数据集构建了三个包含亲缘关系的机器学习模型[图1(c)];然后,我们利用10折交叉验证、ROC曲线和水稻稻瘟病抗病性预测准确性来评估这些模型的性能[图1(d)]。我们通过使用构建好的模型来预测另一个独立水稻群体RDPII的水稻稻瘟病抗病性,同时,我们对RDPII水稻品种进行喷雾接种,并评估它们的真实抗病性水平以验证预测结果[图1(e)]。

3.2 SNP选择与最佳p值阈值模型的建立

为了探究水稻和小麦抗病性的遗传基础,我们对经过过滤的SNP(基因型不确定品种占比频率< 5%且MAF ≥ 0.05)进行了全基因组关联分析。分析对象包括RDPI水稻群体的稻瘟病、水稻黑条矮缩病和水稻纹枯病抗病性表型[6,17,47],以及小麦麦瘟病和小麦条锈病抗病性表型[48]。与水稻和小麦抗病性相关的SNP详细信息列于附录A中表S1和表S2中。为了确保结果的可靠性,我们仅选择了高抗病性和高感病性的水稻和小麦品种用于机器学习模型的构建。分类标准及用于训练机器学习分类模型的品种数量见附录A中表S3。

首先,我们构建了RFC、SVC和lightGBM模型预测RB抗性,以确定合适的p值阈值。我们将RB抗性表型数据和GWAS得到的SNP的基因型数据整合到RFC算法中进行模型训练。SNP的筛选基于GWAS中的不同p值阈值,包括p ≤ 1.0 × 10‒4p ≤ 1.0 × 10‒3p ≤ 1.0 × 10‒2p ≤ 2.0 × 10‒2p ≤ 3.0 × 10‒2p ≤ 4.0 × 10‒2p ≤ 5.0 × 10‒2。在p ≤ 1.0 × 10‒2下,总计有142个SNP与RO1-1和RB22两个菌株的抗性均相关(附录A中表S4)。

为了评估稻瘟病抗病性预测的准确性,我们对这三个分类模型(RFC、SVC、lightGBM)进行了10折交叉验证,测试模型在有限训练数据上训练时可能出现的过拟合问题[63,66]。通过交叉验证,我们获得了10个性能指标,以全面评估模型的表现。这些指标包括准确率、精确率、召回率、F1得分,以及ROC曲线下的AUC值(附录A表S5和表S6)。分析结果显示,当使用p ≤ 1.0 × 10-3p ≤ 1.0 × 10-2的阈值构建模型时,RFC、SVC和lightGBM模型均表现出较高的预测准确率。具体而言,针对RO1-1,RFC模型在上述两个阈值下的平均预测准确率分别为90.90%和92.02%;SVC模型分别为93.53%和93.18%;lightGBM模型分别为91.61%和91.25% [附录A中图S1(a)]。针对RB22,RFC模型的平均预测准确率分别为89.79%和90.20%;SVC模型为91.98%和93.10%;lightGBM模型为89.78%和91.65% [附录A中图S1(b)]。对于RO1-1菌株,随着p值阈值从p ≤ 1.0 × 10‒2逐步放宽至p ≤ 5.0 × 10-2,平均准确率和平均AUC值呈现下降趋势;对于RB22菌株,这些指标则略有提升或保持稳定(附录A中表S5、表S6及图S1)。因此,我们选择p ≤ 1.0 × 10⁻3p ≤ 1.0 × 10-2作为进一步分析的阈值。

3.3 结合亲缘关系的分类器的预测准确率显著提高

为了提高分类器的预测准确率,我们在选择训练集品种时引入了种群亲缘关系(成对距离矩阵),而不是随机选择品种,并将这些改进后的模型命名为RFC_K、SVC_K和lightGBM_K(附录A中表S7和表S8)。使用最佳p值阈值p ≤ 1.0 × 10-3p ≤ 1.0 × 10-2,我们比较了RFC、RFC_K、SVC、SVC_K、lightGBM、lightGBM_K、DNNGP和DenseNet模型在三种水稻相关病害和两种小麦病害上的预测准确率。所有模型均使用默认参数(图2图3)。

p阈值为p ≤ 1.0 × 10-3时,结合亲缘关系进行训练的模型(RFC_K、SVC_K 和 lightGBM_K)在平均预测准确率方面优于其他五种模型,尤其在水稻对稻瘟病(RB22和RO1-1菌株)抗病性预测准确率超过95%,这些模型的平均AUC值达到0.99,表现显著优于其他模型。RFC的准确率约为90%,SVC为92%,lightGBM为90%,DNNGP为88%,DenseNet为90%;对RO1-1抗病性而言,RFC的准确率约为91%,SVC为94%,lightGBM为92%,DNNGP为89%,DenseNet为92% [图2(a)和(b),附录A中表S5和表S6]。在 p ≤ 1.0 × 10-2p阈值下,RFC_K、SVC_K和lightGBM_K的平均准确率与未结合亲缘关系相比均显著提升。在这些模型中,SVC_K在RB22和RO1-1中表现出最高的准确率,达96%和98%[图2(a)和(b),附录A中表S5和表S6]。

对不同地区RBSDV预测准确率差异可能是因为环境因素不同导致。在河南省,RFC和SVC预测准确率最高,在p值阈值为p ≤ 1.0 × 10-3p ≤ 1.0 × 10-2时的准确率均为86% [图2(c)和(d)]。在鱼台,RFC_K优于其他方法,在两个阈值区间内均达到79%,而SVC_K的准确率为78%(p ≤ 1.0 × 10-3)和76%(p ≤ 1.0 × 10-2),位居第二[图2(d)和图3(d)]。

对于1-YN7、2-MH12和A-GN43三种纹枯病菌菌株,SVC_K方法表现最佳,其中预测水稻对1-YN7菌株的抗病性准确率约为 88%(p ≤ 1.0 × 10-3)和 91%(p ≤ 1.0 × 10-2)[图2(e)和图3(e)];对2-MH12和A-GN43菌株,在p ≤ 1.0 × 10-3时,RFC_K方法表现出最高的准确率(85%),与SVC_K(83%)和lightGBM_K(2-MH12为85%,A-GN43为83%)相当[图2(f)和(g)]。在p ≤ 1.0 × 10-2时,lightGBM_K方法表现最佳(2-MH12为83%,A-GN43为88%)。RFC_K和lightGBM_K两个添加了亲缘关系的模型显著提升了水稻抗2-MH12和A-GN43的抗病性预测准确率[图3(f)和(g)]。

在对小麦抗麦瘟病抗性水平预测中,RFC、RFC_K、SVC、SVC_K、lightGBM和lightGBM_K平均预测准确率都达到90%。此外,DNNGP和DenseNet在p ≤ 1.0 × 10-3时也达到了90%的准确率,较p ≤ 1.0 × 10-2阈值时分别提升3%和降低1% [图2(h)和图3(h)]。对于小麦条锈病,RFC_K、SVC_K和lightGBM_K表现出优异的性能,在两个阈值区间内的平均准确率均达93% [图2(i)和图3(i)]。

总之,将亲缘关系纳入RFC、SVC和lightGBM模型显著提高了对测试作物病害抗病性预测的准确率,提升了预测性能。

3.4 RFC_K模型在水稻抗稻瘟病水平预测中的表现与可解释性

在模型中加入亲缘关系(RFC_K、SVC_K和lightGBM_K)显著提高了模型对水稻抗稻瘟病菌株RO1-1和RB22的抗病性预测表现,在p值阈值p ≤ 1.0 × 10-2下的平均AUC值达到0.99 [图3(a)和(b),附录A中表S5和S6]。后续研究重点分析了这三个包含亲缘关系的模型,其中RFC_K模型在RO1-1上的平均AUC值最高,达0.9975,而在RB22上的平均AUC值为0.9966。表明RFC_K模型不仅具有高预测准确率,而且具有高度可靠性。为了进一步验证预测结果,我们比较了接种表型与预测表型,并将RFC_K模型的结果展示在RO1-1 [图4(a),附录A中表S5]和RB22 [图4(b),附录A中表S5]的系统发育树中。

为了探讨RFC_K模型中关键SNP与植物病害抗性之间的关系,我们评估了特征重要性[55]。我们发现具有较高特征重要性的SNP可能位于在稻瘟病抗病中发挥重要作用的区域[图4(c)和(d)]。对这些区域进行进一步分析可能有助于鉴定和克隆新的水稻抗稻瘟病基因。

3.5 加入亲缘关系模型的分类器在另一个独立水稻群体中对水稻稻瘟病抗性的预测具有高准确率

我们在另一个大型水稻群体RDPII中测试了基于RDPI训练的RFC_K、SVC_K和lightGBM_K模型的泛化能力[49],预测结果总结见附录A中表S9。为了评估预测的准确率,我们对RDPII中的品种利用稻瘟病菌株RO1-1和RB22进行喷雾接种鉴定(附录A中表S9)。我们选择高抗病品种(评分:0~3)和高感病品种(评分:6~9)水稻用于评估RFC_K、SVC_K和lightGBM_K模型。

最终预测模型(RFC、SVC和lightGBM)是基于通过10折交叉验证获得的最高准确率和AUC值来选择的(附录A中表S10)。我们使用这些最终预测模型及其对应的整合亲缘关系模型(RFC_K、SVC_K和lightGBM_K)来预测RDPII群体水稻的稻瘟病抗病性(测试两个菌株:RB22和RO1-1),如图5所示。在预测水稻对RB22的抗病性时,RFC_K模型将RFC模型的准确率从89.10%提高到了90.36%,同时AUC值从0.70提高到了0.73。然而,SVC_K和lightGBM_K模型并没有比SVC和lightGBM模型有更高的准确率,分别保持在89.31%和87.63%。AUC值则从0.76提高到0.78(SVC与SVC_K对比)和从0.71提高到0.74(lightGBM与lightGBM_K对比)[图5(a)、(d)、(f)和附录A表S10]。在预测水稻对RO1-1的抗病性时,所有三个整合亲缘关系的模型均表现更优。准确率分别从90.49%(RFC)提高到91.10%(RFC_K),从89.67%(SVC)提高到90.69%(SVC_K),从89.47%(lightGBM)提高到90.01%(lightGBM_K)。此外,AUC值也分别增加了0.02~0.04 [图5(b)、(d)、(f)和附录A表S11]。使用RFC_K模型分别对476个和492个水稻品种对RO1-1和RB22的抗病性进行预测,将预测结果与喷雾接种结果进行比较[图5(c)]。图5(g)和(h)分别展示了RO1-1和RB22菌株的代表性高感和高抗水稻品种,验证了预测结果与喷雾接种结果的一致性。

4 讨论

与传统作物育种过程中表型的选择相比,基因组选择通常采用单核苷酸多态性预测目标性状的表型。这种方法通过在表型出现之前进行选择,显著缩短了育种周期,进而大幅降低了经济成本和时间消耗。此外,GS还能够评估更多的个体,从而提高选择强度,增加遗传改良潜力[67,68]。这在改良作物抗病性方面优势突出,例如,传统的稻瘟病抗病育种可能需要经过七个生长季节,其中两个季节用于表型选择,以筛选出最佳亲本,接下来五个季节进行杂交和自交;而通过GS,仅需两代即可完成,并且选择基于基因型而非表型[44]。

结合GS的ML技术已被证明能够改进和优化植物育种流程。为实现基因组选择中的最高预测精度,育种学家通常需对多种模型进行测试,但最优模型会因具体性状和作物类型而异[69]。在植物抗病性预测领域,既往研究表明RFC和SVC模型在玉米和小麦群体中的应用效果优于基于回归的模型[7071]。LightGBM作为一种并行投票决策树算法,在分类问题中展现出卓越性能[68]。此外,基于DL的基因组选择方法通过将基因型矩阵作为输入数据,已成为表型预测的有效手段,其中DNNGP通过整合多组学数据来预测农艺性状,其模型架构基于CNN [60];而DenseNet201作为另一种基于CNN的方法,则引入了密集连接模式以提升性能[61]。在本研究中,我们选择了RFC、SVC、LightGBM、DNNGP和DenseNet模型来预测植物的抗病性。结果表明,加入亲缘关系的模型(RFC_K、SVC_K和LightGBM_K)显著提高了水稻对RB、RBSDV、RSB病害以及小麦对WB和WSR病害的抗病性的预测能力(图2图3,附录A中表S6)。值得注意的是,本研究表明整合亲缘关系的模型达到的准确率超过了绝大多数此前关于作物抗病性水平预测准确率的研究报道。这种优势可能归因于这些分类器模型不需要超大型的育种数据集,而像DNNGP和DenseNet这样的深度学习模型则依赖于超大型数据集。

预测准确率是基因组选择获得成功应用的关键。预测能力的提升,在选择压力下能转化为显著的性状增益[22]。在本研究中,除了选择合适的基因组选择模型外,通过调整标记数量和训练集的组成,结合亲缘关系的模型显著提高了作物抗病性预测的准确率。有研究报道,与随机选择SNP相比,基于全基因组关联分析选择的SNP能够提高预测准确率[72]。我们发现,在p ≤ 1.0 × 10-3p ≤ 1.0 × 10-2的阈值区间内,GWAS关联的SNP标记对预测准确率影响较小。标记间存在的强特异性连锁不平衡(LD)导致该区间预测精度变异范围较窄(通常为0.001~0.003),这意味着在全基因组范围内达到几百到几千个关联标记,便能在群体中达到良好的预测准确率[73]。本研究使用的SNP数量在p ≤ 1.0 × 10-3时范围为72~973个,而在p ≤ 1.0 × 10-2时范围为224~10 283个(附录A中表S6)。

确定训练集的规模与组成对于预测准确率至关重要。研究表明,较大的训练群体能够提升基因组预测的准确率[72,74],然而,最佳训练群体的规模需要在提高预测准确率与控制基因分型及表型测定成本之间取得平衡。此外,群体结构和遗传关系也对模型的预测准确率具有重要影响[75]。为了进一步提升模型性能,本研究在确定训练集规模与组成时,考虑了不同品种间的亲缘关系。在p ≤ 1.0 × 10-3p ≤ 1.0 × 10-2的阈值区间内,包含亲缘关系的模型(RFC_K、SVC_K、LightGBM_K)在预测准确率上优于不包含亲缘关系的模型(RFC、SVC、LightGBM),也优于基于深度学习的DNNGP和DenseNet模型。在水稻对稻瘟病抗病性预测中,加入亲缘关系的模型准确率达95%,而在对RBDSV和RSB病害抗病性预测中准确率仅85%。同样,在小麦对WB和WSR病害抗病性预测中,模型的准确率也达到了90%和93%。亲缘关系模型的预测准确率可能受多种因素影响,包括数据集的规模与质量、用于预测的特征与变量的选择,以及所研究病害的复杂性。

本研究表明,整合亲缘关系的机器学习模型(RFC_K、SVC_K 和 lightGBM_K)显著提高了在实验室和田间条件下水稻和小麦病害抗病性的预测准确率。将机器学习方法应用于基因组选择不仅可加速抗病新资源或品种的鉴定,还可缩短表型分析所需的时间并降低成本。本研究在揭示基因型与抗病性表型之间复杂关联性方面迈出了重要一步,也为预测未知或少有抗病基因的作物病害的抗病性提供了参考。为了进一步提升基因组选择中机器学习模型的预测准确率,可以通过整合新兴技术与数据源实现。例如,通过高通量表型分析在受控环境和田间条件下获取的大规模表型数据,以及通过日益普及且更为精准的下一代测序基因分型技术[7677]提高准确率。通过优化模型、具有成本效益的基因分型技术、精确的高通量表型分析平台以及精心设计的实验,机器学习模型有望加速开发出高产且对各种重大病害具有强抗性的作物优良新品种。

参考文献

[1]

Lee FN. Rice sheath blight: a major rice disease. Plant Dis 1983;67(7):829. . 10.1094/pd-67-829

[2]

Skamnioti P, Gurr SJ. Against the grain: safeguarding rice from rice blast disease. Trends Biotechnol 2009;27(3):141‒50. . 10.1016/j.tibtech.2008.12.002

[3]

Zhou T, Du L, Wang L, Wang Y, Gao C, Lan Y, et al. Genetic analysis and molecular mapping of QTLs for resistance to rice black-streaked dwarf disease in rice. Sci Rep 2015;5:10509. . 10.1038/srep10509

[4]

Schwessinger B. Fundamental wheat stripe rust research in the 21st century. New Phytol 2017;213(4):1625‒31. . 10.1111/nph.14159

[5]

Ceresini PC, Castroagudín VL, Rodrigues F, Rios JA, Aucique-Pérez CE, Moreira SI, et al. Wheat blast: past, present, and future. Annu Rev Phytopathol 2018;56:427‒56. . 10.1146/annurev-phyto-080417-050036

[6]

Chen Z, Feng Z, Kang H, Zhao J, Chen T, Li Q, et al. Identification of new resistance loci against sheath blight disease in rice through genome-wide association study. Rice Sci 2019;26(1):21‒31. . 10.1016/j.rsci.2018.12.002

[7]

Li W, Chern M, Yin J, Wang J, Chen X. Recent advances in broad-spectrum resistance to the rice blast disease. Curr Opin Plant Biol 2019;50:114‒20. . 10.1016/j.pbi.2019.03.015

[8]

Sun S, Zhou Y, Chen J, Shi J, Zhao H, Zhao H, et al. Extensive intraspecific gene order and gene structural variations between Mo17 and other maize genomes. Nat Genet 2018;50(9):1289‒95. . 10.1038/s41588-018-0182-0

[9]

Thomas WJW, Zhang Y, Amas JC, Cantila AY, Zandberg JD, Harvie SL, et al. Innovative advances in plant genotyping. In: Shavrukov Y, editor. Plant genotyping. Berlin: Springer; 2023. p. 451‒65. . 10.1007/978-1-0716-3024-2_32

[10]

Wang W, Mauleon R, Hu Z, Chebotarov D, Tai S, Wu Z, et al. Genomic variation in 3,010 diverse accessions of Asian cultivated rice. Nature 2018;557(7703):43‒9. . 10.1038/s41586-018-0063-9

[11]

Burghardt LT, Young ND, Tiffin P. A guide to genome-wide association mapping in plants. Curr Protoc Plant Biol 2017;2(1):22‒38. . 10.1002/cppb.20041

[12]

Cortes LT, Zhang Z, Yu J. Status and prospects of genome-wide association studies in plants. Plant Genome 2021;14(1):e20077. . 10.1002/tpg2.20077

[13]

Lu J, Wang C, Zeng D, Li J, Shi X, Shi Y, et al. Genome-wide association study dissects resistance loci against bacterial blight in a diverse rice panel from the 3000 rice genomes project. Rice (N Y) 2021;14(1):22. . 10.1186/s12284-021-00462-3

[14]

Sattayachiti W, Wanchana S, Arikit S, Nubankoh P, Patarapuwadol S, Vanavichit A, et al. Genome-wide association analysis identifies resistance loci for bacterial leaf streak resistance in rice (Oryza sativa L.). Plants 2020;9(12):1673. . 10.3390/plants9121673

[15]

Zhang F, Zeng D, Zhang CS, Lu JL, Chen TJ, Xie JP, et al. Genome-wide association analysis of the genetic basis for sheath blight resistance in rice. Rice 2019;12(1):93. . 10.1186/s12284-019-0351-5

[16]

Long W, Yuan Z, Fan F, Dan D, Pan G, Sun H, et al. Genome-wide association analysis of resistance to rice false smut. Mol Breed 2020;40(5):46. . 10.1007/s11032-020-01130-y

[17]

Kang H, Wang Y, Peng S, Zhang Y, Xiao Y, Wang D, et al. Dissection of the genetic architecture of rice resistance to the blast fungus Magnaporthe oryzae . Mol Plant Pathol 2016;17(6):959‒72. . 10.1111/mpp.12340

[18]

Liu MH, Kang H, Xu Y, Peng Y, Wang D, Gao L, et al. Genome-wide association study identifies an NLR gene that confers partial resistance to Magnaporthe oryzae in rice. Plant Biotechnol J 2020;18(6):1376‒83. . 10.1111/pbi.13300

[19]

Zhu D, Kang H, Li Z, Liu M, Zhu X, Wang Y, et al. A genome-wide association study of field resistance to Magnaporthe oryzae in rice. Rice 2016;9:44. . 10.1186/s12284-016-0116-3

[20]

Xu Y, Bai L, Liu M, Liu Y, Peng S, Hu P, et al. Identification of two novel rice S genes through combination of association and transcription analyses with gene-editing technology. Plant Biotechnol J 2023;21(8):1628‒41. . 10.1111/pbi.14064

[21]

Su P, Kang H, Peng Q, Wicaksono WA, Berg G, Liu Z, et al. Microbiome homeostasis on rice leaves is regulated by a precursor molecule of lignin biosynthesis. Nat Commun 2024;15(1):23. . 10.1038/s41467-023-44335-3

[22]

Xu Y, Ma K, Zhao Y, Wang X, Zhou K, Yu G, et al. Genomic selection: a breakthrough technology in rice breeding. Crop J 2021;9(3):669‒77. . 10.1016/j.cj.2021.03.008

[23]

Crossa J, Fritsche-Neto R, Montesinos-Lopez OA, Costa-Neto G, Dreisigacker S, Montesinos-Lopez A, et al. The modern plant breeding triangle: optimizing the use of genomics, phenomics, and environics data. Front Plant Sci 2021;12:651480. . 10.3389/fpls.2021.651480

[24]

Crossa J, Pérez-Rodríguez P, Cuevas J, Montesinos-López O, Jarquín D, de los Campos G, et al. Genomic selection in plant breeding: methods, models, and perspectives. Trends Plant Sci 2017;22(11):961‒75. . 10.1016/j.tplants.2017.08.011

[25]

Jeong S, Kim JY, Kim N. GMStool: GWAS-based marker selection tool for genomic prediction from genomic data. Sci Rep 2020;10(1):19653. . 10.1038/s41598-020-76759-y

[26]

Zhang Y, Zhang M, Ye J, Xu Q, Feng Y, Xu S, et al. Integrating genome-wide association study into genomic selection for the prediction of agronomic traits in rice (Oryza sativa L.). Mol Breed 2023;43(11):81. . 10.1007/s11032-023-01423-y

[27]

Wang W, Guo W, Le L, Yu J, Wu Y, Li D, et al. Integrating high-throughput phenotyping, GWAS and prediction models reveals the genetic architecture of plant height in maize. Mol Plant 2022;16(2):354‒73. . 10.1016/j.molp.2022.11.016

[28]

Greener JG, Kandathil SM, Moffat L, Jones DT. A guide to machine learning for biologists. Nat Rev Mol Cell Biol 2022;23(1):40‒55. . 10.1038/s41580-021-00407-0

[29]

Montesinos-López OA, Montesinos-López A, Pérez-Rodríguez P, Barrón-López JA, Martini JWR, Fajardo-Flores SB, et al. A review of deep learning applications for genomic selection. BMC Genomics 2021;22(1):19. . 10.1186/s12864-020-07319-x

[30]

Yang KK, Wu Z, Arnold FH. Machine-learning-guided directed evolution for protein engineering. Nat Methods 2019;16(8):687‒94. . 10.1038/s41592-019-0496-6

[31]

Jones OT, Matin RN, van der Schaar M, Bhayankaram KP, Ranmuthu CKI, Islam MS, et al. Artificial intelligence and machine learning algorithms for early detection of skin cancer in community and primary care settings: a systematic review. Lancet Digit Health 2022;4(6):e466‒76. . 10.1016/s2589-7500(22)00023-1

[32]

Najafabadi MY, Hesami M, Eskandari M. Machine learning-assisted approaches in modernized plant breeding programs. Genes 2023;14(4):777. . 10.3390/genes14040777

[33]

Wang X, Zeng H, Lin L, Huang Y, Lin H, Que Y. Deep learning-empowered crop breeding: intelligent, efficient and promising. Front Plant Sci 2023;14:1260089. . 10.3389/fpls.2023.1260089

[34]

Pérez-Rodríguez P, Gianola D, González-Camacho JM, Crossa J, Manès Y, Dreisigacker S. Comparison between linear and non-parametric regression models for genome-enabled prediction in wheat. G3Genes Genom Genet 2012;2(12):1595‒605. . 10.1534/g3.112.003665

[35]

Rutkoski J, Benson J, Jia Y, Brown-Guedira G, Jannink JL, Sorrells M. Evaluation of genomic prediction methods for fusarium head blight resistance in wheat. Plant Genome 2012;5(2):51‒61. . 10.3835/plantgenome2012.02.0001

[36]

Xu Y, Wang X, Ding X, Zheng X, Yang Z, Xu C, et al. Genomic selection of agronomic traits in hybrid rice using an NCII population. Rice 2018;11:32. . 10.1186/s12284-018-0223-4

[37]

Yoosefzadeh-Najafabadi M, Rajcan I, Eskandari M. Optimizing genomic selection in soybean: an important improvement in agricultural genomics. Heliyon 2022;8(11):e11873. . 10.1016/j.heliyon.2022.e11873

[38]

Sandhu KS, Lozada DN, Zhang Z, Pumphrey MO, Carter AH. Deep learning for predicting complex traits in spring wheat breeding program. Front Plant Sci 2020;11:613325. . 10.3389/fpls.2020.613325

[39]

Ornella L, González-Camacho JM, Dreisigacker S, Crossa J. Applications of genomic selection in breeding wheat for rust resistance. In: Periyannan S, editor. Wheat rust diseases. Berlin: Springer; 2017. p. 173‒82. . 10.1007/978-1-4939-7249-4_15

[40]

Arruda MP, Brown PJ, Lipka AE, Krill AM, Thurber C, Kolb FL. Genomic selection for predicting fusarium head blight resistance in a wheat breeding program. Plant Genome 2015;8(3):plantgenome2015.01.0003. . 10.3835/plantgenome2015.01.0003

[41]

Technow F, Bürger A, Melchinger AE. Genomic prediction of northern corn leaf blight resistance in maize with combined or separated training sets for heterotic groups. G3Genes Genom Genet 2013;3(2):197‒203. . 10.1534/g3.112.004630

[42]

Montesinos-López OA, Montesinos-López JC, Singh P, Lozano-Ramirez N, Barrón-López A, Montesinos-López A, et al. A multivariate poisson deep learning model for genomic prediction of count data. G3Genes Genom Genet 2020;10(11):4177‒90. . 10.1534/g3.120.401631

[43]

Pérez-Rodríguez P, Flores-Galarza S, Vaquera-Huerta H, del Valle-Paniagua DH, Montesinos-López OA, Crossa J. Genome-based prediction of Bayesian linear and non-linear regression models for ordinal data. Plant Genome 2020;13(2): e20021. . 10.1002/tpg2.20021

[44]

Huang M, Balimponya EG, Mgonja EM, McHale LK, Luzi-Kihupi A, Wang GL, et al. Use of genomic selection in breeding rice (Oryza sativa L.) for resistance to rice blast (Magnaporthe oryzae). Mol Breed 2019;39(8):114. . 10.1007/s11032-019-1023-2

[45]

Eizenga GC, Ali ML, Bryant RJ, Yeater KM, McClung AM, McCouch SR. Registration of the rice diversity panel 1 for genomewide association studies. J Plant Regist 2014;8(1):109‒16. . 10.3198/jpr2013.03.0013crmp

[46]

Zhao K, Tung CW, Eizenga GC, Wright MH, Ali ML, Price AH, et al. Genomewide association mapping reveals a rich genetic architecture of complex traits in Oryza sativa . Nat Commun 2011;2:467. . 10.1038/ncomms1467

[47]

Feng Z, Kang H, Li M, Zou L, Wang X, Zhao J, et al. Identification of new rice cultivars and resistance loci against rice black-streaked dwarf virus disease through genome-wide association study. Rice 2019;12:49. . 10.1186/s12284-019-0310-1

[48]

Juliana P, Poland J, Huerta-Espino J, Shrestha S, Crossa J, Crespo-Herrera L, et al. Improving grain yield, stress resilience and quality of bread wheat using large-scale genomics. Nat Genet 2019;51(10):1530‒9. . 10.1038/s41588-019-0496-6

[49]

McCouch SR, Wright MH, Tung CW, Maron LG, McNally KL, Fitzgerald M, et al. Open access resources for genome-wide association mapping in rice. Nat Commun 2016;7:10532. . 10.1038/ncomms11346

[50]

Zhu X, Chen S, Yang J, Zhou S, Zeng L, et al. The identification of Pi50(t), a new member of the rice blast resistance Pi2/Pi9 multigene family. Theor Appl Genet 2012;124:1295‒304. . 10.1007/s00122-012-1787-9

[51]

Mgonja EM, Balimponya EG, Kang H, Bellizzi M, Park CH, Li Y, et al. Genomewide association mapping of rice resistance genes against Magnaporthe oryzae isolates from four african countries. Phytopathology 2016;106(11):1359‒65. . 10.1094/phyto-01-16-0028-r

[52]

Bradbury PJ, Zhang Z, Kroon DE, Casstevens TM, Ramdoss Y, Buckler ES. TASSEL: software for association mapping of complex traits in diverse samples. Bioinformatics 2007;23(19):2633‒5. . 10.1093/bioinformatics/btm308

[53]

Kumar S, Stecher G, Tamura K. MEGA7: molecular evolutionary genetics analysis version 7.0 for bigger datasets. Mol Biol Evol 2016;33(7):1870‒4. . 10.1093/molbev/msw054

[54]

Xie J, Chen Y, Cai G, Cai R, Hu Z, Wang H. Tree visualization by one table (tvBOT): a web application for visualizing, modifying and annotating phylogenetic trees. Nucleic Acids Res 2023;51(W1):W587‒92. . 10.1093/nar/gkad359

[55]

Breiman L. Random forests. Mach Learn 2001;45(1):5‒32. . 10.1023/a:1010933404324

[56]

Pedregosa F, Varoquaux G, Gramfort A, Michel V, Thirion B, Grisel O, et al. Scikit-learn: machine learning in Python. J Mach Learn Res 2011;12:2825‒30.

[57]

Awad M, Khanna R. Support vector machines for classification. In: Awad M, Khanna R, editors. Efficient learning machines: theories, concepts, and applications for engineers and system designers. Berlin: Springer; 2015. p. 39‒66. . 10.1007/978-1-4302-5990-9_3

[58]

Cervantes J, Garcia-Lamont F, Rodríguez-Mazahua L, Lopez A. A comprehensive survey on support vector machine classification: applications, challenges and trends. Neurocomputing 2020;408:189‒215. . 10.1016/j.neucom.2019.10.118

[59]

Ke G, Meng Q, Finley T, Wang T, Chen W, Ma W, et al. LightGBM: a highly efficient gradient boosting decision tree. In: Proceedings of the 31st International Conference on Neural Information Processing Systems; 2017 Dec 4‒9; Red Hook, NY, USA. ACM Digital Library; 2017.

[60]

Wang K, Abid MA, Rasheed A, Crossa J, Hearne S, Li H. DNNGP, a deep neural network-based method for genomic prediction using multi-omics data in plants. Mol Plant 2023;16(1):279‒93. . 10.1016/j.molp.2022.11.004

[61]

Iandola F, Moskewicz M, Karayev S, Girshick R, Darrell T, Keutzer K. DenseNet: implementing efficient ConvNet descriptor pyramids. 2014. arXiv.1404.1869. . 10.1109/itsc.2015.205

[62]

Xu W, Zhao L, Li J, Shang S, Ding X, Wang T. Detection and classification of tea buds based on deep learning. Comput Electron Agric 2022;192:106547. . 10.1016/j.compag.2021.106547

[63]

Tong H, Nikoloski Z. Machine learning approaches for crop improvement: leveraging phenotypic and genotypic big data. J Plant Physiol 2021;257:153354. . 10.1016/j.jplph.2020.153354

[64]

Fawcett T. An introduction to ROC analysis. Pattern Recognit Lett 2006;27(8):861‒74. . 10.1016/j.patrec.2005.10.010

[65]

González-Camacho JM, Crossa J, Pérez-Rodríguez P, Ornella L, Gianola D. Genome-enabled prediction using probabilistic neural network classifiers. BMC Genomics 2016;17:208. . 10.1186/s12864-016-2553-1

[66]

Ban Z, Yuan P, Yu F, Peng T, Zhou Q, Hu X. Machine learning predicts the functional composition of the protein corona and the cellular recognition of nanoparticles. Proc Natl Acad Sci USA 2020;117(19):10492‒9. . 10.1073/pnas.1919755117

[67]

Liu Y, Wang D, He F, Wang J, Joshi T, Xu D. Phenotype prediction and genome-wide association study using deep convolutional neural network of soybean. Front Genet 2019;10:1091. . 10.3389/fgene.2019.01091

[68]

Qiu Z, Cheng Q, Song J, Tang Y, Ma C. Application of machine learning-based classification to genomic selection and performance improvement. In: Huang DS, Bevilacqua V, Premaratne P, editors. Intelligent computing theories and application. Berlin: Springer; 2015. p. 412‒21. . 10.1007/978-3-319-42291-6_41

[69]

Larkin DL, Lozada DN, Mason RE. Genomic selection—considerations for successful implementation in wheat breeding programs. Agronomy 2019;9(9):479. . 10.3390/agronomy9090479

[70]

Ornella L, Pérez P, Tapia E, González-Camacho JM, Burgueño J, Zhang X, et al. Genomic-enabled prediction with classification algorithms. Heredity 2014;112(6):616‒26. . 10.1038/hdy.2013.144

[71]

González-Camacho JM, Ornella L, Pérez-Rodríguez P, Gianola D, Dreisigacker S, Crossa J. Applications of machine learning methods to genomic selection in breeding wheat for rust resistance. Plant Genome 2018;11(2):170104. . 10.3835/plantgenome2017.11.0104

[72]

Cericola F, Jahoor A, Orabi J, Andersen JR, Janss LL, Jensen J. Optimizing training population size and genotyping strategy for genomic prediction using association study results and pedigree information. A case of study in advanced wheat breeding lines. PLoS One 2017;12(1):e0169606. . 10.1371/journal.pone.0169606

[73]

Abed A, Pérez-Rodríguez P, Crossa J, Belzile F. When less can be better: how can we make genomic selection more cost-effective and accurate in barley? Theor Appl Genet 2018;131(9):1873‒90. . 10.1007/s00122-018-3120-8

[74]

Zhong S, Dekkers JCM, Fernando RL, Jannink JL. Factors affecting accuracy from genomic selection in populations derived from multiple inbred lines: a barley case study. Genetics 2009;182(1):355‒64. . 10.1534/genetics.108.098277

[75]

Sarinelli JM, Murphy JP, Tyagi P, Holland JB, Johnson JW, Mergoum M, et al. Training population selection and use of fixed effects to optimize genomic predictions in a historical USA winter wheat panel. Theor Appl Genet 2019;132(4):1247‒61. . 10.1007/s00122-019-03276-6

[76]

Budhlakoti N, Kushwaha AK, Rai A, Chaturvedi KK, Kumar A, Pradhan AK, et al. Genomic selection: a tool for accelerating the efficiency of molecular breeding for development of climate-resilient crops. Front Genet 2022;13:832153. . 10.3389/fgene.2022.832153

[77]

Yang W, Feng H, Zhang X, Zhang J, Doonan JH, Batchelor WD, et al. Crop phenomics and high-throughput phenotyping: past decades, current challenges, and future perspectives. Mol Plant 2020;13(2):187‒214. . 10.1016/j.molp.2020.01.008

AI Summary AI Mindmap
PDF (5876KB)

15633

访问

0

被引

详细

导航
相关文章

AI思维导图

/