本发明涉及一种预测DNA蛋白质结合位点的集成学习方法,其包括以下步骤:获取DNA结合蛋白质位点的蛋白质序列数据;对DNA结合蛋白质位点的蛋白质序列数据预处理;使用one‑hot编码方式构建输入数据;将提取的特征合并,构建每个蛋白质序列上氨基酸的特征,将其作为输入数据;使用SMOTE算法对正样本数据进行过采样;根据正样本大小将负样本数据分成多份,每份负样本与正样本组合成一个新的数据子集,得到N个数据子集;每个数据子集使用卷积神经网络进行训练;对N个卷积神经网络的结果进行多数投票法集成,从而得到预测结果。本发明解决了不平衡数据情况下的DNA蛋白质结合位点预测问题,提高了预测的准确性。
📄 2018104890373
📂 G16B20_30
👤 成都信息工程大学
📅 2018-05-21
本发明公开了基于集成学习的二氧化氮精细化空间分布方法,收集目标区域对二氧化氮浓度产生影响因素的原始数据,将原始数据进行预处理;将预处理之后的原始数据分别与二氧化氮浓度进行相关性分析,将相关性高的原始数据作为预测变量;构建Stacking模型作为集成学习模型,利用原始数据训练Stacking模型;将训练之后的Stacking模型作为二氧化氮浓度预测模型,利用该浓度预测模型对待测区域进行二氧化氮浓度预测。本发明采用集成学习方法,融合多个机器学习模型,包括6个基模型和1个元模型,提高二氧化氮浓度的精细化空间分布预测准确度;同时减少对异常点和噪声数据的过拟合,提高模型的稳定性和泛化能力。
📄 2024100513542
📂 G06F18_27
👤 南京信息工程大学
📅 2024-01-15