一种基于高斯混合模型的数据过采样方法,包括下述步骤:首先,针对不平衡数据集,利用高斯混合模型对少数类样本进行去噪以及聚类处理;接着,根据代价敏感学习的思想,对簇间交叉验证下分类器预测错误率更高的簇分配更多的过采样数量;最后,使用标准SMOTE算法在每个少数类样本簇的内部合成相应数量的新样本;本发明在保证数据信息完整性的前提下,利用数据本身的分布信息与代价敏感学习思想对过采样的原样本与数量进行精确控制,增加了过采样样本的泛化信息,降低了分类器分类难度。
📄 2021113485246
📂 G06K9_62
👤 浙江工业大学
📅 2021-11-15
本发明请求保护一种基于Spark大数据平台的三支决策不平衡数据过采样方法,涉及数据挖掘邻域,Spark大数据技术。首先使用Spark的RDD进行数据变换,得到归一化的LabeledPoint格式的样本集,并分成训练集和测试集;其次采用Spark的RDD进行数据变化,求样本间的距离,确定领域半径,根据邻域三支决策模型将整个训练集中的样本划分成正域样本,边界域样本和负域样本;然后分别对边界域样本,负域样本进行过采样;最后调用Spark Mllib机器学习算法,验证采样效果。本发明有效解决大规模不平衡数据集在机器学习和模式识别领域中的分类问题。
📄 2016112440514
📂 G06K9_62
👤 重庆邮电大学
📅 2016-12-29