摘要
本发明涉及一种基于数据类不平衡分布的即时软件缺陷预测方法。本发明首先通过对样本近邻集的计算,分析样本的数据分布情况,识别噪声区样本,删除处于噪声区的有缺陷样本,将处于噪声区的无缺陷样本的标签置换为有缺陷样本的标签;再重新计算各样本的近邻集,分析当前相对干净数据集的数据分布,划分边界区和安全区,删除处于边界区的无缺陷样本;最后对训练数据集进行随机欠采样,使得样本得到数量上的平衡。本发明通过对样本数据分布的分析,以更精准的策略除去样本集中的噪声样本以及对有缺陷样本识别有负面影响的样本,以此提升模型对有缺陷样本的识别性能。