本发明公开了一种基于特征提取和Stacking集成学习的软件缺陷预测方法,包括:(1)利用核主成分分析对原始数据集进行特征提取,得到降维后的缺陷数据集DS′;(2)利用本发明提出的协同过滤算法为新的软件缺陷数据推荐适用的抽样方法,使用推荐的抽样算法在缺陷数据集DS′上进行不平衡处理,得到不平衡处理后的缺陷数据集DS″;(3)使用K‑Means算法对缺陷数据集DS″进行聚类,对于偏离主流类别的异常值进行剔除,得到缺陷数据集DS″′;(4)构建基于Stacking集成学习的软件缺陷预测模型,为第一层的基学习器和第二层的元学习器选择合适的分类器,构建出性能良好的软件缺陷预测模型;(5)在处理后的缺陷数据集DS″′上使用集成后的模型与基模型和主流集成模型进行对比,以此验证本发明提出的集成预测模型的性能优劣。研究结果表明,本发明提出的KSSDP集成预测模型比基模型和主流集成模型的性能更好。
📄 2021111066110
📂 G06K9_62
👤 西南民族大学
📅 2021-09-22
本发明公开了一种基于局部密度信息的软件缺陷数据自适应过采样方法,本发明首先在数据预处理阶段使用Min‑Max归一化方法统一量纲,使用提出的AgglomerativeClustering‑Relief特征选择方法,降低数据维度并删除冗余特征。然后在自适应分组采样阶段,通过分析在低维状态下的少数类实例的局部密度信息,将所有少数类实例根据各自的分布特点划分至不同的分组,并针对不同分组中的少数类实例,采用针对性的过采样策略进行自适应过采样。最终使数据集中两类样本数量达到平衡,从数据层面解决不平衡问题。
📄 2021111162527
📂 G06V10_774
👤 杭州电子科技大学
📅 2021-09-23
本发明公开了一种基于样本分布特征和SPY算法的软件缺陷预测方法;本发明基于软件缺陷数据集的分布特征,提出了边界k值确定公式。根据公式为不同的数据集选择合适的少数类边界样本。此外,本发明将SPY算法和边界采样算法结合,通过边缘样本优化SPY算法,将少数类边界区域的部分多数类样本设置成为SPY样本,并为SPY样本设置较小训练样本权重,在原始少数类边界区域内部使用边界采样的算法。SPY样本可以对边界上的少数类样本起到引导的作用,确保边界区域的少数类样本能够被正确分类。同时,通过为SPY样本设立一个较小的样本权重,减少了SPY样本对多数类样本的分类影响,最终达到一个较好的分类效果。
📄 2021107033222
📂 G06F11_36
👤 杭州电子科技大学
📅 2021-06-24
本发明公开了一种软件缺陷预测方法和系统,包括:收集和编译Java编程语言开发的软件系统的源代码文件,并将编译后的代码合并为一个统一的JSONL文件。将预处理后的JSONL文件输入到预训练的CodeBERT模型中,以获取代码的高维语义特征表示。将经过CodeBERT模型处理后得到的高维语义特征表示输入到双向门控循环单元模型中,以进一步捕获代码片段的上下文信息。基于经过上下文特征处理的代码片段,进行二分类预测,判断代码片段是否存在缺陷。本发明的优点是:充分利用代码语义信息,考虑代码结构和顺序,自动选择和强调重要的特征,将CodeBERT与BiGRU模型相结合,提高预测的准确性和可靠性。
📄 2023113011751
📂 G06F11_36
👤 湖北大学
📅 2023-10-09
一种基于协同迁移的软件缺陷预测方法,包括以下步骤:1)通过四种不同的标准化方法与TCA迁移学习方法同时结合,将原源项目数据集扩充进四个的新的同等规模源项目数据集;2)利用基于协同迁移的软件缺陷预测算法对目标项目构建协同分类器;3)对目标项目中新的待预测样本进行缺陷预测。本发明选取四种不同的标准化方法同时与TCA迁移学习方法结合来扩充源项目数据集,丰富了源项目数据的信息表达,为每一个源项目生成一个子分类器,并依据PSO算法对子分类器进行自适应权重分配,从而构建协同分类器,对目标项目中的待测样本进行缺陷预测。
📄 2017114175946
📂 G06F11_36
👤 浙江工业大学
📅 2017-12-25
本发明公开了一种基于深度迁移的软件缺陷预测方法,包括:(1)采用可视化方法将源项目和目标项目的源代码文件转化为图像文件;(2)构建深度迁移网络,其中,所述深度迁移网络包含提取单元和软件缺陷预测单元,并在特征提取单元采用自注意力机制;(3)根据采用自注意力机制提取的训练样本特征和测试样本特征之间的最大均值差异,和深度迁移网络的预测输出与样本的真值标签自检的交叉熵构建损失函数,并以损失函数收敛为目标,对深度迁移网络进行训练,以获得软件缺陷预测模型;(4)应用时,采用可视化方法将待检测源代码文件转化为图像,并将图像输入至软件缺陷预测模型,经计算,输出待检测源代码文件的缺陷预测结果。
📄 2019104465462
📂 G06F11_36
👤 浙江工业大学
📅 2019-05-27
本发明公开了一种基于异构迁移的数据集扩充方法,包括:首先,基于视图对源项目数据集进行分割,并基于神经网络对视图生成的各数据集之间训练得到异构迁移模型;然后,对大量的无类标数据,采用同样的视图分割方式生成各个视图,将视图投入异构迁移模型生成基于该视图生成的其他视图,经过组合后可以得到与源项目数据集格式相同的拟真样本;接着,利用源项目的各个视图训练各自的视图分类器;对由异构迁移模型生成的视图打上类标并给出置信度,综合各个分类器的置信度筛选出质量高的拟真样本的k个对源项目数据集进行扩充;最后,上述过程进行多次迭代,利用扩充后的源项目数据集训练生成软件缺陷预测模型进行缺陷预测。
📄 2018105374150
📂 G06F11_36
👤 浙江工业大学
📅 2018-05-30
本发明公开了一种跨项目软件缺陷预测方法及系统,针对跨项目方法的优势,融合朴素贝叶斯和最近邻的优点,将区别目标项目的所有项目的历史样本整合成训练集,结合朴素贝叶斯模型特点,使用0和0.5对目标项目中所有实例进行第一次标记,来将目标项目分为两类,值的大小表示缺陷的严重程度;利用最近邻模型的特质,二次标记目标实例,将所有实例标记为值0、0.5和1,根据标记结果,预测目标实例是否存在缺陷。
📄 2019110941697
📂 G06F11_36
👤 南京邮电大学
📅 2019-11-11
本发明公开了基于上下文感知代码翻译和特征融合的软件缺陷定位方法。本发明首先从缺陷报告和源文件中提取不同类型的信息检索特征,并且利用包含稠密块和过渡块的线性模型将信息检索的不同特征关联起来;然后构建源文件的浅层语义信息和缺陷报告匹配模块以及源文件的深层语义信息和缺陷报告匹配模块,将源文件的代码转化成的自然语言描述作为源文件的深层语义,利用深层语义和缺陷报告进行语义匹配,最后再构建融合模块将各模块的结果进行融合,得到最终的定位结果。本发明克服了现阶段缺陷定位技术中使用不充分的特征表征源文件的局限性,丰富了源文件的特征表达能力,帮助模型更好地理解源文件,从而提高缺陷定位最终预测的准确度。
📄 2024108795744
📂 G06F11_3604
👤 杭州电子科技大学
📅 2024-07-02
本发明提出基于流形组合特征和联合分布的跨项目软件缺陷预测方法,本发明选择在流形特征空间中考虑使用具有域适应的全局边缘化降噪自动编码器提取全局可转移特征和具有域适应的局部子集边缘化降噪自动编码器提取局部可转移特征,然后将提取的全局可转移特征和局部可转移特征线性组合为新的组合特征并应用实现联合分布匹配;其次,该方法引入一种迭代学习的伪标签策略,通过在循环中多次更新伪标签来提高伪标签准确率,该策略通过利用新的组合特征实现联合分布匹配,然后通过联合分布匹配获取实例权重训练模型并再次更新标签,并使更新后的标签进行新一轮的组合特征提取、伪标签更新和联合分布匹配,直至最终的预测结果收敛。
📄 2021115640142
📂 G06F11_36
👤 杭州电子科技大学
📅 2021-12-20
本发明涉及一种基于数据类不平衡分布的即时软件缺陷预测方法。本发明首先通过对样本近邻集的计算,分析样本的数据分布情况,识别噪声区样本,删除处于噪声区的有缺陷样本,将处于噪声区的无缺陷样本的标签置换为有缺陷样本的标签;再重新计算各样本的近邻集,分析当前相对干净数据集的数据分布,划分边界区和安全区,删除处于边界区的无缺陷样本;最后对训练数据集进行随机欠采样,使得样本得到数量上的平衡。本发明通过对样本数据分布的分析,以更精准的策略除去样本集中的噪声样本以及对有缺陷样本识别有负面影响的样本,以此提升模型对有缺陷样本的识别性能。
📄 2021113418222
📂 G06F11_36
👤 杭州电子科技大学
📅 2021-11-12
本发明涉及一种基于类不平衡学习算法的软件缺陷预测方法。本发明使用SWIM过采样方法合成少数类样本,使数据集由高度不平衡转化为中度不平衡,其次,使用提出的自适应代价矩阵调整策略计算出最适合当前数据集的少数类误分类代价,然后根据训练集训练出K个弱分类器,在此过程中不断地调整样本权重,预测错误的样本增大其权重,预测正确的样本减少其权重,最后,将K个弱分类器组合成一个复合分类器预测待测样本的类别。本发明解决了预测不平衡数据集时少数类样本预测准确率低的问题,可以准确的预测出有缺陷的模块,帮助测试经理寻找软件的缺陷,降低软件开发成本。
📄 2020113862863
📂 G06F18_2431
👤 杭州电子科技大学
📅 2020-12-01