摘要
本发明公开了一种面向类别不平衡下的加密流量识别方法,步骤如下:S1、获取数据集;S2、平衡数据集:采用基于密度估计的改进SMOTE算法,对原始实验数据集进行处理;S3、数据预处理:读取数据流,截断数据,并进行归一化处理;S4、最优化特征集:通过变分自动编码器模型自动提取特征,通过网络流量来识别领域常用的特征,并利用基于树模型的特征选择法得到最优化特征集;S5、识别流量:将最优化特征集输入到基于遗传算法改进的随机森林CGA‑RF分类器算法,识别目的加密流量;S6、对获得的指标结果分析,优化加密流量识别方法。本发明识别率高,误报率低,适用于对数据集的类别不平衡性和特征提取困难的加密流量识别。