本发明公开一种基于半监督学习的标签抗噪文本分类方法,该方法首先通过任务自适应预训练预测出每个样本在每个类别上的概率,再使用置信学习方法来评估每个样本的标签质量,将所有训练数据划分为噪声样本和干净样本;对噪声样本进行处理,借助数据增强、集成学习等策略来预测噪声样本的伪标签,使用MixMatch方法来集成一致性正则化、熵最小化和传统正则化方法,结合半监督学习的主流范式思想和组件,将原始标签和伪标签结合起来重新标记噪声样本;最后结合噪声样本和干净样本,使用MixUp方法以线性插值的方式重新构建新的训练样本和标签并重新训练最终的文本分类模型。该方法极大地利用了噪声标签数据,将噪声样本的利用率最大化,提升了神经网络的鲁棒性。
📄 2022117141035
📂 G06F16_35
👤 浙江工业大学
📅 2022-12-27
本发明提供一种用于分布式大规模多天线系统的半监督学习定位方法,包括:生成两个不同的数据集,包括训练数据集和坐标隶属度集;利用半监督学习算法估计高斯混合模型GMM参数,根据训练数据集对GMM进行初始化;基于半监督期望极大EM算法对GMM参数进行迭代估计,完成GMM的训练;根据训练完成的GMM和坐标隶属度集,完成对目标接收信号强度RSS数据对应的位置信息的估计。通过分析不同天线分布情况下的系统性能,可证明本发明提供的定位方法可实现较高的定位精度;同时,该方法可以有效降低训练集的采样成本,并且仍可达到较高的定位精度;可有效保证位置估计结果的唯一性,为解决二维平面定位和三维空间定位的问题提供了一种有效的通用方法。
📄 2020102804830
📂 G06F18_214
👤 中山大学
📅 2020-04-10
本发明请求保护一种基于AP聚类的半监督网络水军识别方法及系统,涉及网络舆情领域,该方法包括以下步骤:(A)对爬取数据进行打标和数据清理,结合水军定义构造新特征;(B)将数据集拆分成训练集、测试集与验证集,作为水军识别模型的输入;(C)根据用户相似性将欧氏距离引入AP聚类算法与支持向量机算法(SVM)组合形成半监督网络水军识别模型;(D)将处理好的数据输入识别模型,判断每个用户是否为水军;(E)通过调整欧氏距离Radius的值提高模型的准确率,输出识别结果。本发明解决了现有算法中对打标数据质量和数量高度依赖,且打标数据不易获取的问题,能利用少量的打标数据实现较高准确率的识别。
📄 201911197218X
📂 G06F18_214
👤 重庆邮电大学
📅 2019-11-29
本发明涉及一种基于密度和在线半监督学习烟草分类方法,首先利用少量有标签的烟草样本进行初始训练,然后利用一批数量上大于有标签样本数的无标签样本,基于密度和距离筛选有用样本,进行在线学习,因此不断筛选更新,并获得最终的学习模型,最后的模型就可以应用于烟草的分类。本发明相比一般的半监督学习,通过密度和距离的算法增加了一个机选样本的过程,提高了模型的训练效率,运用在线学习提高模型的训练速度和适用性。
📄 2018101194229
📂 G06K9_62
👤 南京信息工程大学
📅 2018-02-06