本发明公开了一种基于随机近邻嵌入的文本聚类方法,包括以下步骤:对文本集进行预处理,将文本集表示为标准化词‑文本共现矩阵;通过t‑分布随机近邻嵌入(t‑SNE)将高维文本数据嵌入到低维空间,使高维空间相似度较低的文本对应的低维嵌入点距离较远,相似度较高的文本对应的低维嵌入点距离较近;将多个低维嵌入点作为K均值算法的初始质心,并根据低维空间映射点坐标,采用K均值算法进行聚类。解决了因文本高维稀疏特性带来的维数灾难问题,降低了文本数据的维数,缩短了聚类算法的运行时间,提高了聚类算法的精度。
📄 2016106835988
📂 G06F16_35
👤 盐城工学院
📅 2016-08-17
本发明提供了一种基于改进的博弈论粗糙集的文本三支聚类方法包括:采集文本数据,对文本数据进行预处理,建立文本数据集,根据文本数据集建立对应的粗糙集,对粗糙集进行聚类得到聚类信息,根据聚类信息对文本数据集进行文本聚类,得到若干个数据簇,基于改进的博弈论粗糙集的文本三支聚类对文本数据集进行聚类,处理了数据集中数值的缺失,显著降低了文本三支聚类的计算时间,提高了模型的通用性,有效且高效地提高了文本三支聚类的准确性。
📄 2023105822177
📂 G06F16_35
👤 盐城工学院; 盐城工学院技术转移中心有限公司
📅 2023-05-23
本发明提供一种基于三层加权模型的文本聚类集成方法及系统,其中,方法包括:步骤S1:获取文本集;步骤S2:对文本集进行预处理;步骤S3:基于k‑means算法,对预处理结果进行聚类集成;步骤S4:构建三层加权模型,对聚类集成结果进行优化;步骤S5:对优化后的聚类集成结果进行评价。本发明的基于三层加权模型的文本聚类集成方法及系统,三层加权模型为点、簇、划分三层加权的统一构架,探究每种加权方式对最终聚类结果的影响,弥补现有技术空白,另外,通过微调超图邻接矩阵H,依次实现点、簇、划分三层加权,处理的矩阵规模明显小于基于CA矩阵的方法,具有更低的计算复杂度,在处理大规模数据集时,效率优势明显。
📄 2021116110891
📂 G06F16_35
👤 盐城工学院, 盐城工学院技术转移中心有限公司
📅 2021-12-27
本发明公开了一种基于谱图理论的选择性文本聚类集成方法,将文本数据集采用K均值算法生成聚类成员;采用谱聚类算法从生成的聚类成员中选择出代表性成员;采用层次聚类方法对选择出的代表性成员进行集成;将集成后的代表性成员构成本文聚类结果。解决了谱聚类方法直接应用于高维、稀疏、海量的文本数据集上时导致的计算量大的问题,因此,采用本方案显著降低文本聚类的计算时间,有效提高了文本聚类的准确性。另外,本实施例使用K均值算法作为基聚类器随机选取初始质心,算法复杂度低,提升算法的鲁棒性。
📄 2021116197378
📂 G06F16_35
👤 盐城工学院, 盐城工学院技术转移中心有限公司
📅 2021-12-28
本发明提出一种基于特征扩展和T‑oBTM的弹幕文本聚类方法,包括网络新词处理阶段、主题建模阶段、文本聚类阶段三个步骤阶段,本发明提出了一种根据弹幕特点对词对进行阈值约束的oBTM流式短文本聚类方法(T‑oBTM),减少了算法执行时间,并对网络新词进行识别和处理,达到了扩展文本特征的目的,进而提高了算法精度。本发明对网络新词进行识别与处理,丰富分词词库,提高了分词精度;网络新词处理时,对识别出的实体名词和情感、观点、看法类词语进行区别处理,扩展了短文本特征,提高了聚类精度。
📄 2019107696543
📂 G06F16_35
👤 河北工程大学
📅 2019-08-20
本发明公开了动态短文本流聚类检索方法。本方法利用短文本流数据建立短期话题模型并综合长期历史话题模型对数据流中的短期话题模型进行修正得到话题与特征词的概率分布,再利用文档与话题之间的条件概率进行聚类,形成对关键词的动态精准检索。本发明通过建立动态话题模型,实现随时间变化的关键词检索功能,并通过多项式混合话题模型解决了短文本数据的稀疏性,信息缺失等问题,提升了信息检索的效率与性能。
📄 2017112112711
📂 G06F16_33
👤 南京信息工程大学
📅 2017-11-28