基于词汇链特征扩展和LDA模型的微博分类方法,针对微博文本长度短、内容少、特征稀疏等问题,提出了词汇链特征扩展方法。在《同义词词林》的基础上生成基础词汇链,再利用基础词汇链去扩展微博文本。词汇链不仅能够涵盖到被《同义词词林》收录的词汇,而且还能涵盖到未被《同义词词林》收录的其他词汇,并且在扩展微博文本的同时还能不断丰富词汇链。针对向量空间模型在微博文本分类中高维数、语义特征不明显的问题,使用LDA主题模型的主题概率分布来表示微博文本,有效地降低了相似度计算的维度,并且融合了一定的语义特征。本方法综合了词汇链特征扩展和LDA模型的各自的优势,提出了微博分类方法。实验结果表明,这个方法有效地提高了微博文本的分类性能。
📄 2018103930674
📂 G06F16_33
👤 浙江工业大学
📅 2018-04-27
本发明公开了一种文本分类方法,涉及文本智能处理领域,所述方法包括:构建第一文本分类模型;采集样本文本数据,对所述样本文本数据进行处理获得训练集;利用所述训练集训练所述第一文本分类模型获得第二文本分类模型;获得待分类文本数据,将所述待分类文本数据输入所述第二文本分类模型,所述第二文本分类模型输出所述待分类文本数据的分类结果;本方法能够提升对长文本的文本信息的提取效果。
📄 2021116729990
📂 G06F16_35
👤 成都信息工程大学
📅 2021-12-31
本发明提供了一种针对突发事件新闻的文本分类方法,属于自然语言处理领域,包括:收集新闻文档,完成数据清洗,及文档的分词、依存分析和指代消解等预处理操作,得到新闻数据集D;将新闻数据集D加入到背景语料,利用Word2Vec训练后学习词的分布式表示;对新闻数据集D中的每篇新闻d进行事件抽取并构造事件词典;采用无参聚类的中文口哨方法对事件词典中的所有事件进行聚类以得到事件簇;对聚类后得到的每个事件簇,计算其出现频率和倒排文档频率,以提取特征事件;根据特征事件为每篇新闻文档构建其特征向量;采用支持向量机的分类算法完成对新闻文档的分类。该方法语义表征能力和类别区分度强。
📄 2021104677730
📂 G06F16_35
👤 乐山师范学院
📅 2021-04-28
本发明公开一种垃圾邮件的分类方法,包括1)采用相对文档-特征词频率差异的方法,分别计算出现在ham类和spam类中特征的权重;2)取ham类和spam类特征的文档-特征词频率的差值,差值反映了特征出现在ham类与出现在spam类之间的差异程度;3)根据差异值的正负,将特征集合分成两类,负值为spam类特征,正值为ham类特征;4)采用包装模式的特征选择方法,结合Particle Swarm Optimization(PSO)优化算法运用滑动窗口对spam类和ham类特征数的比例进行组合搜索,产生候选特征子集,然后分别在候选特征子集上进行验证并采用F1值进行迭代评价;5)输出F1值最高的候选特征子集作为最终的特征集合;该垃圾邮件的分类方法的分类效果要比传统的基于过滤模式的方法要好。
📄 2017109795347
📂 G06K9_62
👤 苏翀
📅 2017-10-19
本发明实施例提供邮件分类方法及装置。一实施例中,该方法包括:将接收到的邮件文本进行处理,将所述邮件文本映射成初始向量;利用堆栈自编码器对所述初始向量进行处理得到输出向量;对所述输出向量进行分类,根据所述输出向量的分类判断所述邮件是否垃圾邮件。通过上述方法及装置能够提高垃圾邮件的识别效率,提高用户体验。
📄 2017101618325
📂 H04L12_58
👤 盐城工学院
📅 2017-03-17
本发明涉及一种结合相对位置信息的弱监督文本分类方法,属于自然语言处理领域,包括以下步骤:S1:输入初始化种子词,以及与初始化种子词同类的为标记文档;S2:生成伪标签;S3:基于生成的伪标签训练Transformer文本分类器;S4:通过文本分类器为未标记的文本分配标签;S5:通过比较排序方法,更新每一个类别的种子词,返回步骤S2进行迭代训练。本发明提升了模型的学习能力,提高了分类的准确率。
📄 2022106396933
📂 G06F16_35
👤 重庆邮电大学
📅 2022-06-07
本发明涉及一种计算机文本分类系统,其包括文本预处理模块、文本的形式化模块,文本权值计算模块、模型训练模块、噪声降低模块;本发明的有益效果是,本发明能有效地减少计算机文本分类的时间和空间复杂度,从而使得计算机文本分类更加快速、有效和准确。
📄 2016109213604
📂 G06F16_35
👤 江苏理工学院
📅 2016-10-21
本发明公开了一种基于机器学习的政务文本分类、热点问题挖掘方法及系统,所述分类方法包括:获取多条训练政务文本数据及相应标签,并构建编码字典;基于编码字典得到所述多条训练政务文本数据的向量表示;对标签数据进行编码,得到各标签的向量表示;根据文本数据及相应标签的向量表示,采用机器学习模型训练政务文本分类模型;所述政务文本分类模型用于政务文本分类。本发明通过政务文本构建字典,基于该字典进行文本编码和向量表示,可以提高政务文本分类的准确度。在分类的基础上,对每一类中的问题进行聚类,并且通过相似度计算出来的问题类别数,可以进一步提高政务文本聚类的效果。
📄 2020106587096
📂 G06F16_353
👤 山东师范大学
📅 2020-07-09
本发明请求保护一种微博文本分类系统,具体包括以下模块:数据预处理模块:用python爬虫软件爬取微博博文信息和微博用户信息,清洗缺失的数据,并根据情感极性进行人工打标;词向量词性增强模块:通过word2vec构造微博博文信息的词向量,在原始词向量的基础上,根据情感词词典和程度副词词典增强词性信息;新特征构造模块:用于对微博用户信息进行特征提取工作,在原始特征的基础上构造出新的特征;分类模块:利用改进的textCNN模型,先通过卷积层和池化层学习词向量信息,再通过全连接层融入用户信息,最后用softmax函数激活,将微博文本分为积极、消极和中性三种类型。
📄 2019111972048
📂 G06F16_35
👤 重庆邮电大学
📅 2019-11-29
本发明公开了一种学生浏览网页分类方法基于N‑Gram和朴素贝叶斯分类器,具体实现步骤,先从导航类网站爬取URL描述信息,构建四分类语料库,把语料库文本表示成uni‑gram和bi‑gram的形式,以TF‑IDF作为文本特征的权重,用朴素贝叶斯分类算法构建分类器;对学生浏览记录中的URL按设定规则进行切分,通过分类器和URL类别库匹配确定URL类别,由分类器确定的URL类别,若符合设定置信度,则加入到URL类别库中。本发明方法有效的对学生浏览记录中URL分类,提高了网页的识别率和分类的准确率。
📄 2017107924235
📂 G06F16_951
👤 淮阴工学院
📅 2017-09-05