一种针对论坛文本的主题挖掘方法,所述方法包括以下步骤:步骤1:爬取论坛的数据,利用文本处理手段找出大概率可能是无意义的回复,并做好标记;步骤2:对论坛文本按照句子切割,之后进行分词,根据词性删除无用的词,去停用词;步骤3:对现有的文本根据BBS‑LDA主题模型使用Gibbs Sampling进行参数估计,最终得到属于每个主题可能性最大的词语。本发明对论坛的这些特点,基于LDA提出一种新的主题模型BBS‑LDA,更有效地挖掘论坛文本中的主题,以提高论坛文本主题挖掘的能力。
📄 2018104189985
📂 G06F17_30
👤 浙江工业大学
📅 2018-05-04
一种基于TWE‑NMF模型的Web服务描述文档语义挖掘方法,包括以下步骤:第一步:根据上下文信息和服务标签信息计算单词的语义权重信息从而得到文档‑单词语义权重信息矩阵D;第二步:统计单词共现信息,从而计算出SPPMI矩阵信息;第三步:基于第一步,第二步得到Mashup服务文档单词的词频信息矩阵D,单词的上下文SPPMI矩阵M,通过分解M可以得到词嵌入信息矩阵,进一步将上述两种信息进行结合,计算服务的主题信息。本发明在模型上能和NMF模型有机的统一,并且通过分解SPPMI矩阵引入的词嵌入信息能缓解Mashup服务特征信息稀疏的问题,从而有效地对Mashup服务进行建模。
📄 202110096324X
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
本发明提供一种基于成员选择的簇加权聚类集成医学数据处理方法及系统,其中方法包括:构建聚类成员集合并输入至预先训练好的决策树模型中;从决策树模型的输出的聚类成员集合筛选出标签为预先标签的聚类成员,并以筛选出的聚类成员,生成目标聚类集体;根据簇层加权系数确定目标聚类集体的目标CA矩阵;以目标CA矩阵为基础执行层次聚类算法,得到最终的聚类结果。本发明的基于成员选择的簇加权聚类集成医学数据处理方法及系统,可以得到更加优化的聚类结果,可以更好地展示患者疾病的特征和相似性,方便医生为不同的患者选择医疗服务或定制个性化的治疗方案,有助于提高患者的医疗体验和治疗效果。
📄 2024105539360
📂 G06F18_23213
👤 盐城工学院, 盐城工学院技术转移中心有限公司
📅 2024-05-07
本发明公开了基于Web新闻文本快速检测地表覆盖变化的方法及系统,以辅助遥感影像快速预测局部地区的地表覆盖变化类型、空间范围和时间范围等,以便用最少的人工干预获取最高的变化检测精度。方法包括:构建地表覆盖变化检测知识库、获取地表覆盖Web新闻文本、从地表覆盖Web新闻文本中识别地表覆盖变化类型、判定地表覆盖变化区域、确认地表覆盖变化时间和规范整合从地表覆盖Web新闻文本中抽取的地表覆盖变化信息。本发明无需利用遥感影像,不受遥感影像获取的时间、天气状况、图像分类技术、同物异谱及同谱异物等因素的影响,避免了单纯依靠遥感影像检测方法存在的检测周期长、成本高、局部区域精确性低、难以持续更新等问题。
📄 2017110980599
📂 G06F16_335
👤 山东师范大学
📅 2017-11-09
本发明涉及一种标记松弛的多主题文本数据特征选择方法,涉及自然语言处理技术领域,方法包括:给定由特征空间和标记空间组成的多主题文本数据;使用非负标记松弛矩阵获得松弛后的标记空间;构建特征选择矩阵并进行分解得到结构化子空间和因子矩阵,挖掘特征之间和标记之间的结构化关系;构造损失函数并施加范数约束,对特征选择矩阵进行范数稀疏正则化,基于此构建总目标函数;再通过迭代求解总目标函数,获得最终特征选择矩阵;最后,利用最终特征选择矩阵选择特征以表征原始文本数据。本发明通过标记松弛、结构化子空间分解、稀疏正则化等技术手段,显著提高了多主题文本数据特征选择的准确性、解释性、泛化能力和计算效率。
📄 2024116588676
📂 G06F18_211
👤 华侨大学
📅 2024-11-20
本发明公开了一种平台留言文本挖掘方法及系统,包括对历史平台留言信息进行数据标记,得到对应的标记类别;根据历史平台留言信息和对应的标记类别训练构建的长短期记忆网络模型;以训练后的长短期记忆网络模型对待分类平台留言信息进行分类,得到待分类平台留言信息所属的标记类别;将任一标记类别下平台留言信息的留言编号和留言主题合并为合并列,对合并列进行聚类,得到当前标记类别下的留言类簇;根据留言类簇的热度得到当前标记类别下的热点留言类簇。针对网络问政平台中的用户留言数据,有利于及时发现热点问题,针对性处理、提升服务效率。
📄 2020105973101
📂 G06F16_35
👤 山东师范大学
📅 2020-06-28
本发明公开了一种基于KL距离相似性度量的研究热点演变行为检测方法,其将刊物主题性和刊物的时序性相结合,提出了时序刊物主题模型TS‑JTM,以实现学术刊物的时态热点抽取,在此基础上建立基于时间序列的主题快照刊物研究热点演变模型,同时,利用概率分布KL距离相似性度量方法,提出了度量相邻时刻主题快照中主题演变行为的检测方法,以实现对刊物中研究热点演变的细粒度分析。
📄 2018112162062
📂 G06F40_194
👤 龙图腾网科技(合肥)股份有限公司
📅 2018-10-18
本发明公开了一种分析文本数据潜在主题短语的方法及系统,该方法包括:采集文本数据集,并对文本数据集进行分词,得到文本数据集的词语表现形式;根据文本数据集的词语提取词语搭配后形成的有效短语,得到未搭配成有效短语的词语与短语集的混合表现形式;对混合表现形式的文本数据集进行词向量训练后得到对应的词向量模型;构建DR‑Phrase LDA并求解各个参数;对DR‑Phrase LDA训练,并根据训练结果输出文本数据潜在的主题短语。本发明采用基于词向量的短语主题模型,该模型在概率主题模型训练中借助汉语言学规律来合理提升模型训练中短语的统计信息,具体采用词向量的方法度量短语成分词之间的关系,定量反映词在文本整体和短语局部中的语义关系,使得模型精度更高。
📄 2019103544607
📂 G06F40_289
👤 淮阴工学院
📅 2019-04-29