基于用户交互的主题模型提升方法,包括:步骤1:文档数据预处理;对语料库中每一篇文档进行数据预处理,获得语料库中每个词的重要性列表L;使用气泡云图对词的重要性列表L进行可视化,在该可视化界面交互进行去停词操作;步骤2:主题模型建模和分析结果的可视化;利用预处理好的语料库作为输入,通过LDA主题模型训练得到主题‑文档分布和主题‑词分布;通过统计的方法提取主题模型的信息,并设计数据可视化视图来展示信息;步骤3:基于用户交互的模型提升阶段;对主题模型分析结果可视化视图进行分析和探索,分析当前主题模型的不足;然后将先验知识带入模型中再次训练;对前后两次模型输出的结果进行统计计算;最后重复该步骤进行迭代优化。
📄 2018113756212
📂 G06F16_34
👤 浙江工业大学
📅 2018-11-19
融合主题模型和卷积神经网络的垂直域实体消歧方法,包括:1、构建领域知识库;2、将预处理后的数据集进行词向量模型训练,并构建相应的词典;3、提取出待消歧实体名称,并从领域知识库中确定该实体对应的候选实体集,将实体上下文信息进行词向量化表示;4、将经人工标注的训练集语料利用词库构造代表实体主题的关键词字典作为输入,训练并保存主题模型;5、将经人工标注的数据集作为训练集和验证集进行训练,优化模型参数并保存CNN模型;6、根据步骤4和5中得到的主题特征相似度Sim1和语义特征相似度Sim2,利用权值归一化操作以最优方式融合两种特征相似度;7、取值最大的融合相似度对应的候选实体为最终消歧实体。
📄 2020106801969
📂 G06F40_30
👤 浙江工业大学
📅 2020-07-15
一种面向NLP基于GSDPMM和主题模型的Mashup服务谱聚类方法,包括以下步骤:第一步:通过GSDPMM方法计算出Mashup服务数量的主题个数;第二步:根据上下文信息和服务标签信息计算单词的语义权重信息从而得到文档‑单词语义权重信息矩阵D;第三步:统计单词共现信息,计算出SPPMI矩阵信息;第四步:基于文档‑单词语义权重信息矩阵D和SPPMI矩阵M,通过分解M得到词嵌入信息矩阵,将上述两种信息进行结合,计算服务的主题信息;第五步:得到的Mashup服务主题特征作为谱聚类的输入进行聚类。本发明融合优化的词嵌入和单词语义权重计算方法来缓解短文本带来的稀疏性问题,找到更优的解集。
📄 2021100971706
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
本发明公开了基于音频事件和主题模型的音频场景识别方法及其装置,该方法包括训练音频场景分类模型;提取待识别音频文档的主题分布作为音频特征,并将提取的音频特征代入音频场景分类模型中进行分类识别,最终输出待识别音频文档的音频场景类别。本发明提出以音频事件作为统计单元,创新性地对音频文档‑音频事件共现矩阵进行主题分析,其与人类的音频场景识别模式更加一致,因此本发明提出的音频场景识别思路更加合理,更能提高识别的准确率。
📄 2016105250553
📂 G10L15_06
👤 山东师范大学
📅 2016-07-05
本发明涉及信息检索和数据挖掘领域,特别涉及一种基于LDA主题模型的三部图新闻推荐方法,包括获取用户浏览过的新闻标题和文本并记录点击时间,并对获取的数据进行预处理;使用LDA文档主题建模方法对预处理后的数据进行主题建模得到新闻的主题特征;根据领域方法得到用户物品倒排列表并结合主题特征进一步计算用户间的相似性,最后得到目标用户最近邻用户;将目标用户和最近邻用户和这些用户所浏览过的新闻以及这些新闻所属的主题输入到基于加权的三部图网络结构中得到欲推荐新闻的最终权重,按照该权值由高到低进行TOP‑N推荐;本发明有效利用了新闻的文本数据提提升了推荐精度,还改善了个性化推荐方法的稀疏性问题。
📄 2019112367796
📂 G06F16_9535
👤 重庆邮电大学
📅 2019-12-05
基于超像素和主题模型的极化SAR图像分类方法,输入待分类的极化SAR图像,并对其进行精致Lee滤波处理;使用均匀采样的方式对步骤1处理后的图像进行样本点采集,得到样本点集合;对样本点集合提取三种类型的特征,并分别进行归一化,得到特征集合F1、F2、F3;对特征集合F1、F2、F3分别进行聚类,形成视觉字典V1、V2、V3,并合并为多特征视觉字典V;在步骤1处理后的图像的基础上进行过分割,得到若干个超像素,根据字典V对每个超像素进行稀疏编码;使用主题模型对超像素的稀疏编码进行特征学习,并用SVM分类法分类,得到最终分类结果,能够有效表示极化SAR图像的异质区域。
📄 2017106670496
📂 G06K9_00
👤 深圳泓瑞知识产权服务有限公司
📅 2017-08-07