一种基于互联网服务单词语义权重的文本主题挖掘方法,包括以下步骤:第一步:使用Python中的自然语言工具包,对Mashup服务描述文档进行中的单词进行词性标注;第二步:统计单词词频信息,计算TF‑IDF信息;第三步:提取Mashup服务标签信息,并基于名词集Nset和TF‑IDF值,重新计算Mashup服务描述文档中的每一个单词的语义权重;第四步:通过NMF模型求解Mashup主题特征。本发明在TF‑IDF的基础上,结合服务标签信息和上下文单词信息,重新计算单词的权重,提高关键性单词的权重值,从而有效地对Mashup服务建模,确认服务文档主题。
📄 2021100963432
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
一种云计算模式中融合词嵌入和非负矩阵分解技术的服务建模方法,包括以下步骤:第一步:统计每个Mashup服务中单词词频信息,即单词出现的次数,构建文档‑词频关系矩阵D;第二步:统计单词共现信息,从而计算出SPPMI矩阵信息;第三步:基于第一步,第二步得到Mashup服务文档单词的词频信息矩阵D,单词的上下文SPPMI矩阵M,通过分解M得到词嵌入信息矩阵,进一步将上述两种信息进行结合,计算服务的主题信息。本发明在模型上能和非负矩阵分解有机的统一,并且通过引入词嵌入信息能缓解Mashup服务特征信息稀疏的问题,从而有效地对Mashup服务进行建模。
📄 2021100971693
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
一种基于地址的单字权重统计方法,输入待统计的总数据表,记为T,其地址数据条数为N,同时建立一个存储表;首先使用逐字加一法对表T进行总字数统计,总字数记为AllWordSum;然后,使用逐字加一法统计表T中每个单字的出现次数perWordSum;同时,使用逐行加一法统计表T中每个单字的出现条数perWordRow;同时,通过计算得出正单字频率WF,逆单字频率IWF,单字加权权重WF‑IWF,按对应方式存储于结果Result中。本发明单字权重非单一化、系统存储率高。
📄 2020107085379
📂 G06F40_216
👤 浙江工业大学
📅 2020-07-22
一种基于TWE‑NMF模型的Web服务描述文档语义挖掘方法,包括以下步骤:第一步:根据上下文信息和服务标签信息计算单词的语义权重信息从而得到文档‑单词语义权重信息矩阵D;第二步:统计单词共现信息,从而计算出SPPMI矩阵信息;第三步:基于第一步,第二步得到Mashup服务文档单词的词频信息矩阵D,单词的上下文SPPMI矩阵M,通过分解M可以得到词嵌入信息矩阵,进一步将上述两种信息进行结合,计算服务的主题信息。本发明在模型上能和NMF模型有机的统一,并且通过分解SPPMI矩阵引入的词嵌入信息能缓解Mashup服务特征信息稀疏的问题,从而有效地对Mashup服务进行建模。
📄 202110096324X
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
基于主题模型的交通轨迹数据语义分析与可视化方法,包括:步骤1.提取轨迹主题,包括轨迹的文本化、提取主题;步骤2.构造张量;经过NMF模型的处理,得到由带有主题隶属度的时空单元构成的k个主题,以及每条轨迹在k个主题上的隶属度分布;包括:过滤时空单元、分类主题时空单元、构造三维张量;步骤3.分解张量;对于构造出的三维张量,采用张量的CP分解把张量分解成一系列秩一张量的和;步骤4.模式可视化;将主题模式近似看作是主题的另一种表现形式,对模式的分析也就是对主题的分析;从不同维度来展现张量分解的模式,通过这种方式简化了用户对主题的时空探索以及对主题语义理解。本发明简化了用户操作,降低了使用难度。
📄 2019112853239
📂 G06F40_216
👤 浙江工业大学
📅 2019-12-13
一种面向NLP基于GSDPMM和主题模型的Mashup服务谱聚类方法,包括以下步骤:第一步:通过GSDPMM方法计算出Mashup服务数量的主题个数;第二步:根据上下文信息和服务标签信息计算单词的语义权重信息从而得到文档‑单词语义权重信息矩阵D;第三步:统计单词共现信息,计算出SPPMI矩阵信息;第四步:基于文档‑单词语义权重信息矩阵D和SPPMI矩阵M,通过分解M得到词嵌入信息矩阵,将上述两种信息进行结合,计算服务的主题信息;第五步:得到的Mashup服务主题特征作为谱聚类的输入进行聚类。本发明融合优化的词嵌入和单词语义权重计算方法来缓解短文本带来的稀疏性问题,找到更优的解集。
📄 2021100971706
📂 G06F40_216
👤 浙江工业大学
📅 2021-01-25
本发明提供一种基于三重词频方案的Ad‑hoc信息检索模型,属于信息技术领域,所述检索模型的构建包括以下步骤:步骤一、计算LTF、RTF和PTF排名函数,并进行归一化处理,得到它们相应的表示函数TF1、TF2和TF3;其中,LTF表示长度正则化的词项频率;RTF表示相对文档内词项频率;PTF表示基于接近度的词项频率;步骤二、对TF1、TF2和TF3函数进行线性组合,基于TF1、TF2和TF3函数线性组合结果,得到检索模型。本发明构建的检索模型TriATF和TriATF*,将LTF、RTF和PTF线性地结合起来,充分利用这些词频的优势,实现更高效的文档检索,简单实用。
📄 2023106486012
📂 G06F40_216
👤 盐城工学院, 盐城工学院技术转移中心有限公司
📅 2023-06-02
本发明公开一种伪相关反馈中的文档主题相关性模型,通过在PRF模型中引入基于主题的反馈文档之间的相关性来估计反馈文档的可靠性。所述PRF模型为相关性模型,通过在PRF模型中引入基于主题的反馈文档之间的相关性构建基于主题的相关性模型。与Miao等人提出的方案不同,本发明的方法可以被认为是一种通用的方法,能够被纳入任何其它PRF模型中。在TREC的5个公开数据集上对本发明提出的基于主题的伪相关反馈的相关性模型进行了验证,实验结果表明本发明算法具有良好的性能。
📄 2022101055650
📂 G06F40_216
👤 盐城工学院
📅 2022-01-28
本发明涉及一种基于CNN‑GRNN(Convolutional Neural Network‑General Regression Neural Network)的读者情绪分布预测算法,与读者情绪有关的语义特征可以分配更大的注意力概率权重,突出了与读者情绪有关的语义特征的作用,减少了其他非相关特征的干扰,因此本算法又可称为CNN‑GRNN‑CBAT,其中CBAT表示Context Based Attention。
📄 2017107924201
📂 G06F40_216
👤 广东石油化工学院
📅 2017-09-05
本发明涉及基于卡方统计和TF‑CRF改进的TF‑IDF计算模型包括:数据载入模块、TF‑IDF计算模块、卡方统计模块、CRF计算模块、权重计算模块、权重排序模块、权重筛选模块和特征词保存模块,其特征在于模型工作步骤如下:步骤1.建立用于保存筛选后特征词的.txt文本文件;步骤2.数据模块的载入;步骤3.进行TF‑IDF计算模块的运算;步骤4.进行卡方统计模块的运算;步骤5.进行CRF计算模块的运算;步骤6.进行权重计算模块的运算;步骤7.权重排序模块的运算;步骤8.进行权重筛选模块的运算;步骤9.进行词保存模块的运算;步骤10.将步骤2‑9运算筛选得到的筛选后特征词保存在步骤1建立的文档中。
📄 2020107838922
📂 G06F40_216
👤 成都信息工程大学
📅 2020-08-06
本发明涉及自然语言序列标注技术领域,公开了一种基于深度神经网络的信息抽取方法,BERT‑BiLSTM‑CRF模型能够解决信息抽取任务中存在的一词多义与同物异名问题,以及信息抽取任务中存在的待抽取信息长短不统一和待抽取信息有错别字、描述简短等问题,通过批量过采样的方式增加批量中少数类样本信息的数量,使得模型在训练的过程中可以有效学习到少数类样本信息的特征,从而在一定程度上解决数据类别分布不均衡的问题,使得少数类样本信息的抽取效果有显著提升。
📄 2022107191396
📂 G06F40_216
👤 成都信息工程大学
📅 2022-06-23
本发明的实施例提供了一种基于机器学习的文本信息作者的识别方法及装置。该基于机器学习的文本信息作者的识别方法包括:通过将获取的所述待判定作者对应的词类个数集合和文本不同的分词出现的频率集合与所述待判定的文本信息对应的词类个数集合和所述分词结果中文本不同的分词出现的频率集合输入预设的机器学习模型,获取由所述机器学习模型输出的所述待判定的文本信息的作者是否为所述待判定的作者的结果。本发明实施例的技术方案可以在在提高作者识别准确率的同时提高作者识别的效率。
📄 201910878031X
📂 G06F40_216
👤 平安科技(深圳)有限公司
📅 2019-09-17