一种基于代表词对的RESTful API文档主题分布提取方法,所述方法包括以下步骤:第一步:对文档进行分词处理,并进行停止词去除与时态归一化;第二步:将分词结果转换为词对集合;第三步:在主题模型的迭代过程中计算代表词对,并利用代表词对实现概率采样算法,完成主题模型训练,输出RESTful API的文档主题分布。本发明提出一种基于代表词对的RESTful API文档主题分布提取方法,该方法设计了一种以BTM主题模型为基础的词对模型,通过一种基于主题分布信息的概率采样策略,来寻找训练过程中对当前采样主题关联度高的代表词对,并通过调节词对在采样过程中的权重信息,降低噪声问题带来的干扰。
📄 2021105702706
📂 G06F40_284
👤 浙江工业大学
📅 2021-05-25
一种面向服务数据聚类的短文本优化主题模型方法,首先设计一种以BTM主题模型为基础的词对模型,该模型利用词向量筛选词对信息,改善词对主题模型耗时较长的缺点;同时,通过一种基于主题分布信息的概率采样策略,来寻找训练过程中对当前采样主题关联度高的代表词对,并通过调节词对在采样过程中的权重信息,降低噪声问题带来的干扰;之后,将模型训练的得到的文档主题分布作为服务特征向量,利用一种优化的DPC算法(sDPC),完成对服务描述文档的聚类操作。本发明提高服务聚类精度,解决服务聚类问题中由服务描述文档带来的稀疏性与噪声问题。
📄 2021105702744
📂 G06F40_284
👤 浙江工业大学
📅 2021-05-25
本发明实施例提供一种文本处理方法及装置,其中的方法可包括:获取即时通讯应用中与目标用户关联的文本消息;将所述文本消息划分为至少一个分词;分别计算所述至少一个分词中每一个分词的情感极性;将每一个所述分词按照所述分词的情感极性对应的情感语音进行播放。本发明可将即时通讯应用中的文本消息采用情感语音进行播放,不仅提高了文本消息展示的趣味性,而且减少用户的用眼时间,使用极其方便。
📄 2015107843050
📂 G06F40_284
👤 重庆邮电大学, 腾讯科技(深圳)有限公司
📅 2015-11-16
本发明公开了一种基于Word2Vec模型的WordNet中词语相似度计算方法,该相似度计算方法先从WordNet名词数据集data.noun中提取标号集,然后使用Word2Vec模型训练提取的标号集,然后使用Word2Vec模型从训练过的标号集中提取计算用单词对所对应的标号,然后基于提取的计算用单词对所对应的标号生成标号的词向量,最后基于该词向量计算词语的相似度。该相似度计算方法能够高效准确地计算词语相似度,受人的主观影响比较小,能很好地反映客观事实。
📄 2019111285159
📂 G06F40_284
👤 曲阜师范大学
📅 2019-11-18
本发明涉及一种基于增量学习的集成式自适应水军识别方法,采用集成式模型,集成了传统分类器A和神经网络分类器B,传统分类器A,用于学习离散的用户信息特征,基于RNN的神经网络模型属于神经网络分类器B,通过深度学习捕获文本序列中的语言特征,集成式模型可以自适应水军特征的变化,通过多个模型同时对水军特征进行学习,以互补的形式提高了模型的识别准确率。同时增量学习通过不断学习新的样本特征,能够自适应的拟合用户各类特征的变化,无需重新收集新样本,无需重新训练模型,提升了模型可持续性效应,减少了各方人力成本。通过增量学习,模型可以实现更好的泛化性能。
📄 2021101699367
📂 G06F40_284
👤 成都灵枢易诊健康科技有限公司
📅 2021-02-05
本发明公开了融合图注意力网络和QA提取范式的事件抽取方法与系统,针对包括军事事件的历史作战文本,基于图注意力网络及分类机制,通过对历史作战文本进行预处理、触发词识别、事件论元角色抽取,完成对文本的处理,提高事件抽取的准确率,旨在保证在复杂多变的战场环境下,提高关键信息的提取效率,缩短指挥决策的时间。
📄 2023103307538
📂 G06F40_284
👤 南京信息工程大学
📅 2023-03-30
本发明公开了一种基于人工智能的古诗词生成方法、装置、设备及存储介质,所述方法包括:获取古诗词生成请求中包含的关键词,根据关键词,确定生成古诗词的目标类型,将关键词输入到预设的Transformer模型中,并依据目标类型,生成诗词初稿,再使用预训练的语言模型进行遮挡训练,得到临时诗词初稿,将临时诗词初稿中的每个预测文字与对应的遮挡文字对比,若存在预测文字与遮挡文字不同,则继续对临时诗词初稿进行迭代遮挡预测,直到每个预测文字与对应的遮挡文字均相同,将得到的临时诗词初稿作为目标诗词。通过循环迭代地方式和预训练的语言模型,依次对临时诗词初稿中每个文字进行遮挡预测,实现每个文字根据整体语境不断更新,提高了生成古诗词的质量。
📄 2019108815111
📂 G06F40_284
👤 平安科技(深圳)有限公司
📅 2019-09-18
本发明实施例公开了一种地址信息标准化的方法、装置、计算机设备及存储介质,其中方法包括下述步骤:获取待标准化的地址信息;将所述地址信息输入到预设的分词模型中,得到所述分词模型输出的地址分词;将所述地址分词与预设的地址库匹配,得到与所述地址信息对应的候选地址;将所述候选地址输入到预设的标准地址生成模型中,得到所述标准地址生成模型输出的标准地址,其中,所述标准地址生成模型基于Seq2Seq模型。本发明基于人工智能技术,先识别待标准化的地址信息对应的具体地址,再将其转化为预期的标准化的地址,解决了用户输入地址信息时存在多种表达方式,导致无法识别或识别不准确的问题。
📄 2019101219057
📂 G06F40_284
👤 平安科技(深圳)有限公司
📅 2019-02-18
本发明涉及人工智能技术领域,提供一种文本摘要生成方法、计算机设备及存储介质,包括:对文本进行分词处理得到目标关键词;根据目标关键词的词向量生成文本中语句的语句向量及文本片段的段向量;根据语句向量计算语句在文本中的语句权重;对段向量进行编码得到文本片段的隐状态;根据文本片段的隐状态及每个时刻的隐状态向量得到文本片段中的目标关键词的注意力权重;根据目标关键词的注意力权重及对应的代理权重计算得到t时刻的词汇概率分布,词汇概率分布表示第k个位置出现的目标关键词,代理权重为语句权重之和;根据词汇概率分布生成文本摘要。本发明能够准确的生成文本摘要,生成的文本摘要可读性强,且对于长文本具有较好的效果。
📄 2021104897711
📂 G06F40_284
👤 平安科技(深圳)有限公司
📅 2021-05-06
本发明提出一种基于改进的BTM主题模型的新闻要素词的挖掘方法,先选择文本中的有代表性的词作为文本的特征表示,利用代表性的词构建词典,设置窗口,将窗口内任意的两个代表性的词构成biterm,将多个biterm构建biterm列表;利用改进的BTM模型生成主题‑词分布和文档‑主题分布;最后根据词对主题的贡献度,提高主题‑词分布中低频代表性词分配到主题的概率,再将出现在每个主题中的通用的词剔除得到主题要素词。本发明选择短文本中有代表性的词进行biterm的生成后再进行主题建模,可以消除由于高频的通用词与不同领域的专有词汇构成词对时,影响主题建模的效果,导致各个不同领域的词混合出现在某一主题中的问题。
📄 2023106343235
📂 G06F40_284
👤 华东交通大学
📅 2023-05-31
本发明公开一种关键共性技术实体的识别方法和系统,属于文本数据识别技术领域;方法包括:步骤S1:获取所需领域的技术文本数据集,对技术文本数据集进行数据清洗;步骤S2:定义实体及语义关系,并对文本提要内容进行标注形成语料库;步骤S3:利用语料库对引入神经网络的实体关系抽取模型进行训练;步骤S4:通过通用性、效益性、关联性进行共性度量,筛选共性技术实体;步骤S5:借助社会网络分析测度技术实体重要性,同时结合引领性指标度量技术关键性,准确高效地识别出关键共性技术实体。
📄 2025110561053
📂 G06F40_284
👤 南京信息工程大学
📅 2025-07-30
本发明实施例提供一种基于最小信息熵的神经网络分词系统及训练方法。所述系统包括:卷积神经网络、双向长短期记忆神经网络、第一词库预测层和最小信息熵词库预测层,其中:卷积神经网络用于提取输入文本的特征向量并输出至双向长短期记忆神经网络;双向长短期记忆神经网络用于对特征向量进行前后文信息的读取之后输出至第一词库预测层和最小信息熵词库预测层;第一词库预测层用于根据第一词库计算并输出每个字的标签;最小信息熵词库预测层用于根据最小信息熵词库计算并输出每个字的标签。本发明实施例通过在神经网络分词系统中添加最小信息熵词库预测层,使分词系统提高未登录词的识别能力,进而提高分词准确率。
📄 2018107246462
📂 G06F40_284
👤 普天信息技术有限公司
📅 2018-07-04