一种基于双知识图谱的新闻标题短文本分类方法,包含:对新闻标题短文本进行预处理,去除特殊字符;通过jieba分词工具提取新闻标题中的关键词,去除停用词;通过CNDBPedia外部知识库提供的API,将关键词链接到外部知识库获取实体集合;通过余弦相似度对实体集合进行消岐,得到候选实体集合;基于全局关键词共现信息,构建领域知识图,解决OOV问题;通过链接到外部知识库获取与实体相关的解释信息,丰富上下文语义信息;使用BERT获取原始新闻标题和实体链接的解释信息的字符级向量表示,并融合这两部分的向量表示,以弥补短文本信息不足的缺点;使用TextCNN来提取多个连续单词之间的N‑grams特征,捕捉深层次的语义信息;最后通过Softmax函数进行分类,得到最终的分类结果。
📄 2022106430313
📂 G06F16_353
👤 浙江工业大学
📅 2022-06-08
本发明公开了一种基于有监督对比学习的开放服务意图检测方法,首先使用BERT进行语义编码得到初始词向量表示,然后利用标签信息通过线性分类层和有监督对比学习表示层同时学习,获得丰富且有区分度的句向量特征表示。表示学习完成后,该模型就变为下一步联合训练的特征提取器。为了获得更多的开放类事件文本帮助训练,使用数据增强方式Mix‑up生成新的开放类样本。最后将获取的样本和合成的样本同时输入到具有两个分支的联合训练模型中进行训练优化。判断意图事件文本属于哪个已知类,如果不属于任何已知意图事件类,就认为它是开放类意图事件。本发明构建的已知意图事件分类和开放类意图检测检测方法具有推理速度快、解释性强、准确率高的特点。
📄 2022107580426
📂 G06F16_353
👤 浙江工业大学
📅 2022-06-29
本发明提供了一种基于对比学习的方面级情感分析方法及装置。方法包括:S1,基于预设的多个方面情感对生成多个提示句对;S2,将待分析语句输入基于对比学习的方面级情感分析模型获得分析结果,方面级情感分析模型包括:增强模块,将待分析语句与不同提示句对中的疑问或回答提示句组合获得不同的待分析增强语句;预训练编码层,获得待分析增强语句的句子表示向量和词向量;第一激活函数层,获取第一分析结果;第二激活函数层,标记出与方面情感对匹配的目标词语位置从而获得标记序列。实现了目标‑方面‑情感联合检测,对待分析语句利用疑问或回答提示句进行增强处理后能生成高质量的语义信息,有效缓解稀疏标记数据问题,提高情感分析效果。
📄 2023101219208
📂 G06F16_353
👤 重庆大学
📅 2023-02-16
本发明涉及基于情绪感知元学习的跨事件虚假新闻检测方法,它包括构建情绪感知元任务和事件自适应元任务;对情绪感知元任务进行加权元学习;将事件自适应元任务和经过加权元学习后的情绪感知元任务输入基本检测模型进行训练得到初步检测模型;使用目标事件数据对初步模型进行微调得到最优模型;将待检测帖子输入最优模型,输出该待检测帖子的预测标签。本发明将情绪深度融入元学习过程,从已有事件中学习细粒度的元知识,构建情绪感知任务,通过双层优化目标得到能使多个已有事件损失快速达到极小值的初始化参数,通过使模型参数对多个事件敏感,使模型在只有少量标记数据的情况下快速适应目标事件。
📄 2023103104957
📂 G06F16_353
👤 重庆大学
📅 2023-03-28
本发明公开了基于对比学习和异构图注意力网络的作者名称消歧方法,属于知识图谱构建的实体消歧技术领域,包括使用MongoDB存取论文名称、作者、机构等信息,使用python的字符处理库对数据进行清洗,去除噪声获得更加规范的文本,清洗成适用于后续步骤的数据;使用对比学习对论文进行表征学习,获得论文的统一编码的嵌入;以纯度优先为原则对论文进行聚类,缓解论文过合并问题,得到论文簇;对上一步得到的论文簇使用异构图注意力网络进行对齐;提出过拆分检测和过拆分对齐算法,保证论文消歧质量。本发明更好的实现了同名作者消歧的消歧问题,在一定程度上解决了论文过合并和论文过拆分的问题。
📄 2022111516070
📂 G06F16_353
👤 燕山大学
📅 2022-09-21
本发明属于文本分类技术领域,公开了一种自适应门控残差连接的相关性虚假新闻检测方法,本发明利用Electra编码器将新闻文档转换为词嵌入向量;将词嵌入向量输入到多尺度循环卷积神经网络中,提取全局或局部语义的词嵌入特征;并通过自适应门控残差连接得到关键词嵌入特征;在批样本中,利用文档级交叉注意力,根据新闻文档之间的相关性来给予新闻文档不同的影响权重,得到文档级交叉注意力的输出;并通过自适应门控残差连接获得最终文档特征;将最终文档特征送入分类器,分类器输出新闻检测结果。本发明通过使用自适应门控残差连接和文档级交叉注意力,可以提高虚假新闻检测任务的准确性和鲁棒性。
📄 2024118202726
📂 G06F16_353
👤 华东交通大学
📅 2024-12-11
本发明适用于数据标注技术领域,提供了一种高质量智能数据标注方法,包括以下步骤:向量化及向量空间构建:输入文本,进行种子标注,选择代表性样本;将文本映射为d维语义向量,得到整个语料的向量空间;以部分已标注样本为提示,驱动LLM产出规则特征,确定规则特征向量;构造混合特征空间;构建相似图,进行标签传播;进行不确定数学信度检验,将信度嵌入样本,确定向量证据、规则证据以及LLM直判证据,进行证据融合,将证据变成最终信度,将信度送入标签传播,进行决策。本发明利用LLM产出规则特征并确定规则特征向量,挖掘数据中的语义和模式信息,两者在混合特征空间中融合,从多个角度对数据进行表征,提高了标注的准确性。
📄 2025114034942
📂 G06F16_353
👤 闽南理工学院
📅 2025-09-29
本发明提供了一种支持短文本流在线聚类的上下文增强狄利克雷模型,其特征在于:包括以下步骤:步骤1,根据计算的概率,选择将到达的文档添加到模型的活动集群中,或者创建一个新的集群进行添加;步骤2,当模型中已有集群的文档到达的概率小于伪概率时,则将文档视为新主题的出现,从而创建新的集群;步骤3,随着文档的到来,模型对旧的集群(即过时的主题)进行检查并删除,从而使得当前分布的近期主题集群在模型中处于活跃状态,为了推断模型中的活跃簇数,在每个ρ时间单位间隔后重新采样来自最近ψ文档的随机文档数η。本发明具有模型效率高,稳健性强的优点。
📄 2022115045851
📂 G06F16_353
👤 电子科技大学长三角研究院(湖州)
📅 2022-11-29
本发明公开了一种基于损失阈值和动态权重的自适应医学文本分类方法,对预先获取的医疗文本进行预处理,然后使用分词器进行文本分词,生成对应的字符序列并进行语义特征编码;基于样本损失分布确定易或难样本阈值,并在后续每轮训练中依据该阈值对样本进行易或难标记与动态权重更新;将医疗文本的语义嵌入与首次被判定为易样本的轮次及最终权重信息融合,以融合特征在特征空间中进行三类数据分层划分,自适应动态再训练预训练语言模型,使模型先在简单难度数据集上进行训练,并根据验证集性能增益动态引入中等及困难难度样本,直至模型在完整的数据集上性能收敛。本发明能提升医学文本分类任务的收敛速度、分类精度和鲁棒性。
📄 2025110639039
📂 G06F16_353
👤 南京信息工程大学
📅 2025-07-31
本发明提供了一种基于量子迁移学习的文本分类方法,属于量子计算与人工智能融合领域。考虑到文本分类中的复杂特征空间和非线性特性,优化量子电路设计、自注意机制以及量子转移学习过程,以提高模型的学习效率和分类准确性。将该高维特征表示与复杂非线性决策过程转化为量子自注意网络结构,利用复杂量子内核自注意网络(CQKSAN)模型获得文本分类的最优策略,并在其中引入了量子叠加和纠缠机制以增强模型的表达能力。仿真结果表明,所提算法相比于传统深度学习算法和其他混合量子‑经典算法,具有更高的分类精度和学习效率。该方法不仅展现了混合量子‑经典方法的潜力,还为未来全量子学习系统的进一步研究提供了基础。
📄 2024115992272
📂 G06F16_353
👤 湖南师范大学
📅 2024-11-11
本发明提供了一种基于量子迁移学习的文本分类方法,属于量子计算与人工智能融合领域。考虑到文本分类中的复杂特征空间和非线性特性,优化量子电路设计、自注意机制以及量子转移学习过程,以提高模型的学习效率和分类准确性。将该高维特征表示与复杂非线性决策过程转化为量子自注意网络结构,利用复杂量子内核自注意网络(CQKSAN)模型获得文本分类的最优策略,并在其中引入了量子叠加和纠缠机制以增强模型的表达能力。仿真结果表明,所提算法相比于传统深度学习算法和其他混合量子‑经典算法,具有更高的分类精度和学习效率。该方法不仅展现了混合量子‑经典方法的潜力,还为未来全量子学习系统的进一步研究提供了基础。
📄 2024115992272
📂 G06F16_353
👤 湖南师范大学
📅 2024-11-11
本发明公开了一种基于小样本学习的文本实体关系分类方法,包括以下步骤:1)采用卷积神经网络作为实例编码器提取数据集中实例向量的语义特征;2)在小样本学习场景下,通过设计原型级注意力机制模块,为每个实例赋予权重,以加权求和的方式表示每个关系的原型;3)在小样本学习场景下,更换新的度量函数。通过距离级注意力机制模块,利用卷积操作提取支持集向量中的特征系数,并用曼哈顿距离公式与特征系数的乘积作为新的度量函数来计算支持集中每一个关系原型和查询实例之间的距离;4)利用softmax函数实现小样本关系分类。
📄 2022103183403
📂 G06F16_353
👤 河海大学
📅 2022-03-29