本发明公开了一种基于领域文本分类的知识抽取和知识融合方法及系统,方法按如下步骤:S1.构建领域知识文本数据集;S2.构建基于ChatGPT的领域知识抽取框架,抽取步骤S1中领域知识文本数据集所蕴含的领域知识;S3.构建基于对比学习和词分类的多任务学习知识融合框架,将步骤S2中获取的领域知识与深度语言模型进行融合。本发明降低了高质量领域知识的获取难度,同时提高语言模型与领域知识的融合程度。
📄 2024114289294
📂 G06F40_30
👤 浙江理工大学
📅 2024-10-14
本发明涉及一种基于注意力机制的多标签文本分类方法及系统,属于计算机领域。该方法首先使用GloVe预训练嵌入模型对文本进行初始化,获得文本嵌入,利用Bi‑LSTM和自注意力机制提取文本语义信息,然后利用图注意力网络(GAT)来捕获标签之间的依赖关系并且使用标签注意力机制获取文本和标签之间的语义关系,最后添加额外的CorNet模块,该模块能够学习标签相关性,使用相关性知识增强原始标签预测,并输出增强的标签预测,从而提高多标签分类的预测精度。
📄 2022100555809
📂 G06F16_35
👤 重庆邮电大学
📅 2022-01-18
本发明公开一种基于Gate‑Mixup数据增强的知识蒸馏化工文本分类方法及装置,首先同时对图神经网络教师模型以及Transformer学生模型进行初始训练;然后进行一阶段蒸馏训练,通过指标函数与门控单元对教师模型输出进行筛选,满足预设条件,则直接作为logits输入蒸馏损失函数指导学生模型,否则对文本表示进行数据增强,最后将输出残差叠加输入蒸馏损失函数指导学生模型训练;将教师模型与学生模型角色进行对调作为二阶段蒸馏训练,循环执行上述一阶段和二阶段蒸馏训练,最终获得蒸馏好的学生模型;实际应用时,将化工文本样本输入学生模型,获得预测输出文本类别。本发明通过构建的数据增强方法有效增强相互学习困难样本知识蒸馏效果,提升学生模型文本分类性能。
📄 2022111562153
📂 G06F16_353
👤 淮安华凯教育科技有限公司
📅 2022-09-22
本发明公开了一种基于相似度模型和FastText的多标签文本分类方法。适用于普遍的有监督文本标签预测问题。这种改进的文本标签预测算法主要是基于已经构建好的文本标签数据,结合了文本相似思想。对历史文本数据进行处理,首先使用隐马尔科夫链文本分词算法得到分完词的文本,再通过文本相似度算法提取文本相似项,查询历史数据得到文本标签,然后对分完词的文本进行FastText训练,得到最终文本标签的方法。本发明方法可有效获取一种准确度最高的文本标签并进行推荐,使文本多标签的预测更加准确,并增加了历史文本标签的使用价值。
📄 201810635615X
📂 G06F16_35
👤 淮阴工学院
📅 2018-06-20