一种基于注意力状态转移模型的生物嵌套命名实体识别方法,包括:1.将包含DNA、RNA、蛋白质、细胞系和细胞这五种类型实体标签的生物领域文本分为训练数据和测试数据;2.根据注意力状态转移模型和语义遮罩模型的输入形式,将训练数据调整为满足模型输入的形式;3.训练注意力状态转移模型,用来学习词与词之间的关联性,通过模型输出的状态可以从文本中提取出候选实体并判断其类型;4.训练语义遮罩模型,用来判断候选实体及其类型是否符合上下文语义;5.将测试数据输入到注意力状态转移模型中,提取出候选实体,随后将提取的实体进行遮罩,送入到语义遮罩模型中进行筛选,最终确认出符合上下文的真实实体。
📄 2022106531615
📂 G06F40_295
👤 浙江工业大学
📅 2022-06-09
一种面向人机对话系统的命名实体识别方法,首先去除大语言模型的因果掩码以充分挖掘大语言模型的双向语义嵌入表征能力,使其更适用于精准的令牌分类任务;然后计算大语言模型语义嵌入的语义相似度并作为新的监督信息融合到大语言模型的语义嵌入中,以改善去掩码大语言模型在恢复双向注意力时标签监督能力不足的问题,从而使模型获得更好的语义嵌入来计算对应的实体分数;最后分别计算实体和类型分数来识别命名实体。本发明考虑了大语言模型的双向语义理解信息和语义相似度信息,提高了大语言模型在人机对话系统中的命名实体识别的准确度。
📄 2025100094878
📂 G06F40_295
👤 浙江工业大学
📅 2025-01-03
一种融合中文医疗领域特征的医疗实体识别方法,基于特定领域知识识别药品说明书中的实体,所述方法包括步骤:S1:收集中文药品说明书并进行文本预处理;S2:利用图卷积网络提取文本序列词级别的特征,其中节点的特征考虑了字音、字形以及字典的特征;S3:提取文本序列字级别的特征,并融合词级别的特征;S4:采用双向LSTM学习文本的序列特征,经过解码层得到汉字的序列标签,将标签进行组合,完成实体识别的任务。本发明充分全面地捕捉到汉字字音字形的特征,以词级别的粒度融入到实体识别的模型中,提高了医疗实体识别的精度。
📄 2022105924034
📂 G16H10_00
👤 浙江工业大学
📅 2022-05-27
本发明提出了基于深度神经网络的中文命名实体识别方法及系统,通过双向长短词记忆模型BiLSTM网络获取上下文特征,并将上下文特征输入到空洞卷积网络ID‑CNN进一步学习语义信息,将上下文特征与语义信息融合后,基于自注意力机制对其进行依赖关系的计算,得到基于依赖关系的特征向量,并通过条件随机场进行标签预测,有效地提高中文命名实体识别的准确度。
📄 202210417839X
📂 G06F40_295
👤 山东师范大学
📅 2022-04-21
本发明公开了一种融合词典信息和注意力机制的命名实体识别方法,包括:步骤(1)通过Bert字嵌入,并进行LSTM上下文融合得到字符特征及其序列;步骤(2)通过将字符特征序列通过处理得到关系特征矩阵V、距离矩阵Ed、区域网络矩阵Et和词汇网格矩阵Ew,并将四个矩阵的特征进行拼接得到网格关系特征;步骤(3)将步骤(2)的网格关系特征通过全局注意力机制进行全局特征融合得到融合了全局信息的Word‑Pair特征;步骤(4)利用的Word‑Pair特征以及字符特征进行联合预测,得到Word‑Pair关系矩阵;步骤(5)Word‑Pair关系矩阵进行解码,得到最终的实体词及其类型。该方法将词语级别的信息表示为Word‑Pair词嵌入关系矩阵融入到模型中的方法,提高实体边界的识别准确率。
📄 2022115466530
📂 G06F40_295
👤 华航信航空科技(浙江)有限公司
📅 2022-12-05
本发明公开一种实体识别模型训练方法、装置、计算机设备及存储介质,该实体识别模型训练方法采用词频算法,对训练标准实体和每一训练同义实体进行向量相似度计算,获取每一训练同义实体与训练标准实体的稀疏相似度;采用语义识别模型,对训练标准实体和每一训练同义实体进行向量相似度计算,得到每一训练同义实体对应的密集相似度;根据稀疏相似度和密集相似度,从训练同义实体中筛选得到目标同义实体;采用批量梯度下降法对目标同义实体进行处理,获取多个分批训练集;依次采用分批训练集,对biobert模型进行分批训练,优化biobert模型中的损失函数,获取实体识别模型,以提高实体识别模型的性能。
📄 2021106112123
📂 G06F40_295
👤 平安科技(深圳)有限公司
📅 2021-06-01
本发明属于自然语言处理领域,涉及一种命名实体识别模型的双级对比学习训练方法及相关装置;所述方法包括获取第一训练文本语句;通过预训练后的第一命名实体识别模型处理,得到是否为实体向量的分类结果;对具有实体向量的第一训练文本语句打标,得到第二训练文本语句;通过预训练后的第二命名实体识别模型处理,得到第二训练文本语句的实体类型;通过每个实体类别标签的原型向量与相应第二训练单词特征之间的对比距离,以及各个第二训练单词特征之间的对比距离,计算得到双级对比学习损失;基于双级对比学习损失对命名实体识别模型的参数调整后继续进行训练,得到训练完成的第二命名实体识别模型;本发明通过两阶段的命名实体识别模型降低了每一步的分类难度。本发明的双级对比学习,减轻模型分类时误判率。
📄 2024117747631
📂 G06F40_295
👤 重庆邮电大学
📅 2024-12-05
一种基于可组合弱认证器的命名实体识别的算法架构,包括:实体识别部分和结果认证部分;所述实体识别部分用于完成识别任务,得到识别结果;所述结果认证部分包括两个及以上弱认证器,分别用于对所述识别结果在每个弱认证器对应细分目标上进行检验认证。本发明所述弱认证器为能够独立完成一个细分目标的模块,其所需的训练数据能够在已有任务语料库上自动生成。弱认证器和实体识别部分形成端到端的网络,用于使用监督方法进行优化学习。本发明通过可组合的弱认证器来辅助命名实体识别的过程,有效提高实体识别的精度,并能简单快速地在特定领域实体识别场景下适配扩展。
📄 2020116018975
📂 G06F40_295
👤 山东大学
📅 2020-12-30
本发明公开了一种基于图传播和动态注意力的网络安全命名实体识别方法及装置。对输入的网络安全文本数据进行预处理,根据网络安全词典构建异构图并且标注边类型;采用图注意力网络GAT实现图传播模块,通过动态注意力机制强化实体之间的语义关联,引入动态卷积层以增强模型对局部上下文的捕捉能力,为每个位置动态生成卷积核;通过双层条件随机场CRF解码器和束搜索进行解码,第一层CRF解码器负责识别简单的网络安全实体,第二层CRF解码器用于识别更复杂的嵌套或多层次网络安全实体,使用束搜索近似求解全局最优,通过这种双层解码策略,不仅提高了实体识别的准确性,也优化了实体之间关系的识别。
📄 2024111009145
📂 G06F40_295
👤 淮阴工学院
📅 2024-08-12
本发明涉及一种多模态命名实体识别方法、装置以及电子设备,该方法包括:获取社交媒体的评论数据,评论数据包括文本和与文本对应的图像,获得上下文表示和图像实体词,输入至多头跨模态注意力机制模型,获得文本向量和图像向量,输入至门控机制模型进行融合,获得多模态融合特征,输入至混合专家系统,获得第一隐藏层向量,输入至自注意力层进行编码,获得第二隐藏层向量,将第一隐藏层向量、第二隐藏层向量以及预设的概率转换矩阵输入至条件随机场,获得命名实体识别结果,引入词性信息,来消除文本实体的噪声,通过门控机制筛选图像信息,来消除图像的噪声,基于知识库的混合专家系统滤除多模态融合后的噪声,从而提高了命名实体识别精度。
📄 2021110000205
📂 G06F40_295
👤 华南师范大学
📅 2021-08-30