本发明公开了一种面向中文文本的端到端中文实体关系联合抽取方法,包括优化中文预训练模型,对输入的中文文本进行编码处理,生成中文文本的文本表示;对中文文本的文本表示进行实体解码处理,得到实体BIO标注序列和上下文表示向量;采用上下文注意力机制确定上下文注意力向量;将上下文注意力向量与中文文本的文本表示拼接后进行关系编码处理,得到关系编码表示;采用双仿射注意力机制进行关系解码处理,得到实体关系抽取结果。本发明能够捕捉到词级别的交叉依赖信息,能有效提升模型准确性和鲁棒性。
📄 2023116292507
📂 G06F40_295
👤 成都信息工程大学
📅 2023-11-30
基于多层次自适应语义增强的中文医疗命名实体识别方法和装置,其方法包括:(1)将中文文本表示为T={C1、C2、···、CN},构建字符Ci特征,包括字符特征、边界特征、部首特征、拼音特征;(2)通过ERNIE‑Health预训练模型将字符级别Ci的特征转化为向量表示,包括字符特征向量ec、边界特征向量eb、部首特征向量er、拼音特征向量ep;(3)将四种字符级特征输入字符层自适应语义增强模块。使用卷积层对字符特征进行压缩,通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重,使用多层感知机进行解压缩,得到增强后的字符级特征;(4)将增强后的字符级特征输入句子层自适应语义增强模块,通过压缩和解压缩机制自适应学习句子中不同字符的贡献;(5)将经过多层次自适应语义增强模块的增强特征输入BiLSTM‑CRF模块进行标签预测。本发明能够更好地捕捉上下文中的语义差异,解决了现有方法在特征权重分配上的局限性,提升了CNER任务的整体性能。
📄 2024109829540
📂 G06F40_295
👤 浙江工业大学
📅 2024-07-22
一种基于预训练模型的特种设备中文命名实体识别方法,包括以下步骤:1)按照中文命名实体标注策略BIEOS对中文命名实体数据集进行标注,将实体类别分为四种类别;2)基于BERT预训练模型将中文句子转换为字向量表示;3)将字向量表示输入到biLSTM模型中,学习字向量序列双向编码,提取句子特征;4)采用CRF条件随机场学习上下文的标签概率,得到了每个汉字的所有可能的标签序列;5)最后输出汉字序列对应的实体类别。本发明通过无监督的方式对无标签语料中进行训练,能够有效解决小数据集、样本特征信息不足情况下中文命名实体提取的问题,用于构建特种设备领域的知识图谱。
📄 2021108934724
📂 G06F40_295
👤 浙江工业大学
📅 2021-08-04
一种基于生成式模型的医疗事件抽取方法,包括以下步骤:1)获取数据库中的电子病历文本数据,预先设定好需要抽取的实体类型和事件模板;2)在电子病历文本中,通过标注工具根据设定好的模板标注出病历中的实体和事件;3)利用transformer模型作为文本编码器,讲文本转换为向量表示;4)使用指针网络对实体进行标注4)使用池化层和线性层对事件类型进行分类;5)使用生成式transformer生成事件信息序列;6)提取事件信息序列中的论元角色,汇总事件信息。本发明以联合抽取算法对医疗电子病历中的非结构化数据进行提取,从而获得结构化的事件信息,对患者后续的病情分析提供有力的帮助。
📄 2022112075624
📂 G06F40_295
👤 浙江工业大学
📅 2022-09-30
一种面向机械化工领域的中文实体识别方法,包括:采取短文本预处理来提取有效内容;采用经过词典优化的中文分词器进行中文分词和词性标注;利用词频与类优先级函数所构成的权重函数用作权重计算同时基于规则式优化加权提取短文本目标关键词;搜索目标关键词上下文基于构建的有向概率状态转化图来进行关键词的上下文扩展从而获得目标实体。本发明还包括实施一种面向机械化工领域的中文实体识别方法的系统,包括依次连接的短文本预处理模块、中文分词和词性标注模块、权重计算和规则式优化加权模块、关键词搜索和扩展模块。本发明实现了高准确率的中文实体识别。
📄 2021105888781
📂 G06F40_295
👤 浙江工业大学
📅 2021-05-28
一种基于注意力状态转移模型的生物嵌套命名实体识别方法,包括:1.将包含DNA、RNA、蛋白质、细胞系和细胞这五种类型实体标签的生物领域文本分为训练数据和测试数据;2.根据注意力状态转移模型和语义遮罩模型的输入形式,将训练数据调整为满足模型输入的形式;3.训练注意力状态转移模型,用来学习词与词之间的关联性,通过模型输出的状态可以从文本中提取出候选实体并判断其类型;4.训练语义遮罩模型,用来判断候选实体及其类型是否符合上下文语义;5.将测试数据输入到注意力状态转移模型中,提取出候选实体,随后将提取的实体进行遮罩,送入到语义遮罩模型中进行筛选,最终确认出符合上下文的真实实体。
📄 2022106531615
📂 G06F40_295
👤 浙江工业大学
📅 2022-06-09
一种基于管道式方案的政务三元组抽取方法,包括以下步骤:1)获取某个问政平台在数据库中的社情民意描述文本,预先确定好实体的schema和关系的schema;2)将文本转化为向量放入BERT模型里进行实体起始边界的预测;3)预先设定好span的最大宽度,从预测出来的起始边界开始,逐一生成实体span,直到span的宽度等于设定的最大宽度;4)对生成的span进行实体类型的预测;5)将识别出的实体两两配对,构成若干条句子,每种实体类型用特殊的token字符表示;6)将文本中的实体替换为对应的token字符,得到新的句子;7)将新句子放到另外一个BERT模型里,得到句子向量;8)将句子向量里的头尾实体向量进行拼接,送入前馈神经网络,进行关系预测,从而完成文本的三元组抽取任务。
📄 2022105896759
📂 G06F40_295
👤 浙江工业大学
📅 2022-05-26
本发明公开一种跨语言知识图谱对齐与融合方法、装置及存储介质,所述方法包括:S1、构建两个不同语言的知识图谱网络中实体的一阶子图特征矩阵;S2、将实体的结构特征矩阵、属性特征矩阵和一阶子图特征矩阵输入到对齐模型中,获得两个不同语言的知识图谱网络中所有实体的结构特征、属性特征、子图特征三种嵌入向量矩阵,并对三种嵌入向量矩阵进行拼接;S3、计算待对齐实体与目标知识图谱网络中各实体之间嵌入向量的相似度;S4、根据相似度高低,对目标知识图谱网络中的实体进行排序,获得待对齐实体的候选等效实体;S5、根据候选等效实体对两个不同语言的知识图谱网络进行融合。本发明能够有效实现跨语言知识图谱的对齐和融合。
📄 2021102415004
📂 G06F40_295
👤 浙江工业大学
📅 2021-03-04
本发明公开了一种基于融合多层语义特征的命名实体识别方法、设备和介质,包括:获取文本数据集分为训练集和测试集,采用BIO标注方法对数据集中每个样本的字符进行标注;将标注后的数据集中的每条数据构建对应的标签序列;构建命名实体识别模型并利用训练集进行训练,命名实体识别模型包括Bert预训练语言模型、多层Transformer编码网络、双向长短期记忆网络BiLSTM层、条件随机场CRF层;将测试集输入训练好的命名实体识别模型,获得命名实体识别结果。该方法能够改善长文本中或包含长实体的文本中的实体提取效果,提升整体命名实体识别的准确性。
📄 2023101879373
📂 G06F40_295
👤 浙江工业大学
📅 2023-03-02
一种面向人机对话系统的命名实体识别方法,首先去除大语言模型的因果掩码以充分挖掘大语言模型的双向语义嵌入表征能力,使其更适用于精准的令牌分类任务;然后计算大语言模型语义嵌入的语义相似度并作为新的监督信息融合到大语言模型的语义嵌入中,以改善去掩码大语言模型在恢复双向注意力时标签监督能力不足的问题,从而使模型获得更好的语义嵌入来计算对应的实体分数;最后分别计算实体和类型分数来识别命名实体。本发明考虑了大语言模型的双向语义理解信息和语义相似度信息,提高了大语言模型在人机对话系统中的命名实体识别的准确度。
📄 2025100094878
📂 G06F40_295
👤 浙江工业大学
📅 2025-01-03
本发明公开一种中文命名实体识别方法及装置,包括如下步骤:根据待识别语句生成若干个平面格结构;其中,一个所述平面格结构中包括一个从所述待识别语句中分割得到的字符串;根据所述待识别语句生成所述待识别语句的词嵌入特征,并根据所述平面格结构中的所述字符串生成所述待识别语句的格特征;将所述格特征以及词嵌入特征输入至预设多元数据嵌入网络中,输出得到所述待识别语句的命名实体识别结果。本发明能够提高中文命名实体识别的效率和准确性。
📄 2024100983904
📂 G06F40_295
👤 广东工业大学
📅 2024-01-23
本发明公开了一种基于规则和词典的地铁设计规范中主体识别方法,步骤包括:1)利用词典文件构建名词哈希词典索引;2)将待处理《地铁设计规范》文本作为输入文本S1;3)对输入文本S1进行处理,去除中英文标点符号,生成句子集合S1’;4)对句子集合S1’进行逆向最大匹配算法处理,生成第一结果集S2;5)对句子集合S1’进行正向最大匹配算法处理,生成第二结果集S3;6)对第一结果集S2、第二结果集S3分别进行规则集匹配,生成地铁设计规范中名词的最终结果集S4,输出该最终结果集S4。本发明的方法,正确率高,便于应用。
📄 2019102088024
📂 G06F40_295
👤 西安理工大学
📅 2019-03-19