本发明公开了一种融合实体标签编码的小样本学习命名实体识别方法,包括:步骤(1)得到字符特征及其序列;步骤(2)得到词对特征矩阵、距离特征矩阵和区域特征矩阵,并拼接得到词对关系特征矩阵;步骤(3)得到每个实体标签的特征表示;步骤(4)计算每个词对关系特征与实体标签特征的点积相似度,得到转移概率矩阵;步骤(5)选取最优模型作为最终的预训练模型;步骤(6)载入预训练模型进行小样本学习,将句子输入到模型中,输出词对关系矩阵。该方法将分别对词对和实体标签进行编码,再将词对的表征和实体标签的表征进行匹配,得到词与词之间的实体关系。能够在低资源的情况下,有效地识别连续实体、重叠实体和不连续实体。
📄 2023101116697
📂 G06F40_295
👤 杭州电子科技大学
📅 2023-02-14
本发明公开了一种自然语言威胁情报抽取分析方法及系统,涉及自然语言技术领域,该系统包括依次执行的数据收集模块、数据预处理模块、威胁识别模块、特征提取模块、威胁分析模块以及情报生成模块;其技术要点为:对高优先级的威胁事件进行深度分析,综合各类参数以计算出威胁程度预估值,不仅能够快速反映出当前高优先级威胁事件的严重程度,还能够为后续预测下一时间周期内存在高密度威胁对应时间段提供优先的关注点,结合预警信号和关注机制,提高了安全团队对威胁事件的响应速度和能力,当发现潜在威胁时,安全团队能够迅速采取行动,并有效应对,从而降低了网络安全威胁事件所带来的影响和损失。
📄 2024110951740
📂 G06F40_295
👤 杭州字节方舟科技有限公司
📅 2024-08-12
本发明公开了一种基于预训练语言模型的本体修正方法与系统,属于语义网中本体修正技术领域。首先将待修正本体与可靠本体中的公理翻译成自然语言句子,基于预训练模型计算句子的向量,根据向量和打分函数为待修正本体R‑MIPS中的公理进行打分,通过分批处理不可满足概念计算出一个修正方案。本发明根据本体修正的特征定义了四个基于预训练语言模型的打分函数,提出了一个基于预训练语言模型分批处理不可满足概念的本体修正方法,用户可以对本体修正方法中的参数进行个性化配置,有助于满足用户多样化的需求。
📄 2024100358335
📂 G06F40_295
👤 南京邮电大学
📅 2024-01-10
一种从网络安全威胁情报联合抽取实体与关系的方法,涉及网络安全技术领域,利用多任务联合学习的模型架构,进行实体关系的联合抽取,能够有效的降低非联合抽取的方式误差传播问题,利用同一个向量编码器编码的统一向量表示,提取特定于不同任务特征,降低无用特征的噪声影响,提高了实体关系的解码速度。
📄 2023113023937
📂 G06F40_295
👤 山东省计算中心(国家超级计算济南中心), 齐鲁工业大学(山东省科学院)
📅 2023-10-10
本发明公开了一种面向中文文本的端到端中文实体关系联合抽取方法,包括优化中文预训练模型,对输入的中文文本进行编码处理,生成中文文本的文本表示;对中文文本的文本表示进行实体解码处理,得到实体BIO标注序列和上下文表示向量;采用上下文注意力机制确定上下文注意力向量;将上下文注意力向量与中文文本的文本表示拼接后进行关系编码处理,得到关系编码表示;采用双仿射注意力机制进行关系解码处理,得到实体关系抽取结果。本发明能够捕捉到词级别的交叉依赖信息,能有效提升模型准确性和鲁棒性。
📄 2023116292507
📂 G06F40_295
👤 成都信息工程大学
📅 2023-11-30
基于多层次自适应语义增强的中文医疗命名实体识别方法和装置,其方法包括:(1)将中文文本表示为T={C1、C2、···、CN},构建字符Ci特征,包括字符特征、边界特征、部首特征、拼音特征;(2)通过ERNIE‑Health预训练模型将字符级别Ci的特征转化为向量表示,包括字符特征向量ec、边界特征向量eb、部首特征向量er、拼音特征向量ep;(3)将四种字符级特征输入字符层自适应语义增强模块。使用卷积层对字符特征进行压缩,通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重,使用多层感知机进行解压缩,得到增强后的字符级特征;(4)将增强后的字符级特征输入句子层自适应语义增强模块,通过压缩和解压缩机制自适应学习句子中不同字符的贡献;(5)将经过多层次自适应语义增强模块的增强特征输入BiLSTM‑CRF模块进行标签预测。本发明能够更好地捕捉上下文中的语义差异,解决了现有方法在特征权重分配上的局限性,提升了CNER任务的整体性能。
📄 2024109829540
📂 G06F40_295
👤 浙江工业大学
📅 2024-07-22
一种基于预训练模型的特种设备中文命名实体识别方法,包括以下步骤:1)按照中文命名实体标注策略BIEOS对中文命名实体数据集进行标注,将实体类别分为四种类别;2)基于BERT预训练模型将中文句子转换为字向量表示;3)将字向量表示输入到biLSTM模型中,学习字向量序列双向编码,提取句子特征;4)采用CRF条件随机场学习上下文的标签概率,得到了每个汉字的所有可能的标签序列;5)最后输出汉字序列对应的实体类别。本发明通过无监督的方式对无标签语料中进行训练,能够有效解决小数据集、样本特征信息不足情况下中文命名实体提取的问题,用于构建特种设备领域的知识图谱。
📄 2021108934724
📂 G06F40_295
👤 浙江工业大学
📅 2021-08-04
一种基于生成式模型的医疗事件抽取方法,包括以下步骤:1)获取数据库中的电子病历文本数据,预先设定好需要抽取的实体类型和事件模板;2)在电子病历文本中,通过标注工具根据设定好的模板标注出病历中的实体和事件;3)利用transformer模型作为文本编码器,讲文本转换为向量表示;4)使用指针网络对实体进行标注4)使用池化层和线性层对事件类型进行分类;5)使用生成式transformer生成事件信息序列;6)提取事件信息序列中的论元角色,汇总事件信息。本发明以联合抽取算法对医疗电子病历中的非结构化数据进行提取,从而获得结构化的事件信息,对患者后续的病情分析提供有力的帮助。
📄 2022112075624
📂 G06F40_295
👤 浙江工业大学
📅 2022-09-30
一种面向机械化工领域的中文实体识别方法,包括:采取短文本预处理来提取有效内容;采用经过词典优化的中文分词器进行中文分词和词性标注;利用词频与类优先级函数所构成的权重函数用作权重计算同时基于规则式优化加权提取短文本目标关键词;搜索目标关键词上下文基于构建的有向概率状态转化图来进行关键词的上下文扩展从而获得目标实体。本发明还包括实施一种面向机械化工领域的中文实体识别方法的系统,包括依次连接的短文本预处理模块、中文分词和词性标注模块、权重计算和规则式优化加权模块、关键词搜索和扩展模块。本发明实现了高准确率的中文实体识别。
📄 2021105888781
📂 G06F40_295
👤 浙江工业大学
📅 2021-05-28
一种基于注意力状态转移模型的生物嵌套命名实体识别方法,包括:1.将包含DNA、RNA、蛋白质、细胞系和细胞这五种类型实体标签的生物领域文本分为训练数据和测试数据;2.根据注意力状态转移模型和语义遮罩模型的输入形式,将训练数据调整为满足模型输入的形式;3.训练注意力状态转移模型,用来学习词与词之间的关联性,通过模型输出的状态可以从文本中提取出候选实体并判断其类型;4.训练语义遮罩模型,用来判断候选实体及其类型是否符合上下文语义;5.将测试数据输入到注意力状态转移模型中,提取出候选实体,随后将提取的实体进行遮罩,送入到语义遮罩模型中进行筛选,最终确认出符合上下文的真实实体。
📄 2022106531615
📂 G06F40_295
👤 浙江工业大学
📅 2022-06-09
一种基于管道式方案的政务三元组抽取方法,包括以下步骤:1)获取某个问政平台在数据库中的社情民意描述文本,预先确定好实体的schema和关系的schema;2)将文本转化为向量放入BERT模型里进行实体起始边界的预测;3)预先设定好span的最大宽度,从预测出来的起始边界开始,逐一生成实体span,直到span的宽度等于设定的最大宽度;4)对生成的span进行实体类型的预测;5)将识别出的实体两两配对,构成若干条句子,每种实体类型用特殊的token字符表示;6)将文本中的实体替换为对应的token字符,得到新的句子;7)将新句子放到另外一个BERT模型里,得到句子向量;8)将句子向量里的头尾实体向量进行拼接,送入前馈神经网络,进行关系预测,从而完成文本的三元组抽取任务。
📄 2022105896759
📂 G06F40_295
👤 浙江工业大学
📅 2022-05-26
本发明公开一种跨语言知识图谱对齐与融合方法、装置及存储介质,所述方法包括:S1、构建两个不同语言的知识图谱网络中实体的一阶子图特征矩阵;S2、将实体的结构特征矩阵、属性特征矩阵和一阶子图特征矩阵输入到对齐模型中,获得两个不同语言的知识图谱网络中所有实体的结构特征、属性特征、子图特征三种嵌入向量矩阵,并对三种嵌入向量矩阵进行拼接;S3、计算待对齐实体与目标知识图谱网络中各实体之间嵌入向量的相似度;S4、根据相似度高低,对目标知识图谱网络中的实体进行排序,获得待对齐实体的候选等效实体;S5、根据候选等效实体对两个不同语言的知识图谱网络进行融合。本发明能够有效实现跨语言知识图谱的对齐和融合。
📄 2021102415004
📂 G06F40_295
👤 浙江工业大学
📅 2021-03-04