本发明公开了一种基于众包的分词标注质量评估系统,涉及标注质量评估领域,用于解决众包用户的主观理解能力存在差异导致提交的标注结果与对应类型存在偏差,使得质量识别不清的问题,采集文本分词置信度评分、文本对应类型与其余类型标准相似度、用户本轮标注数量差以及用户历史标注正确率差值建立数据分析模型,得到偏差评估系数并与偏差阈值比对,得到并统计比对结果,进一步确定标注结果错误提交的可能,标记为再划分标注结果,可划分类别相似度以及最相似标注结果对应的类别与最相似类别相似差异制定一组模糊规则进行模糊推理,确定再划分标注结果的划分方案,弥补了当前系统无法捕捉用户主观性差异的空白,提高标注效率。
📄 2024117070221
📂 G06F40_289
👤 龙岩学院
📅 2024-11-27
本发明公开了一种基于Wikipedia概念向量的中文词语相关度计算方法和装置。方法包括:1.由Wikipedia Dump服务站点获取生语料,进行规范化处理,生成Wikipedia基础语料库;2.进行概念标注扩充,构建Wikipedia概念语料库;3.根据Wikipedia概念语料库,训练概念向量;4.对于待比较词语对,根据Wikipedia,获得其词语概念集合;5.计算概念集合的笛卡尔积中的每个概念对所对应的概念向量的相似度,取最大值作为待比较词语对的相关度。利用本发明,可以充分挖掘Wikipedia蕴含的词语概念信息,生成词语概念向量,更准确有效地计算词语相关度。
📄 2017107077366
📂 G06F17_30
👤 齐鲁工业大学
📅 2017-08-17
本发明公开了一种基于多种中文知识资源的中文词语语义关系识别方法和装置。方法包括:结合多种中文知识资源获取反义词集合,根据反义词集合判定词语间语义关系是否具有反义关系;使用多种中文知识资源提取部分词集合,根据部分词集合判定词语间是否具有整体部分关系;利用多种中文知识资源提取同义词集合,基于同义词集合判定词语间是否具有同义关系;借助于多种中文知识资源提取下位词集合,根据下位词集合判定词语间是否具有上下位关系。利用本发明,可以充分发挥多种中文知识资源的作用,更准确有效地识别中文词语语义关系。
📄 2017107074207
📂 G06F40_30
👤 南方电网互联网服务有限公司
📅 2017-08-17
本发明公开了一种基于语言预训练模型中的中文文本匹配方法,属于文本匹配技术领域,使用预训练语言模型,通过在下游分类任务上进行微调来作为序列分类器,将需要匹配的两句话通过分隔字符拼接起来后作为模型的输入,输出预测结果;在微调过程中,采用DC‑Match方法,以此提高预测准确度;在预测过程中,对于Encoder后的微调层,微调使用多层特征聚合分类模块替换普通分类层,能够明显提高中文匹配任务精确度,并且能与绝大多数中文语言预训练模型结合,与DC‑Match方法相比,在其基础上,使用了本文提出的注意力融合的方法、并对损失函数进行改进,提高了中文预训练模型的微调效果。
📄 2024103581471
📂 G06F16_35
👤 苏州岽睿微电子科技有限公司
📅 2024-03-27
本发明公开了一种面向中文文本的端到端中文实体关系联合抽取方法,包括优化中文预训练模型,对输入的中文文本进行编码处理,生成中文文本的文本表示;对中文文本的文本表示进行实体解码处理,得到实体BIO标注序列和上下文表示向量;采用上下文注意力机制确定上下文注意力向量;将上下文注意力向量与中文文本的文本表示拼接后进行关系编码处理,得到关系编码表示;采用双仿射注意力机制进行关系解码处理,得到实体关系抽取结果。本发明能够捕捉到词级别的交叉依赖信息,能有效提升模型准确性和鲁棒性。
📄 2023116292507
📂 G06F40_295
👤 成都信息工程大学
📅 2023-11-30
基于Potrace算法的中文矢量字库生成方法,其属于矢量字库生成的技术领域。该方法通过对Potrace算法中的拟合多边形和贝塞尔曲线片段进行优化和改进,对字体曲线轮廓进行高质量的布点,然后将中文字体图像进行矢量化,生成svg矢量文件。原有的Potrace算法生成的结果质量是,细节处字形轮廓上往往布满了冗余的控制点。本方法产生的字体是逼真的高质量结果,在视觉外观上显示出优于其他方法的优势。且轮廓的曲线线条光顺性高,可以精确捕捉整体特征以及局部细节,具有很高的精确度。同时本方法不仅减少了路径点的数量,而且保留了轮廓的关键风格细节。
📄 2020104971857
📂 G06F40_129
👤 大连瑞云字库科技有限公司
📅 2020-06-04
基于多层次自适应语义增强的中文医疗命名实体识别方法和装置,其方法包括:(1)将中文文本表示为T={C1、C2、···、CN},构建字符Ci特征,包括字符特征、边界特征、部首特征、拼音特征;(2)通过ERNIE‑Health预训练模型将字符级别Ci的特征转化为向量表示,包括字符特征向量ec、边界特征向量eb、部首特征向量er、拼音特征向量ep;(3)将四种字符级特征输入字符层自适应语义增强模块。使用卷积层对字符特征进行压缩,通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重,使用多层感知机进行解压缩,得到增强后的字符级特征;(4)将增强后的字符级特征输入句子层自适应语义增强模块,通过压缩和解压缩机制自适应学习句子中不同字符的贡献;(5)将经过多层次自适应语义增强模块的增强特征输入BiLSTM‑CRF模块进行标签预测。本发明能够更好地捕捉上下文中的语义差异,解决了现有方法在特征权重分配上的局限性,提升了CNER任务的整体性能。
📄 2024109829540
📂 G06F40_295
👤 浙江工业大学
📅 2024-07-22
一种基于预训练模型的特种设备中文命名实体识别方法,包括以下步骤:1)按照中文命名实体标注策略BIEOS对中文命名实体数据集进行标注,将实体类别分为四种类别;2)基于BERT预训练模型将中文句子转换为字向量表示;3)将字向量表示输入到biLSTM模型中,学习字向量序列双向编码,提取句子特征;4)采用CRF条件随机场学习上下文的标签概率,得到了每个汉字的所有可能的标签序列;5)最后输出汉字序列对应的实体类别。本发明通过无监督的方式对无标签语料中进行训练,能够有效解决小数据集、样本特征信息不足情况下中文命名实体提取的问题,用于构建特种设备领域的知识图谱。
📄 2021108934724
📂 G06F40_295
👤 浙江工业大学
📅 2021-08-04
本发明涉及一种基于CNN和拼音特征的中文短文本相似度计算方法,包括:生成两个中文短文本的句子列表,然后生成句粒度拼音嵌入矩阵和句粒度词嵌入矩阵,将相同字的向量拼接并融合;计算两个文本中两个字的注意力分数,生成两个文本间每个字的注意力矩阵,将注意力矩阵与权重矩阵相乘,生成高粒度的句子特征映射;计算单个字的注意力权重并进行平均池化,生成两个中文短文本的句向量;将句向量输入逻辑回归层,计算得到两个中文短文本的相似度。本发明的方法将汉字的拼音信息结合到词分析中来学习更准确的表征,从而用于在中文短文本相似度匹配任务中综合考虑文字的读音,结合读音所表征的语义更精确判断相似度。
📄 202211166508X
📂 G06F40_194
👤 浙江工业大学
📅 2022-09-23
一种基于部首特征和多层注意力机制的中文自动问答方法,包括以下步骤:步骤1、对数据集进行预处理;步骤2、得到词嵌入矩阵,通过随机初始化得到部首嵌入矩阵;步骤3、通过词嵌入和部首嵌入将词语分别转化为向量表示,在词语向量后追加语言学特征;步骤4、将文档向量序列问题向量序列分别输入至不同的双向RNN网络进行编码;步骤5、根据文档向量序列与问题向量,依次计算得到答案开始和结束边界的概率,生成目标概率分布,步骤6、使用数据集对模型训练N轮,通过计算损失并对参数进行更新,使用mini‑batch策略对模型进行训练,使用模型对给定的一个文档和与之相关的问题进行处理,预测得到答案。本发明提高了自动问答的准确率。
📄 2021113251582
📂 G06F16_3329
👤 浙江工业大学
📅 2021-11-10
一种基于知识图谱的中文医药问答系统,包括知识图谱构建模块、问题分类模块、数据库查询模块、答案整合模块和结果展示模块。一种基于知识图谱的中文医药问答方法,包括以下步骤:S1.获取用户的查询文本;S2.对用户的问句进行解析,获取主语实体、问题类别和问题类型;S3.根据解析结果以及预先构建的中文医药知识图谱进行相关查询,获取查询结果;S4.对医药查询结果进行整理,形成符合自然语言的对话答案以及可视化数据;S5.对文本答案以及可视化数据进行展示。本发明提高了问题类型划分的准确率以及答案精度,满足了用户医药咨询、食品指南、疾病辅助诊疗的需求,为用户提供了更加便捷高效的服务。
📄 2021107637044
📂 G06F16_332
👤 浙江工业大学
📅 2021-07-06
一种面向机械化工领域的中文实体识别方法,包括:采取短文本预处理来提取有效内容;采用经过词典优化的中文分词器进行中文分词和词性标注;利用词频与类优先级函数所构成的权重函数用作权重计算同时基于规则式优化加权提取短文本目标关键词;搜索目标关键词上下文基于构建的有向概率状态转化图来进行关键词的上下文扩展从而获得目标实体。本发明还包括实施一种面向机械化工领域的中文实体识别方法的系统,包括依次连接的短文本预处理模块、中文分词和词性标注模块、权重计算和规则式优化加权模块、关键词搜索和扩展模块。本发明实现了高准确率的中文实体识别。
📄 2021105888781
📂 G06F40_295
👤 浙江工业大学
📅 2021-05-28