本发明公开了一种基于众包的分词标注质量评估系统,涉及标注质量评估领域,用于解决众包用户的主观理解能力存在差异导致提交的标注结果与对应类型存在偏差,使得质量识别不清的问题,采集文本分词置信度评分、文本对应类型与其余类型标准相似度、用户本轮标注数量差以及用户历史标注正确率差值建立数据分析模型,得到偏差评估系数并与偏差阈值比对,得到并统计比对结果,进一步确定标注结果错误提交的可能,标记为再划分标注结果,可划分类别相似度以及最相似标注结果对应的类别与最相似类别相似差异制定一组模糊规则进行模糊推理,确定再划分标注结果的划分方案,弥补了当前系统无法捕捉用户主观性差异的空白,提高标注效率。
📄 2024117070221
📂 G06F40_289
👤 龙岩学院
📅 2024-11-27
本发明公开了一种基于深度分层编码的智能语义匹配方法和装置,属于人工智能、自然语言处理技术领域,本发明要解决的技术问题为如何捕获更多的语义上下文信息和句子间的交互信息,以实现句子的智能语义匹配,采用的技术方案为:该方法是通过构建并训练由嵌入层、深度分层编码表示层、分层特征交互匹配层和预测层组成的句子匹配模型,实现对句子的深度分层编码表示,从而获取更多的语义上下文信息和句子间的交互信息,同时实现分层特征交互匹配机制,以达到对句子进行智能语义匹配的目标。该装置包括句子匹配知识库构建单元、训练数据集生成单元、句子匹配模型构建单元及句子匹配模型训练单元。
📄 2020101035056
📂 G06F40_289
👤 南方电网互联网服务有限公司
📅 2020-02-20
一种基于深度学习的文本语义提取方法,对于一个较长文本输入,经过系统模型,能够最大程度上还原文本语义。本发明结合了循环神经网络(RNN)以及自我注意力机制(Self‑Attention)优势,极大程度上改善了文本语义提取效果,节省了深度学习模型计算资源总成本,有效地降低了文本语义提取时间,使读者获得更优质的阅读体验。
📄 2021102955500
📂 G06F40_289
👤 浙江工业大学
📅 2021-03-19
一种基于多尺度特征融合的评价三元组抽取方法,包括:1)数据预处理:对语料库中的句子进行分词、去除停用词等操作;2)构造单词嵌入:利用预训练向量将句子中的单词转化为词嵌入;3)特征丰富:采用不同卷积核大小的CNN提取多尺度局部特征,并利用BiLSTM进一步捕捉句子当中的上下文信息,从而获得特征丰富的单词表示;4)构造词组级单词表示:设计了简单的词组感知表示选择机制,通过判断当前单词所属的词组的长度,选择合适的词组级单词表示;5)评价三元组抽取:构造对应的网格表示,进一步进行预测和解码,获得最终的评价三元组。本发明能够帮助更好地理解评论中的复杂语句,提高评价三元组的抽取准确率。
📄 2022103311986
📂 G06F40_289
👤 浙江工业大学
📅 2022-03-30
一种高校心理咨询信息服务系统,包括服务端、信息交互平台、学生端和咨询师端,所述信息交互平台分别与服务端、学生端和咨询师端连接,所述信息交互平台包括:预约模块、危机筛查模块、咨询师匹配模块、咨询师自选模块和咨询请求发送模块。本发明提供了一种高校心理咨询信息服务系统,提升了效率,简化了流程。
📄 2021102447151
📂 G06F40_289
👤 浙江工业大学
📅 2021-03-05
本发明提出了一种基于语义扩展和最大边缘相关的伪文本生成方法,包括以下步骤:S1,提取原文本的词和/或短语特征;S2,根据步骤S1中提取的特征通过相似度计算生成扩展词;S3,对步骤S2中的扩展词进行筛选候选词;S4,生成伪文本。本发明在较好地控制文本扩展的噪音的同时,实现了文本语义扩展。
📄 2019103698234
📂 G06F40_289
👤 重庆理工大学
📅 2019-05-06
本发明公开了一种基于数据分析的工程施工材料供应链管理系统,属于语义识别技术领域,本发明中通过采集工程施工材料供应链表单的图像,并对图像进行文字识别,从而得到文字信息,实现自动录入工程施工材料供应链表单,再通过实体提取子系统提取文字信息中的实体,再采用实体关系提取子系统提取文字信息中的实体关系,根据实体与实体关系构建知识图谱,从而实现对整体的供应链架构的呈现,再对知识图谱进行加密处理,从而防止第三方窃取,提高信息保密性。
📄 2023114718596
📂 G06F40_289
👤 成都航空职业技术学院
📅 2023-11-07
本发明涉及一种中文分词的消歧处理方法及系统,该方法及系统主要提供了一种简单的小矩阵中经过互斥迭代处理后实现分词功能的方案。该方案的消岐处理计算量不和分叉数目成指数关系,同时可以兼容错字错词,方便对接语法分析和上下文推理的结果,复合迭代后可以给出容错的符合语法分析和上下文推理倾向性要求的分词结果。
📄 202010339579X
📂 G06F40_289
👤 梁华智能科技(上海)有限公司
📅 2020-04-26
本发明公开了一种基于实体关系和依存Tree‑LSTM的联合事件抽取的方法。本发明步骤:1、对原始文本以及文本标注信息进行编码。2、将步骤1的结果输入双向LSTM。获取具有时序的前向和向后隐含状态向量。3、首先将输入句子解析成依存树形结构,然后将步骤1结果输入构建的依存Tree‑LSTM,获取树根节点隐含状态向量和每个时刻的隐含状态向量。4、获取保存实体关系句子信息特征向量。同时连接双向LSTM t的前向、向后隐含状态向量以及依存Tree‑LSTM t时刻的隐含状态向量5、进行触发词识别和分类;6、进行事件论元的识别和分类。
📄 2020101096011
📂 G06F40_289
👤 杭州电子科技大学
📅 2020-02-22
本发明涉及人工智能领域,具体是论文关键词提取系统,包括训练集、Jieba分词器、清洗模块、权重计算模型、频率计算模型和输出模型;论文关键词提取方法,包括如下步骤:S1、利用词语筛选模块获取训练集中论文正文的词语形成词语训练集;S2、通过Jieba分词器分词切割出论文中摘要、正文或总结中出现的所有词语训练集的词语,并通过清洗模块输出关键词语;S3、将步骤S2的结果输入权重计算模型进行训练;S4、将步骤S2的结果输入频率计算模型进行训练;S5、将步骤S3和S4的输出结果输入输出模型进行训练;S6、将目标论文输入权重计算模型、频率计算模型和输出模型,得到关键字;提出了将无监督的方法和有监督的方法相结合的方式对论文的关键字进行一个获取。
📄 2021100594118
📂 G06F40_289
👤 西华大学
📅 2021-01-15
本发明公开了一种基于分词工具共性信息和部分监督学习的分词方法。本发明步骤如下:(1)使用大量无标注数据和BiLSTM神经网络预训练一个具有多种分词工具共性信息的BiLSTM模块,获得训练好的BiLSTM神经网络模块;(2)使用少量标注数据训练初始分词模型,得到基于卷积神经网络和多种分词工具共性信息的初始分词模型M0。(3)利用M0对大量无标注数据集进行标注,得到大量伪标签数据。修改M0中的损失函数,利用少量标注数据和大量伪标签数据共同训练损失函数修改后的M0,得到基于多种分词工具共性信息和部分监督学习的中文分词模型M1。(4)迭代步骤(3)n次,得到最终分词模型Mn。本发明提高跨领域中文分词的准确率。
📄 2021103814711
📂 G06F40_289
👤 杭州电子科技大学
📅 2021-04-09
本发明公开了一种基于实体关系级别注意力机制的事件检测方法。本发明步骤:首先利用依存Tree‑LSTM获取实体关系级别表示和双向LSTM获取词汇级别表示,然后利用实体关系级别注意力和词汇级别注意力捕获对于当前候选触发词有重要影响的实体关系信息和句子语义信息。再针对候选触发词,对语义信息、实体关系信息、根节点词汇级别表示以及候选触发词的词汇级别表示进行拼接,然后进行触发词识别和分类。本发明不仅可以捕获较重要的句子语义信息,而且可以减少无关的实体关系特征对当前触发词的影响,从而提高了事件检测模型的性能。
📄 2021103817809
📂 G06F40_289
👤 杭州电子科技大学
📅 2021-04-09