本发明涉及一种基于CNN和拼音特征的中文短文本相似度计算方法,包括:生成两个中文短文本的句子列表,然后生成句粒度拼音嵌入矩阵和句粒度词嵌入矩阵,将相同字的向量拼接并融合;计算两个文本中两个字的注意力分数,生成两个文本间每个字的注意力矩阵,将注意力矩阵与权重矩阵相乘,生成高粒度的句子特征映射;计算单个字的注意力权重并进行平均池化,生成两个中文短文本的句向量;将句向量输入逻辑回归层,计算得到两个中文短文本的相似度。本发明的方法将汉字的拼音信息结合到词分析中来学习更准确的表征,从而用于在中文短文本相似度匹配任务中综合考虑文字的读音,结合读音所表征的语义更精确判断相似度。
📄 202211166508X
📂 G06F40_194
👤 浙江工业大学
📅 2022-09-23
本发明提出了一种基于聚类预分析的多意图识别与语义槽填充联合建模方法:实时获取当前用户输入的多意图文本并进行预处理;基于聚类预分析构建多意图识别模型,用来识别用户的多个意图;基于Slot‑Gated关联门机制构建BiLSTM‑CRF语义槽填充模型,充分利用意图识别的结果指导语义槽的填充;对构建的多意图识别与语义槽填充的联合模型进行优化。本发明充分考虑了意图识别与语义槽填充之间的联系,提出了一种联合建模的方法,将两个语义分析子任务合并为一个语义分析任务,在提高多意图识别准确性的同时也提高语义槽填充的准确性,从而提高自然语言语义分析的质量;在实际应用中,可以有效提升人机对话中机器理解人类语言的能力,提高解决问题的能力和人机对话的体验。
📄 202110325369X
📂 G06F40_194
👤 南京邮电大学
📅 2021-03-26
本发明揭示了一种基于编辑距离的数据相似度检测方法,该方法包括以下步骤:步骤S1:输入字符串str1,str2;步骤S2:采用动态规划方法获得LD(str1,str2),LCS(str1,str2),LCCS(str1,str2);所述步骤S2包括以下步骤:S21:计算字符串间的编辑距离Ld;S22:计算字符串间的最长公共子序列Lcs;S23:计算字符串间的最长公共子串Lccs;步骤S3:联合Ld,Lcs,Lccs获得字符串相似度sim。该方法可用于大数据数据预处理等领域,利用本发明获得的字符串相似性检测结果更加准确,具有更好的精度和通用性。
📄 2018109261255
📂 G06F40_194
👤 南京邮电大学
📅 2018-08-14
本发明公开了在线Verilog代码自动判决系统的自动评分方法:系统访问标准答案库,复制对应的标准答案文件存放到临时文件夹;系统运行标准答案文件夹中的.do文件、.vt文件编译学生提交的Verilog代码文件,并进行库的加载;系统在linux下运行modelsim进行.vt仿真,根据学生提交的答案Verilog文件进行仿真,截取控制台输出至.result文件;系统根据.tm文件中所书写的时间范围,对比仿真结果.result文件和标准答案.cmp文件计算得到分数结果。本发明.do文件使用vsim指令编译学生答案.V文件和答案文件夹中的.vt文件,并根据.vt文件进行仿真。题目所需要输出的待测试模块,各个信号的激励以及抓取信号的指令$monitor都写在.vt文件中。从而架构其整个Verilog代码判决系统,大大降低了对于Verilog类题目判决的成本。
📄 2018110063931
📂 G06F40_194
👤 杭州电子科技大学
📅 2018-08-30
本申请涉及语音语义技术领域,公开了一种文本相关性检测方法、装置、设备及存储介质,所述方法包括:构成第一关键词向量和第二关键词向量,基于模糊均值算法对第一关键词向量和第二关键词向量进行聚类分析,得到主题向量;基于主题向量确定第一文本的第一主题和第二文本的第二主题,根据第一主题和第二主题构建主题图;基于预设的关键词匹配规则,对各个主题节点下的句子对构造第一匹配特征和第二匹配特征,将任意主题节点的第一匹配特征和第二匹配特征进行拼接,得到该主题节点的匹配特征;将匹配特征和领接矩阵输入图卷积模型进行分析,得到第一文本和第二文本的相关性。实现了文本间的全局匹配,提高了相关性匹配的灵活性和准确性。
📄 2021102763958
📂 G06F40_194
👤 平安科技(深圳)有限公司
📅 2021-03-15
本发明涉及一种面向网络新闻报道的大事记自动生成方法,采用机器学习的技术自动生成企业或部门在指定时间区间的大事记,数据可以是企业或部门现有的数据集,也可从网络中爬取与企业或部门相关的新闻报道。大事记的生成无需过多的人工干预,本发明不仅可以节省大量的人力和物力,同时数据驱动的方式可以使得大事记的生成效率高,且可以支持各种不同的时间粒度。
📄 2018103654532
📂 G06F40_194
👤 乐山师范学院
📅 2018-04-23
本申请涉及人工智能技术领域,揭示了一种基于人工智能的句子向量生成方法、装置、设备及介质,其中方法包括:将所述目标文本输入句子向量生成模型进行句子向量生成得到目标句子向量;采用获取的多个训练样本对预设的双塔模型进行无监督训练,所述双塔模型包括正模型和负模型,多个所述训练样本是由多个正样本和多个负样本组成,同一个所述正样本中的原始文本和对比文本是相同的文本,同一个所述负样本中的所述原始文本和所述对比文本是不相同的文本;将训练结束的所述双塔模型中的所述正模型作为所述句子向量生成模型。从而将模型训练的目标转移到句子向量的学习上,有利于训练出能获取到较为泛化的句子向量,提高了句子向量的准确性。
📄 2021115342976
📂 G06F40_194
👤 平安科技(深圳)有限公司
📅 2021-12-15
本发明提供了一种文章截断点的设定方法、装置以及计算机设备,其中方法包括:从所述文章中选取目标句子,并将所述目标句子末端至所述文章末端的每一个句子对应的目标向量进行加权和计算得到第二向量;将所述目标句子对应的第一向量和第二向量进行相似度计算,将计算得到的第一相似度值再进行sigmoid非线性映射至(0,1)区间,求出与1的线性距离;将所述线性距离与设定阈值比较,当所述线性距离高于设定阈值时,将所述目标句子的末尾位置作为初始截断点。本发明的有益效果:充分考虑了所有句子的信息,对文章的截断点作出更好的选取。
📄 2020109416003
📂 G06F40_194
👤 平安科技(深圳)有限公司
📅 2020-09-09
本申请涉及人工智能领域,应用于智慧医疗领域中,提供基于分词文本的电子病例查重方法、装置、计算机设备及存储介质,其中,方法包括:对比例文本进行分词处理后,分别提取文本特征、含义特征,并计算其在分词文本中的比率,然后整合比率计算文本相似度和含义相似度,在根据预设权重值整合不同的相似度得到最终相似度,并以预设值为界限判断待查重病例的相似病例。此外,本申请还涉及区块链技术,所述病例数据还存储于区块链中。采用本方法在相同症状对应的疾病相差过大时,仅仅根据医学特征进行病理查重也可找到的准确度高的相似病例。
📄 2020105923738
📂 G06F40_194
👤 平安科技(深圳)有限公司
📅 2020-06-24
本发明公开了一种基于RoBERTa知识蒸馏的相似度文本挖掘方法及系统,包括:将句子嵌入映射到概率分布空间以转化为概率分布,利用KL散度衡量句子嵌入之间的语义差异,调整嵌入向量的参数,减小相似句子对的KL散度的同时增加不相似句子的KL散度;基于KL散度优化后的损失函数进行反向传播,更新词向量参数,保存优化后的句子向量,生成词向量空间;对基于RoBERTa的知识蒸馏嵌入模型进行训练,将深层模型中的丰富语义信息迁移至轻量化的学生模型;采用训练完成的学生模型执行相似度文本挖掘任务。本发明能够更好地捕捉句子之间的细微语义差异,显著提升了语义相似度计算的精度和计算效率。
📄 2024117550411
📂 G06F40_194
👤 南京信息工程大学
📅 2024-12-03
本申请公开了基于大数据的人力资源数据管理方法,涉及人力资源管理,包括:从样本简历数据集中提取性别和年龄,作为偏见特征;对样本简历数据集进行语义编码,得到简历的语义编码特征向量集合;根据偏见特征,对简历的语义编码特征向量集合进行降维处理,得到降低偏见影响的特征向量集合S;对降低偏见影响的特征向量集合S进行聚类分析,得到多个代表不同特征组合的特征向量中心点;采用改进的哈希算法对待评估对象的简历进行语义编码,得到待评估对象的哈希值;计算待评估对象的哈希值与各特征向量中心点之间的相似度,根据相似度进行人力资源数据管理。针对人力资源数据管理中存在的性别和年龄偏见,本申请降低偏见对评估的影响。
📄 2025103656415
📂 G06F40_194
👤 安徽先驱科技服务有限公司
📅 2025-03-26
本发明涉及企业投标文档校验领域,公开了一种企业投标文档的智能校验方法,包括校验插件,校验插件包括录入校验规则和匹配全文的录入单元、对校验规则和匹配全文进行存储的索引数据库、对文字信息进行识别和处理的文字处理工具、对图片进行识别和处理的图片处理工具、对文档进行调用的调用单元、对文字信息进行校验的校验单元和对投标文档进行标记的输出单元;校验时校验单元通过校验规则、文字处理工具和图片处理工具对投标文档中与招标文档进行校验,检验完成后,输出单元对投标文档中与招标文档不一致的内容进行标记提示,便于文档编写人员进行修改,减轻文档人员的工作量,另一方面,还减少投标文件的错误率,提高企业的中标率。
📄 2019114211890
📂 G06F40_194
👤 无锡识凌科技有限公司
📅 2019-12-31