本发明公开了一种面向无监督聚类的热点事件内部评价方法,该方法解决了目前基于聚类内部评价的电信热点事件发现方法存在的效率低下和准确率不高的问题。该方法是通过对电信投诉数据使用预训练模型进行预处理得到其特征空间,然后使用k‑Means聚类算法得到聚类结果,通过衡量热点事件簇的平均微分熵来判断聚类结果的紧密性,再通过衡量每个热点事件簇的簇心所构成空间的微分熵来判断聚类结果的分离性,最终筛选出更好的聚类结果的电信投诉热点事件的内部评估的方法。该方法通过使用微分熵来衡量聚类结果的紧密性和分离性,具有较低的时间复杂度,可以更加有效地评估聚类结果。进而可以提高电信热点事件发现的效率和准确率。
📄 2022108355815
📂 G06F16_355
👤 浙江工业大学
📅 2022-07-15
一种碳中和领域中文文本的实体关系联合抽取方法,针对碳中和的中文文本,利用Atom‑7B大模型得到文本句子的特征表示向量,然后通过PFN以联合抽取的方式得到文本中的实体关系三元组。以及提供一种碳中和领域中文文本的实体关系联合抽取系统,针对关系类型标注不平衡的训练数据,使用ChatGLM3接口对关系类型样本量少的文本句子进行数据增强;使用Atom‑7B大模型,通过在Embedding层添加噪声以及解码器层采用分层去掩码的策略,提取中文文本句子的特征表示向量;根据命名实体识别任务和关系抽取任务的难易程度,加入了动态损失函数,使PFN能关注更难的子任务。本发明提升了中文文本中抽取实体关系三元组的性能。
📄 2024105482184
📂 G06F16_355
👤 浙江工业大学
📅 2024-05-06
本发明属于金融数据处理技术领域,本发明公开了一种网络多源金融文本大数据处理方法,包括采集多源金融文本数据,进行语义级非结构化分析,剖离语义变动中的语言临界点与触发语义断点,构建金融波动语言触发因子矩阵,捕捉关键表达片段;接收触发因子矩阵,采用语言表达动因建模机制,对关键表达片段进行结构提取与构型映射,构建以语言表达动机为轴心的构型变换图,输出构型等价语义簇;基于构型等价语义簇,执行拓扑结构分析,识别语义裂变点与突变连接,判定语义断层,并在断层两侧执行概念重构,生成概念语义树;实现了对金融文本语义信息的深层次挖掘与结构性建模,具有重要的应用价值。
📄 2025110844866
📂 G06F16_355
👤 江西财经大学
📅 2025-08-04
本发明公开了基于预训练模型与决策树的增量式论文同名作者消歧方法,属于神经网络与作者同名消歧技术领域,所述方法利用人工定义特征与XLNet提取特征相结合的特征提取,首先使用人工定义特征提取论文中作者名称、机构等字段的信息,使用XLNet提取论文标题、摘要等字段的信息,之后利用XGBoost与提取出的特征来预测每篇论文应该归属的正确作者,对于该步未能分配出的论文进行凝聚式聚类的后处理,获取主聚类作为新的作者论文集,预测结果使用准确率、召回率以及F1值。本发明能够对论文的信息进行更加充分地提取,具有较强的可解释性,具有较强的鲁棒性,在处理噪点较多以及论文信息较为齐全的数据上有较优秀的表现。
📄 2022109066494
📂 G06F16_355
👤 燕山大学
📅 2022-07-29
本发明公开了一种基于多视图的新闻主题挖掘方法,属于文本分析和数据挖掘的技术领域。本发明首先构建出LT‑MSC模型,然后构造建流形正则化项、稀疏约束项和多样性正则化项,通过引入流形正则化项来挖掘多视图新闻数据中的几何信息,通过使用稀疏约束项来增强子空间表示矩阵的块对角结构,通过融入多样性正则化项来捕获新闻数据中不同视图之间的互补信息。最后,采用谱聚类方法对其进行聚类,相比于现有单视图和多视图挖掘方案,本发明的方法相比于已有的单视图和多视图的挖掘方法,在新闻主题挖掘的场景中能够获得最佳的聚类效果和识别性能,从而有效地提高了新闻主题的挖掘效率和精确率。
📄 2022108148393
📂 G06F16_355
👤 江南大学
📅 2022-06-20