一种基于双知识图谱的新闻标题短文本分类方法,包含:对新闻标题短文本进行预处理,去除特殊字符;通过jieba分词工具提取新闻标题中的关键词,去除停用词;通过CNDBPedia外部知识库提供的API,将关键词链接到外部知识库获取实体集合;通过余弦相似度对实体集合进行消岐,得到候选实体集合;基于全局关键词共现信息,构建领域知识图,解决OOV问题;通过链接到外部知识库获取与实体相关的解释信息,丰富上下文语义信息;使用BERT获取原始新闻标题和实体链接的解释信息的字符级向量表示,并融合这两部分的向量表示,以弥补短文本信息不足的缺点;使用TextCNN来提取多个连续单词之间的N‑grams特征,捕捉深层次的语义信息;最后通过Softmax函数进行分类,得到最终的分类结果。
📄 2022106430313
📂 G06F16_353
👤 浙江工业大学
📅 2022-06-08