基于元路径的异构网络相似节点查询方法,包括:1.生成路径贪婪树;根据输入的源节点和短文本描述对贪婪树进行扩展;在扩展贪婪树过程中进行短文本的语义匹配;2.确定元路径序列;首先遍历贪婪树得到边类型序列,然后按照边类型序列确定节点类型序列;对生成的贪婪树进行遍历,从中分离出连接输入节点对的路径;3.计算元路径的重要度;首先根据影响元路径重要度的因素,定义元路径重要度的计算公式;借助贪婪树叶节点中的实例节点数量,计算元路径的重要度;4.结合多条元路径生成查询实例;符合元路径语义的实例节点对在元路径的语义上具有较高的相似性;因此要得到查询结果实例,只需要找到在每一条元路径语义上都有较高相似性的节点对。
📄 2020112608460
📂 G06F16_383
👤 浙江工业大学
📅 2020-11-12
一种基于数据挖掘的高维剧场数据降维可视化处理方法,属于剧场设备信息管理技术领域。它包括以下步骤:1、对高维剧场设备运行大数据进行降维处理;2、对异构数据的信息进行融合,并对融合的高维数据信息提取频繁序列模式;3、对剧场设备运行数据进行聚类处理;4、训练剧场设备运行数据向量,并根据词向量构成句子向量进行文本分类,将优化后的向量在二维语义空间进行语义可视化表示。本发明通过对海量剧场设备高维数据进行降维处理,将相似的文本收敛到可处理的量级,同时结合相关的半监督学习以及隔离森林算法对降维数据文件进行分类,设计数据分类模型算法并进行可视化展示,优化剧场设备运维数据的管理,实现高效准确的运维。
📄 202111616059X
📂 G06F16_2458
👤 浙江工业大学
📅 2021-12-27
本发明公开了一种基于社会化网络媒体数据的城市空气质量的评估方法,首先以社会化网络媒体数据为数据源,从其中的历史数据中提取与城市空气污染相关的数据,同时从空气质量监测点获取对应的监测数据,其中,城市空气污染相关数据的获取从用户的直接环境空气描述和污染事件描述两方面获取,并以环境污染事件类型、栅格化城区位置、社会化媒体属性因素为重构指引,重构成具有完整语义功能的多模态城市空气污染基本事件数据;然后将社会化网络媒体数据中提取的城市空气污染事件关联量化至城市空气质量;最后依据城市空气污染事件与空气质量的关联模型对城市空气质量进行评估。本发明解决了现有城市空气污染事件监测技术匮乏的问题。
📄 2018115259750
📂 G06Q10_063
👤 西安理工大学
📅 2018-12-13
本发明公开了一种基于扩散树的信息传播频繁模式挖掘方法,包括:S11.获取网络中的信息传播样本;S12.建立每条样本相对应的扩散树,得到每条样本的叶子节点,记录每条样本的叶子节点数量以及总节点数量,所述总节点数量为每条样本的样本规模;S13.计算每条样本的叶子节点数量占每条样本的总节点数量的比例L-metric;S14.统计每条样本的样本规模,计算每条样本规模相对应的L-metric值域的上下界,并根据L-metric值域构建信息传播模式划分规则,将信息传播模式划分为五种传播模式;S15.判断样本相对应的信息传播模式,得到每条样本相对应的信息传播模式;S16.统计信息传播样本中所有样本的信息传播模式,筛选出信息传播样本中频数最高的信息传播模式,并作为信息传播的频繁模式。
📄 2020106013231
📂 G06F16_953
👤 杭州电子科技大学
📅 2020-06-29
本发明公开了一种轨迹数据参数自适应的聚类方法,首先设置参数T和α,再根据时间维度取数据中的交集的部分作为将要处理的样本点,引入置信区间和分布散度为评价标准,保证了样本点数据的有效性和准确性,从而减少了处理数据量。之后,利用交集的数据引入一种点密度的度量的方法解决eps值设定问题,并根据滑动窗口的方式找出单位最大样本个数与单位最小样本个数,取其均值的操作来作为MinPts的设置值。本发明提供的轨迹数据参数自适应的聚类方法不仅解决了DBSCAN聚类算法本身只能处理小量数据的缺点,还能自适应的设定DBSCAN聚类算法中的eps和MinPts值,解决现有技术中只能根据经验人工设定,导致的聚类效果不理想的问题。
📄 2020113747278
📂 G06K9_62
👤 青岛科技大学
📅 2020-11-30
本发明公开了一种基于模糊列表缓冲区的高模糊效用项集挖掘方法、系统及计算机可读存储介质,方法包括:S1:初始化数据挖掘运行参数;S2:扫描事务数据库D并根据隶属度函数R计算单一项的模糊效用上界FUUB,并创建初始化列表I*;S3:将模糊效用上界值不小于最小阈值minUtil的单一模糊项存入初始化列表I*,并按照模糊效用上界值升序排序;S4:再次扫描数据库D,构建评估模糊效用共现结构EFuCS、模糊列表缓冲区FLBuf及其辅助的概要列表SL;S5:调用递归搜索子程序Search,传入参数;S6:输出模糊效用不低于最小阈值的所有高模糊效用项集HFUIs,完成数据挖掘。本发明降低高模糊效用项集挖掘算法运行时间、降低了内存消耗。
📄 2022110489678
📂 G06F16_2458
👤 广东工业大学
📅 2022-08-30
本发明涉及人工智能领域,公开了基于地址信息的黑名单识别方法、装置、设备及存储介质,用于将黑名单特征库划分为维度更小的黑名单特征分库,根据地址信息对应的黑名单特征分库对声纹特征进行对比,提高了声纹识别效率。本发明方法包括:获取目标用户的语音文件,语音文件包括音频和地址信息,地址信息包括进线电话区段或/和互联网协议地址IP信息;通过预置算法对音频进行特征提取,得到特征文件;判断特征文件是否有效;若特征文件无效,则生成提取失败的状态码;若特征文件有效,则根据进线电话区段或IP信息确定目标用户所属的目标地址范围,调用预置的黑名单模型和目标地址范围对特征文件进行相似度评分,并根据评分结果进行相应操作。
📄 2019108846302
📂 G10L17_08
👤 平安科技(深圳)有限公司
📅 2019-09-19
本发明提供了一种基于MD5三叉树和改进BIRCH算法的互联网论文数据自动抽取算法,该方法包括:从所需要抽取出互联网论文数据的网站中抓取数据,进行页面清洗与预处理,基于MD5三叉树进行站内静态噪音去除,基于节点间相似度进行页间动态噪音去除,融合DBSCAN密度聚类算法对样本点数据进行密集区域与稀疏区域的划分,融合密度因素构建ACF树,修正密集区域与稀疏区域生成ACF森林,基于改进BIRCH算法进行字段单元构建,将得到的字段单元通过字段匹配与页面内容提取方法对字段单元和字段进行匹配,从而得到所需要提取的网页数据。本发明噪音去除技术更优,字段单元构建与字段匹配更高效,能有效解决互联网论文数据自动抽取问题。
📄 2021107513681
📂 G06F16_951
👤 燕山大学
📅 2021-07-02
本发明涉及一种基于大数据的计算机数据挖掘方法,涉及数据挖掘技术领域。包括以下步骤:获取描述产品的文本信息;根据文本信息提取产品的多个属性;通过计算机获取描述该产品的待挖掘文本信息,形成待挖掘大数据;获取每个属性的依赖度;对每个属性的依赖度进行归一化获取归一化后的依赖度;获取每个属性的加权信息熵增益值;根据每个属性的加权信息熵增益值构建产品属性的决策树,根据决策树对待挖掘大数据进行提纯。本发明通过产品的属性以及收集到的对待挖掘大数据,利用加权信息熵增益值对待挖掘大数据进行提纯,再通过提纯后数据匹配来实现产品营销数据挖掘的精准化。
📄 202310113188X
📂 G06F40_205
👤 莱芜职业技术学院
📅 2023-02-15
已申报项目
本发明实施例公开了基于MapReduce和数组的频繁项集挖掘方法,将数据集转换为二维数组;将二维数组分解成若干二维子数组;将若干二维子数组分配至至少两个并行执行挖掘频繁项集任务的节点上;每一节点挖掘二维子数组对应的子频繁项集并保留每个节点的非频繁项集;统计汇总各子频繁项集并合并非频繁项集,得到数据组的频繁项集。本发明只扫描一次数据库,把数据库转化为二维数组,减少数据库的扫描,缩短I/O时间;同时创造性的通过水平划分的方法将数组分解为更多的子数组,使用Hadoop平台的MapReduce编程模型,采用并行处理二维子数组的方法,即在若干节点并行的对子数组进行频繁项集的挖掘,使得本发明具有较好的加速比和可扩展性,适合对大数据集挖掘频繁项集。
📄 2019104646650
📂 G06F16_2458
👤 禤世丽
📅 2019-05-30
本发明涉及一种利用移动通信数据挖掘进行线路规划的方法及系统,其方法包括,获取移动终端的当前时刻位置;从当前时刻位置对应的通信基站中获取移动终端的当前移动信令数据,并根据当前移动信令数据挖掘出移动终端在下一时刻即将连接的通信基站;根据移动终端在下一时刻即将连接的通信基站的位置和当前时刻位置为移动终端规划路线,得到预设规划路线;获取移动终端的即时时刻位置;根据即时时刻位置判断移动终端是否超出预设规划路线,若终端超出预设规划路线,则根据移动终端的即时时刻位置纠正预设规划路线。本发明的方法和系统基于实时定位数据和移动通信数据的挖掘实时的进行线路规划和纠正,可以动态的规划路线,满足实时需求。
📄 2020110388979
📂 G01C21_34
👤 贵州力创科技发展有限公司
📅 2020-09-28
本发明公开了基于改进Apriori算法和贝叶斯网络推理的数据可靠性评价方法,属于数据处理领域,评价方法首先采用了聚类和局部线性嵌入的学习算法,对输入的数据矩阵进行数据编码,然后通过各维度数据的相关关系,通过领域背景建立贝叶斯网络的有向无环图,并通过改进的Apriori算法得到条件概率表,得到多维数据局部和全局的可靠值。该算法是从数据结构本身和数据之间的关系来评价数据的可靠性,无需确定可靠性指标,数据分布情况,减少以往数据可靠性评价的主观性。该算法具有普适性,不仅适用于离散的数据值,对于区间数的可靠性同样适用。该算法准确性较高,有助于挖掘高维数据相同维度和不同维度之间的关联关系,得到各个数据的局部可靠性和全局可靠性。
📄 2020107280422
📂 G06F17_18
👤 广西大学
📅 2020-07-23