一种基于Mashup服务功能特征表示与密度峰值检测的聚类方法,包括以下步骤:第一步、对所有需要特征表示的Mashup服务数据进行预处理;第二步、进行功能名词提取操作;第三步、对每个功能名词的语义权重进行语义关联计算;第四步、结合TF‑IDF算法与Word2Vec模型,进行Mashup语义特征向量的表示;第五步、对于所有参与聚类的Mashup语义特征向量,进行密度信息的计算;第六步、从所有Mashup语义特征向量中,筛选出聚类中心的候选点;第七步、进一步筛选出最为合适的K个初始聚类中心,进行K‑means聚类。本发明能够有效表示Mashup服务的功能特征,增强Mashup服务的聚类性能。
📄 2020101273232
📂 G06F16_33
👤 浙江工业大学
📅 2020-02-28
一种基于密度峰和引力影响的半监督游客画像数据聚类方法,通过密度峰算法计算游客画像数据各点的密度值和距离值,寻找到所有可能的聚类中心点;利用提供的游客画像种子点计算与可能的聚类中心点间的距离,投票筛选出精确的聚类中心点,并且利用种子标签信息给对应的聚类中心点贴上聚类标签;从全部的种子数据中随机选取一定比例的种子数据子集,通过引用万有引力定律的理念,计算种子数据子集与各个无标签数据点间的引力影响,从而对所有无标签数据进行聚类并为无标签数据贴上相应的簇标签;通过多次随机选取种子数据子集给无标签数据贴上相应的决策簇标签,投票选出最终各个无标签数据的簇标签信息。本发明聚类效果较好、精确度较高。
📄 2018115159428
📂 G06K9_62
👤 浙江工业大学
📅 2018-12-12
一种面向变尺度数据密度空间基于区域生长及竞争的游客去向数据分级聚类方法,与以往方法不同本发明采用分级聚类的思想,将聚类过程分为三级。第一级聚类基于欧式距离用距离阈值R1,将对象划分为一定数目的小类,来简化算法降低复杂度。然后第二级用空间数据区域生长的方法,用已获得的簇心作为生长种子,在生长准则下进行生长,直到达到停止条件,来解决变尺度数据密度聚类的问题。最后第三级基于竞争的思想与密度相似性原则,计算簇心之间的权重,采取适当的规则进行簇的合并,来解决非凸状数据聚类的问题。本发明方法对比其他聚类算法能在降低复杂度的基础上最大的提高聚类的准确度,在处理海量数据时有明显的优势,更能满足实际工程应用的需要。
📄 2019108120625
📂 G06K9_62
👤 浙江工业大学
📅 2019-08-30
本发明涉及数据聚类集成技术领域,公开了一种多视图金融数据聚类集成方法及装置,方法包括:采用K‑Means聚类方法处理金融多视图数据,生成系综池,再采用模糊隶属度函数生成二元划分矩阵;通过二元划分矩阵学习标签空间全局结构,得到初始协相关矩阵,采用具有Frobenius范数的LSR模型进行优化,得到标签协相关矩阵;学习每个视图的子空间投影矩阵、亲和度矩阵和样本邻接矩阵,从特征空间优化协相关矩阵,得到特征协相关矩阵;结合标签协相关矩阵和特征协相关矩阵得到优化后的协相关矩阵;优化后的协相关矩阵投影到约束空间中,用于构建无向图;利用图切割算法对所述无向图进行划分,获得金融多视图数据的最终聚类集成结果。
📄 2025107701814
📂 G06F18_23213
👤 华侨大学
📅 2025-06-10
本发明公开了一种基于仿射不变度量的旋转机械采样数据聚类方法,通过对数据时间序列进行建模得到时间序列模型,计算时间序列模型中两个时间序列片段的相似性度量对数据时间序列进行建模得到时间序列模型;计算时间序列模型中两个时间序列片段的相似性度量;构建相似度量中位数模型;通过相似度量中位数模型对数据时间序列进行聚类;能够在有效地将通过旋转机械传感器采集的石化机组的数据时间序列,对数据时间序列的仿射变换具有不变性,不会因为时间序列的平移或伸缩而改变度量大小,称为形态相似度量,具有良好容错能力,不会因为野值数据而导致分类错误,其聚类结果的聚类簇具有较好的鲁棒性,本发明属于数据分析技术领域。
📄 2020106672351
📂 G06F18_213
👤 济南小竹科技有限公司
📅 2020-07-13
本发明公开了一种应用于图结构数据聚类的局部信息保留深度对比聚类方法,属于人工智能技术领域。包括以下模块:基于重构方式训练的可学习数据增强模块、高置信度的采样模块、图对比聚类模块。与现有技术相比,本发明针对图结构数据设计了一种保留局部信息的图数据增强方法,通过两个非共享参数的图自编码器来生成学习不同语义信息的嵌入,之后用它们来进行边采样,生成两个视图用来传入到图对比模型。同时,本发明针对正负样本的采集设计了一套筛选机制,以确保同类的样本嵌入具备更高的语义相似度;相比传统的聚类算法,能充分的发掘图的结构信息和特征信息,具有更高的聚类精度。
📄 2024101195922
📂 G06V10_762
👤 镇江大江智能科技有限公司
📅 2024-01-29
本发明公开了一种基于分布密度的多源大气数据聚类方法,首先,构建一个M维数据组成的数据量为N的数据集DS,并判断数据集DS的聚类趋势;其次,生成数据集的距离矩阵DM的全邻域分布密度矩阵DDM;然后,以分布密度阈值ddth为参数,划分出全邻域分布密度矩阵DDM的密度峰值与离散点;最后,截取全体数据的边矩阵E将部分离散点合并入密度峰值,得到聚类结果。本发明仅使用分布密度阈值这一单一参数实现控制聚类结果,并确保可聚类任意分布形状、分布均匀性的数据;且能自动分离出噪点。
📄 2020103146053
📂 G06F18_23
👤 南京信息工程大学
📅 2020-04-21
本发明涉及一种基于堆栈降噪自编码的电网暂态故障数据聚类清洗方法,属于电力技术领域。该方法包括以下步骤:S1:基于堆栈降噪自编码的故障数据特征提取阶段;S2:基于主成分分析的故障特征降维阶段;S3:基于密度峰快速搜寻聚类的故障数清洗阶段。本发明对故障数据进行聚类清洗和代表数据点提取推送,能有效的从海量的故障数据中提取出真实准确的故障信息,为智能告警提供优质的故障信息,同时解决了配电告警平台频繁刷屏的根本原因。
📄 2020114866895
📂 G06K9_62
👤 重庆邮电大学
📅 2020-12-16