本发明实施例公开了基于MapReduce和数组的频繁项集挖掘方法,将数据集转换为二维数组;将二维数组分解成若干二维子数组;将若干二维子数组分配至至少两个并行执行挖掘频繁项集任务的节点上;每一节点挖掘二维子数组对应的子频繁项集并保留每个节点的非频繁项集;统计汇总各子频繁项集并合并非频繁项集,得到数据组的频繁项集。本发明只扫描一次数据库,把数据库转化为二维数组,减少数据库的扫描,缩短I/O时间;同时创造性的通过水平划分的方法将数组分解为更多的子数组,使用Hadoop平台的MapReduce编程模型,采用并行处理二维子数组的方法,即在若干节点并行的对子数组进行频繁项集的挖掘,使得本发明具有较好的加速比和可扩展性,适合对大数据集挖掘频繁项集。
📄 2019104646650
📂 G06F16_2458
👤 禤世丽
📅 2019-05-30
一种MapReduce中备份任务推测执行策略的优化方案,采用指数平滑算法,结合集群中节点实时性能,对任务运行各阶段的时间分别计算,达到对任务运行的剩余时间进行准确预测的目的。解决了默认情况下,推测执行准确率低,由于错误地启动备份任务的问题。本方案极大程度的提高推测执行的正确率,节省了任务运行的时间,有效地节约了集群中有限的资源。
📄 2015107526173
📂 G06F9_50
👤 南京信息工程大学
📅 2015-11-06
本发明公开了一种基于MapReduce算法的并行识别、统计网页URL的方法,包括步骤:将捕获的网络数据流量以block(块,默认大小64M)为单位分散存储在HDFS(分布式文件系统)中;提取URL之前,重组HTTP请求;执行Job1,从重组后的HTTP请求中并行提取URL;执行Job2,从提取出的URL中识别出页面URL。本方法提供了一种稳定、可靠、均匀且低成本的并行识别、统计网页URL的方法。
📄 201410227643X
📂 H04L12_24
👤 重庆邮电大学
📅 2014-05-27
本发明公开了一种基于MapReduce算法的web数据采集方法、系统和存储介质,属于互联网数据处理技术领域,该web数据采集方法包括接收爬虫采集节点传送的网页数据经协议封装而成的数据包;解析所述数据包,对解析后的数据包进行Map操作构建哈希表;向文件导出节点发送所述哈希表,以便于文件导出节点对所述哈希表进行Reduce操作获得同一网站的汇总数据集合,并将获得的汇总数据集合导出到文件中。本发明能够借助分布式架构的微服务技术,对数据处理由不同的节点承担,并通过MapReduce算法的Map操作和Reduce操作对采集的数据进行处理,其数据结构灵活性强,数据采集效率高,采集方法部署简单和扩展性强。
📄 2020111070821
📂 G06F16_22
👤 南京信息职业技术学院
📅 2020-10-16
一种MapReduce并行化大数据文本分类方法,包括如下步骤:第一步:建立用于文本分类的基准测试数据集,进行数据预处理,包括分词、去停用词、词根还原;将该基准测试数据集随机划分为训练文本和测试文本,将所述基准测试数据集采用向量空间模型建立文本表示模型;第二步:根据上述文本表示模型采用CDMT对所述基准测试数据集进行特征选择;第三步:采用贝叶斯分类器对所述基准测试数据集进行训练学习,得到分类结果。本发明提供一种分类性能良好、区分度较高的MapReduce并行化大数据文本分类方法。
📄 201510297189X
📂 G06F17_30
👤 杭州亚龙智能科技有限公司
📅 2015-06-02