咨询电话:13280638997
传真:0533-3110363
邮箱:kefu@shizifang.com
摘 要:本发明涉及一种基于Spark计算框架的大表连接优化方法,属于大数据计算领域。该方法包括:S1:利用谓词下推结合压缩布隆过滤器进行数据清洗,过滤掉大表中大量无效的数据,避免大量无用数据进入到shuffle阶段;S2:搭建基于Spark的数据倾斜检测模型,通过蓄水池采样算法统计出全局Map阶段Key值分布;S3:采用中间数据簇分割策略,对倾斜数据簇根据平均负载额定容量进行切割,使出现频次多的Key进入到其他处理快的分区中,使Key处于均匀分布状态。本发明能滤掉大量无用数据,改进数据倾斜情况,缩短连接查询时间,解决Spark集群节点内存溢出问题,提高用户满意度。
著 录 项:
专利/申请号: | CN202111220042.2 | 专利名称: | 一种基于Spark计算框架的大表连接优化方法 |
申请日: | 2021-10-20 | 申请/专利权人 | 重庆邮电大学 |
专利类型: | 发明 | 地址: | 重庆市南岸区黄桷垭崇文路2号 |
专利状态: | 已下证 查询审查信息 | 分类号: | G06F16/21搜分类 数据服务搜索 |
公开/公告日: | 2024-06-04 | 转让价格: | 面议 |
公开/公告号: | CN113868230B | 交易状态: | 等待洽谈 搜索相似专利 |
交易方 | 企业 | 个人 |
买家 | 营业执照副本复印件(需盖公章) | 身份证复印件(签字) |
专利转让委托书(需盖公章)一式两份 | 专利转让委托书(需签字)一式两份 | |
专利转让协议(需盖公章)一式两份 | 专利转让协议(需签字)一式两份 | |
卖家 | 营业执照副本复印件(需盖公章) | 身份证复印件(需申请人签字) |
解除代理委托书(需盖公章)一式两份(如专利通过代理机构申请) | 解除代理委托书(需签字)一式两份(如专利通过代理机构申请) | |
专利转让协议(需盖公章)一式两份 | 专利转让协议(需签字)一式两份 | |
专利请求书或手续合格通知书、授权通知书复印件 | 专利请求书或手续合格通知书、专利授权通知书复印件 | |
专利证原件(若授权下证) | 专利证原件(若授权下证) |
日期 | 法律信息 | 备注 |