本发明属于互联网技术领域,特别涉及一种基于改进的PageRank的网络爬虫方法及系统,所述的方法包括:(1)爬取网页;(2)获取网页关系;(3)获取关系矩阵;(4)获取初始概率矩阵;(5)PageRank计算;获取到关系矩阵、初始概率矩阵以及阻尼系数后,计算网页PR值,循环迭代计算直至概率矩阵收敛终止迭代;通过本发明提供的方法,解决了网页爬虫中部分页面重用关键字以提高搜索排名的网页欺骗问题。本发明提供的网络爬虫系统,使用简单且具有易接受的存储、转换、计算形式,可高效快速地计算出每张网页的权重;同时包含较完善的爬虫程序,展示了爬虫在实际生活中的应用,包括图片和文件下载、百度百科检索、视频播放、网页关系可视化等功能。
📄 2020105073625
📂 G06F16_951
👤 合肥学院
📅 2020-06-05
本发明公开了一种基于Scrapy框架的数据采集方法、系统及存储介质,使用先后发送两次请求,第一次请求得到更新cookie、第二次请求携带更新的cookie得到数据的方式,结合延迟请求和先后发送两次请求,每次请求都使用上一次请求返回的更新cookie,请求后提取出返回的更新cookie,同时解决了ip限制和动态cookie的限制,解决了现有技术中难以通过爬虫爬取动态网页数据的问题,实现了克服动态网页的反爬机制、高效快速的获得所需数据的目的。
📄 2020107842627
📂 G06F16_951
👤 成都信息工程大学
📅 2020-08-06
一种网络爬虫方法,包括:将每隔预设时间段获取的多个代理IP存储于预先设置的代理IP池中;对所述代理IP池中的每个代理IP进行逐个验证,判断所获取的代理IP的有效性;将确定为有效的代理IP记录于所述代理IP池中的白名单中,将确定为无效的代理IP记录于所述代理IP池中的黑名单中;当侦测到当前的代理IP满足预先设置的代理替换条件时,从所述代理IP池中的所述白名单中选取出一个代理IP;及将选取出的代理IP作为新的代理IP进行数据爬取。本发明还提供一种终端及存储介质。本发明能够有效地解决同一代理IP在长时间、多次快速、大量爬取数据的过程中的IP受限问题。
📄 2018103499876
📂 H04L29_06
👤 平安科技(深圳)有限公司
📅 2018-04-18
本发明涉及爬虫调度方法技术领域,具体是基于组合预测法的主题词搜索爬虫调度方法及其系统,包括第一获取模块、数据预处理模块、向量空间模型、分簇模块、主题词提取模块、第二获取模块、真实热度指标权重计算模块、真实热度值计算模块、更新模块、预测热度值模块和CPU分配模块;包括如下步骤:步骤1、在数据源获取数据;步骤2、数据预处理;步骤3、获取主题数据,计算真实热度指标与指标权重;步骤4、计算真实热度值;步骤5、计算下一期每个主题的预测热度值;步骤6、提取新主题词并更新数据库;步骤7、分配CPU占用率上限,获取更多高热度主题的相关数据。实现了在资源有限条件下,优先跟踪高热度主题的目的。
📄 2021107012048
📂 G06F16_951
👤 西华大学
📅 2021-06-23
本发明公开了一种基于变异思想改进粒子群算法的主题爬虫系统及方法,涉及种子集选取、页面初始权值计算与算法改进三个部分。种子集选取模块主要是基于主题相关页面的点击率获取3种不同类型的种子页面,其中包括人工去重操作;页面初始权值计算模块包括网页文本预处理、关键词选择及权值计算三个步骤;算法改进模块是基于变异思想改进粒子群算法。本爬虫系统对主题爬虫寻优精度不高的问题提供了思路。
📄 2018114880414
📂 G06F16_951
👤 重庆邮电大学
📅 2018-12-06
本发明公开了一种基于代工模式的动态网页爬虫方法及系统,包括:接收业务信息,配置爬虫参数,业务评估,做准备工作;分配系统资源,发起多个独立进程的业务爬虫;采用模拟浏览器模式,对动态网页原始URL进行爬取,并返回目标静态数据内容的URL;审查URL的有效性和非重复性,并审查后的爬取任务,构造生产任务消息列表,发起多个线程的生产爬虫;采用自动化程序模式,对静态的URL页面进行爬取,并返回目标数据和附件文件;对返回内容处理并存储;导出数据。本发明分别构造了业务爬虫和生产爬虫,基于代工模式对动态网页和静态内容采取不同的爬取策略,最大限度地利用系统资源,实现对动态网页数据进行大规模、快速爬取。
📄 2020104887202
📂 G06F16_951
👤 重庆邮电大学
📅 2020-06-02
本专利公开发明了一种基于网页切分爬取的网络地址置信度评估方法,首先对已分类的网页链接进行切分,使用脚本爬取切分后的网页内容,采用卷积神经网络对网页内容进行分类,将切分后的网页分类准确率与原始网页分类准确率相减,得到网页分类差值集,再通过计算不同切分网页的权重,得到网络地址置信度算法公式,接着使用脚本爬取待分类网页链接,并计算切分的数量,将置信度大于一定阈值的网页链接放入已分类网页链接集中继续优化算法公式中的权重,最后使用网络地址置信度算法得出爬取网页的置信度。本发明方法有效的评估了在对网页进行切分爬取时,待爬取的网页与原始网页内容的信息差异,提高了网页爬取的效率。
📄 2018103972060
📂 G06F16_951
👤 淮阴工学院
📅 2018-04-28