本发明特别涉及一种通用的网页主题内容提取方法和系统,方法包括以下步骤:构建目标网页的DOM树,对DOM树的节点进行清理,并按照与正文内容的相关性对剩余节点进行属性标记;遍历DOM树,将DOM树的剩余节点分类缓存;根据各个类别中节点与所述可视标题节点的距离判断所述节点的内容是否为主题内容,并根据判断结果完成对目标网页主题内容的提取。本发明提供了一种更为优化的基于语义的网页信息抽取方法,其基于页面结构上存在的强关联关系,对DOM树的正文可视标题节点进行识别并对其他节点进行分类缓存,然后以DOM树中其他类别节点与正文可视标题节点的距离作为判定节点是否属于主题内容的重要依据,从而提高了网页信息抽取的精度和效率。
📄 2018105727260
📂 G06F16_951
👤 武汉酷犬数据科技有限公司
📅 2018-06-06
本发明公开了基于Storm的产品评论信息实时采集方法,该方法在基于Storm平台的采集系统进行,该方法包括产品抓取模块周期性的从网络中抓取数据,预处理模块根据产品Id初始化产品的属性参数,调度模块将数据封装成Tuple发射到Storm集群中,更新检测模块检查是否有新的评论产生,将其送到评论信息抓取模块,评论信息抓取模块检测到有评论信息更新的产品进行分布式抓取,访问间隔调整模块动态调整产品下一次采集的时间等。本发明将传统的网络爬虫与开源分布式流处理框架Storm相结合,使得传统的网络爬虫能够运行在流处理平台上,在实时信息采集性能上得到极大提高,具有很强的实际价值和现实意义。
📄 2016103130913
📂 G06F16_951
👤 广东工业大学
📅 2016-05-11
本发明涉及数据处理及分析技术领域,公开了一种求职与租房的数据处理方法。包括以下过程:通过网络爬虫获取目标求职网站和租房网站的原始的房屋数据和工作数据;将原始的房屋数据处理得到基础设施评分和光照时间,并与通过审核的招租信息结合获得精选房屋数据;原始的工作数据进行筛选,并与通过审核的职位信息结合获取精选工作数据;将精选房屋数据和精选工作数据存入数据库,同时用户终端普通用户上传求职信息和租房信息到数据库。本发明的技术方案将地图功能、工作招聘求职信息、租房信息三者相结合,能有效的将三者的精选数据进行综合,获得的求职与租房的数据处理系统具有高质量的数据信息。本发明还公开了一种求职与租房的数据处理系统。
📄 2018110820221
📂 G06F16_951
👤 四川理工学院
📅 2018-09-17
一种基于学术网络的作者贡献量化与分配方法和装置,其方法包括:S1:撰写网络爬虫程序,并爬集论文数据、论文之间的引用关系数据以及论文作者数据;S2:构建需要计算作者贡献得分点的论文p0的引文网络,网络的节点为科学论文,连边为论文间的引用关系;该网络结构分为两层,第一层为论文p0的参考文献层,第二层为参考文献层的引文,其中包括论文p0以及其他引文;S3:计算论文p0中的每个作者在引文层的每篇论文中的贡献得分,构建论文p0作者贡献矩阵A;S4:计算论文p0与引文层中包括p0在内的每篇论文共同引用参考文献层论文的次数,构建共同引用强度矩阵S;S5:将贡献矩阵与共同引用强度矩阵相乘,得到论文p0作者的最终贡献得分C。
📄 2025101002341
📂 G06F16_951
👤 浙江工业大学
📅 2025-01-22
一种基于网络表征学习和邻居合力的微博用户社区发现方法,根据现有微博数据,建立微博网络,基于网络表征学习方法把微博网络转化为欧氏空间向量;计算微博网络中节点的质量以及节点的邻居合力;通过邻居合力计算微博网络中节点的邻居合力中心性,设定为初始社区的中心节点,其余节点设定为普通节点;将普通节点归属到与其最近的中心节点所代表的社区形成微博网络的初始社区结构;根据模块度最优的原则合并初始社区,形成最终的微博网络社区结构。本发明综合考虑网络节点的邻居合力和节点间的距离,提高了社区发现的速度和精度。
📄 2019108020171
📂 G06F16_951
👤 浙江工业大学
📅 2019-08-28
本发明涉及一种动态检测失效流量的网络爬虫方法,包括以下步骤,首先通过分析网络请求信息构建动态检测失效流量模型的数据集,然后设计出动态检测失效流量的方法,接着对URL队列中的信息进行读取并且对Cookie等信息进行封装后发送请求,提取返回数据信息,并对返回数据信息进行失效流量检测,最后对重复返回数据信息进行处理,如是有效数据则持久化存储。本发明弥补了现有聚焦爬虫和增量爬虫在Cookie失效问题的处理上和数据重复处理上的不足之处,降低了爬取数据的失效和重复概率,对爬虫系统的设计提供了可借鉴的方案,提高了爬虫系统的整体性能。
📄 2021100864723
📂 G06F16_951
👤 浙江工业大学
📅 2021-01-22
一种全网爱国舆情事件识别及流行度跟踪方法,首先使用网络爬虫系统爬取全网热门新闻网站和社交媒体,通过BERT模型判断话题是否与爱国主义相关,并判断发文者对国家的态度,分别计算话题在不同网站和平台的流行度,然后将相同话题的内容聚合在一起,得出此话题在全网的流行度,如果事件流行度超过阈值或者暴增,系统通过LOF算法来识别突发热点事件,并对事件持续跟踪;最后,通过收集事件相关的网络活动,在事件平息之后给出相应的事件报告。本发明可以有效识别和跟踪网络上有关爱国主义的舆情。
📄 2019112382283
📂 G06F16_951
👤 浙江工业大学
📅 2019-12-06
本发明属于互联网技术领域,特别涉及一种基于改进的PageRank的网络爬虫方法及系统,所述的方法包括:(1)爬取网页;(2)获取网页关系;(3)获取关系矩阵;(4)获取初始概率矩阵;(5)PageRank计算;获取到关系矩阵、初始概率矩阵以及阻尼系数后,计算网页PR值,循环迭代计算直至概率矩阵收敛终止迭代;通过本发明提供的方法,解决了网页爬虫中部分页面重用关键字以提高搜索排名的网页欺骗问题。本发明提供的网络爬虫系统,使用简单且具有易接受的存储、转换、计算形式,可高效快速地计算出每张网页的权重;同时包含较完善的爬虫程序,展示了爬虫在实际生活中的应用,包括图片和文件下载、百度百科检索、视频播放、网页关系可视化等功能。
📄 2020105073625
📂 G06F16_951
👤 合肥学院
📅 2020-06-05
本发明公开了一种面向视频常规评论的情感不稳定用户检测方法,包括以下步骤:步骤1,从网站中收集原始数据,筛选出常规评论文本、用户信息与评论时间。步骤2,实现数据的格式化处理,组成常规评论集合。步骤3,汇总网站预置表情包并构建表情对照表,测量常规评论的情感倾向,实现常规评论的情感分析。步骤4,构建时序评论交互网络。步骤5,根据时序的用户间关系,判断用户是否符合情感不稳定用户的定义,从而检测出情感不稳定的用户。本发明的优点是:在舆情发展初期根据视频中常规评论内容,发现情感易变用户,会为舆情的控制和引导带来许多方便,从而产生良好的社会效益和经济价值。
📄 2020110816581
📂 G06F16_951
👤 西华大学
📅 2020-10-12
本发明公开了一种基于Scrapy框架的数据采集方法、系统及存储介质,使用先后发送两次请求,第一次请求得到更新cookie、第二次请求携带更新的cookie得到数据的方式,结合延迟请求和先后发送两次请求,每次请求都使用上一次请求返回的更新cookie,请求后提取出返回的更新cookie,同时解决了ip限制和动态cookie的限制,解决了现有技术中难以通过爬虫爬取动态网页数据的问题,实现了克服动态网页的反爬机制、高效快速的获得所需数据的目的。
📄 2020107842627
📂 G06F16_951
👤 成都信息工程大学
📅 2020-08-06
本发明实施例公开了一种基于网页的图像获取方法及装置,确定所抓取的网页信息中的每张图像的位置,针对每个位置,识别与该位置相关联的正文内容,并根据正文内容,确定该位置处的图像的第二图像主题,如果该位置处的图像的第二图像主题与用户所要获取图像的图像主题(第一图像主题)的关联度满足预设规则,则获取该位置处的图像;第一方面,本方案中不是仅将网页信息与第一图像主题进行关联,而是将网页信息中各张图像的第二图像主题与第一图像主题进行关联,仅获取与第一图像主题相关联的图像,提高了获取图像的准确性;第二方面,根据网页信息中与图像所在位置相关联的正文内容,确定图像的第二图像主题,提高了确定图像主题的准确性。
📄 2017107447310
📂 G06F16_951
👤 杭州海康威视数字技术股份有限公司
📅 2017-08-25
本申请实施例公开了一种统一资源定位符URL去重方法及装置,其中方法包括:对原始URL进行第一泛化处理,并判断该第一URL是否属于第一重复集合,若该第一URL不属于该第一重复集合,则对该第一URL进行第一减参处理得到第二URL,并判断该第二URL是否属于第二重复集合,若该第二URL属于第二重复集合,检测该第二URL在该第二重复集合中的第一出现次数是否小于或等于第一阈值,若是,则下载该原始URL,若否,则丢弃该原始URL,即不下载。采用本申请实施例,可以减少下载到重复URL的数量,从而可以提高WEB漏洞扫描系统的扫描效率。
📄 2018107353055
📂 G06F16_951
👤 平安科技(深圳)有限公司
📅 2018-07-05