一种基于学术网络的作者贡献量化与分配方法和装置,其方法包括:S1:撰写网络爬虫程序,并爬集论文数据、论文之间的引用关系数据以及论文作者数据;S2:构建需要计算作者贡献得分点的论文p0的引文网络,网络的节点为科学论文,连边为论文间的引用关系;该网络结构分为两层,第一层为论文p0的参考文献层,第二层为参考文献层的引文,其中包括论文p0以及其他引文;S3:计算论文p0中的每个作者在引文层的每篇论文中的贡献得分,构建论文p0作者贡献矩阵A;S4:计算论文p0与引文层中包括p0在内的每篇论文共同引用参考文献层论文的次数,构建共同引用强度矩阵S;S5:将贡献矩阵与共同引用强度矩阵相乘,得到论文p0作者的最终贡献得分C。
📄 2025101002341
📂 G06F16_951
👤 浙江工业大学
📅 2025-01-22
一种基于网络表征学习和邻居合力的微博用户社区发现方法,根据现有微博数据,建立微博网络,基于网络表征学习方法把微博网络转化为欧氏空间向量;计算微博网络中节点的质量以及节点的邻居合力;通过邻居合力计算微博网络中节点的邻居合力中心性,设定为初始社区的中心节点,其余节点设定为普通节点;将普通节点归属到与其最近的中心节点所代表的社区形成微博网络的初始社区结构;根据模块度最优的原则合并初始社区,形成最终的微博网络社区结构。本发明综合考虑网络节点的邻居合力和节点间的距离,提高了社区发现的速度和精度。
📄 2019108020171
📂 G06F16_951
👤 浙江工业大学
📅 2019-08-28
本发明涉及一种动态检测失效流量的网络爬虫方法,包括以下步骤,首先通过分析网络请求信息构建动态检测失效流量模型的数据集,然后设计出动态检测失效流量的方法,接着对URL队列中的信息进行读取并且对Cookie等信息进行封装后发送请求,提取返回数据信息,并对返回数据信息进行失效流量检测,最后对重复返回数据信息进行处理,如是有效数据则持久化存储。本发明弥补了现有聚焦爬虫和增量爬虫在Cookie失效问题的处理上和数据重复处理上的不足之处,降低了爬取数据的失效和重复概率,对爬虫系统的设计提供了可借鉴的方案,提高了爬虫系统的整体性能。
📄 2021100864723
📂 G06F16_951
👤 浙江工业大学
📅 2021-01-22
一种全网爱国舆情事件识别及流行度跟踪方法,首先使用网络爬虫系统爬取全网热门新闻网站和社交媒体,通过BERT模型判断话题是否与爱国主义相关,并判断发文者对国家的态度,分别计算话题在不同网站和平台的流行度,然后将相同话题的内容聚合在一起,得出此话题在全网的流行度,如果事件流行度超过阈值或者暴增,系统通过LOF算法来识别突发热点事件,并对事件持续跟踪;最后,通过收集事件相关的网络活动,在事件平息之后给出相应的事件报告。本发明可以有效识别和跟踪网络上有关爱国主义的舆情。
📄 2019112382283
📂 G06F16_951
👤 浙江工业大学
📅 2019-12-06
本发明属于互联网技术领域,特别涉及一种基于改进的PageRank的网络爬虫方法及系统,所述的方法包括:(1)爬取网页;(2)获取网页关系;(3)获取关系矩阵;(4)获取初始概率矩阵;(5)PageRank计算;获取到关系矩阵、初始概率矩阵以及阻尼系数后,计算网页PR值,循环迭代计算直至概率矩阵收敛终止迭代;通过本发明提供的方法,解决了网页爬虫中部分页面重用关键字以提高搜索排名的网页欺骗问题。本发明提供的网络爬虫系统,使用简单且具有易接受的存储、转换、计算形式,可高效快速地计算出每张网页的权重;同时包含较完善的爬虫程序,展示了爬虫在实际生活中的应用,包括图片和文件下载、百度百科检索、视频播放、网页关系可视化等功能。
📄 2020105073625
📂 G06F16_951
👤 合肥学院
📅 2020-06-05
本发明公开了一种面向视频常规评论的情感不稳定用户检测方法,包括以下步骤:步骤1,从网站中收集原始数据,筛选出常规评论文本、用户信息与评论时间。步骤2,实现数据的格式化处理,组成常规评论集合。步骤3,汇总网站预置表情包并构建表情对照表,测量常规评论的情感倾向,实现常规评论的情感分析。步骤4,构建时序评论交互网络。步骤5,根据时序的用户间关系,判断用户是否符合情感不稳定用户的定义,从而检测出情感不稳定的用户。本发明的优点是:在舆情发展初期根据视频中常规评论内容,发现情感易变用户,会为舆情的控制和引导带来许多方便,从而产生良好的社会效益和经济价值。
📄 2020110816581
📂 G06F16_951
👤 西华大学
📅 2020-10-12
本发明公开了一种基于Scrapy框架的数据采集方法、系统及存储介质,使用先后发送两次请求,第一次请求得到更新cookie、第二次请求携带更新的cookie得到数据的方式,结合延迟请求和先后发送两次请求,每次请求都使用上一次请求返回的更新cookie,请求后提取出返回的更新cookie,同时解决了ip限制和动态cookie的限制,解决了现有技术中难以通过爬虫爬取动态网页数据的问题,实现了克服动态网页的反爬机制、高效快速的获得所需数据的目的。
📄 2020107842627
📂 G06F16_951
👤 成都信息工程大学
📅 2020-08-06
本发明实施例公开了一种基于网页的图像获取方法及装置,确定所抓取的网页信息中的每张图像的位置,针对每个位置,识别与该位置相关联的正文内容,并根据正文内容,确定该位置处的图像的第二图像主题,如果该位置处的图像的第二图像主题与用户所要获取图像的图像主题(第一图像主题)的关联度满足预设规则,则获取该位置处的图像;第一方面,本方案中不是仅将网页信息与第一图像主题进行关联,而是将网页信息中各张图像的第二图像主题与第一图像主题进行关联,仅获取与第一图像主题相关联的图像,提高了获取图像的准确性;第二方面,根据网页信息中与图像所在位置相关联的正文内容,确定图像的第二图像主题,提高了确定图像主题的准确性。
📄 2017107447310
📂 G06F16_951
👤 杭州海康威视数字技术股份有限公司
📅 2017-08-25
本申请实施例公开了一种统一资源定位符URL去重方法及装置,其中方法包括:对原始URL进行第一泛化处理,并判断该第一URL是否属于第一重复集合,若该第一URL不属于该第一重复集合,则对该第一URL进行第一减参处理得到第二URL,并判断该第二URL是否属于第二重复集合,若该第二URL属于第二重复集合,检测该第二URL在该第二重复集合中的第一出现次数是否小于或等于第一阈值,若是,则下载该原始URL,若否,则丢弃该原始URL,即不下载。采用本申请实施例,可以减少下载到重复URL的数量,从而可以提高WEB漏洞扫描系统的扫描效率。
📄 2018107353055
📂 G06F16_951
👤 平安科技(深圳)有限公司
📅 2018-07-05
一种动态图表类页面数据爬取方法,包括:采用自动化测试工具启动浏览器,输入待爬取数据的网站的链接;从待爬取数据的网站中爬取与用户输入的爬取关键词相关的页面信息;对爬取到的页面进行渲染并解析;通过自动化测试工具对解析后的页面进行截图得到截图图片并保存截图图片;根据预先训练的图片识别模型对截图图片进行识别,得到截图图片中的内容;判断待爬取数据的网站及对应爬取关键词的页面是否已遍历完;当确定都已被遍历过,则结束流程;否则,继续执行上述过程。本发明还提供一种动态图表类页面数据爬取装置、终端及存储介质。本发明能够自动爬取动态加载的图表类数据且能识别出图片中的内容。
📄 2018103499753
📂 G06F16_951
👤 平安科技(深圳)有限公司
📅 2018-04-18
本发明实施例提供一种分页的实现方法、装置、计算机设备及存储介质,属于计算机技术领域。上述分页的实现方法包括接收到输入的数据查询的关键字时,将该关键字发送给服务器;接收该服务器发送的数据,该数据包括该服务器根据该关键字查询到的数据,当该数据的大小在应用端的负荷范围之内时,该数据包括该服务器查询到的全部数据;根据接收的排序规则,对接收到的全部数据按照该排序规则进行排序;获取在一个页面中显示的数据的预设的数量;当预设的数量小于接收到的数据的数量时,对排序后的数据进行分页。本发明一方面节省了多次数据请求的响应时间及用户等待请求的时间,降低了服务器端的负荷,提高了排序后分页显示的效率。
📄 2017107520369
📂 G06F16_951
👤 平安科技(深圳)有限公司
📅 2017-08-28
本发明提供了一种基于云计算的动态预警方法、装置、计算机设备及存储介质,方法包括获取当前时间,并获取当前时间中浏览服务器的当前浏览人数;判断当前浏览人数超过第一阈值后;在历史浏览记录中获取A个第一浏览人数、B个第二浏览人数和C个第三浏览人数;在计算A个第一浏览人数、B个第二浏览人数和C个第三浏览人数分别对应的第一平均浏览人数、第二平均浏览人数和第三平均浏览人数之后,集合日权重、周权重和月权重运用预设的动态预警公式计算出动态阈值;判断当前浏览人数达到动态阈值后,触发预警。以实现动态预警,解决目前服务器/网页/客户端的预警方式单一化的技术问题。
📄 2019103051737
📂 G06F16_951
👤 平安科技(深圳)有限公司
📅 2019-04-16