一种动态检测失效流量的网络爬虫方法.pdfVIP

  • 1
  • 0
  • 约1.55万字
  • 约 12页
  • 2023-06-06 发布于四川
  • 举报

一种动态检测失效流量的网络爬虫方法.pdf

本发明涉及一种动态检测失效流量的网络爬虫方法,包括以下步骤,首先通过分析网络请求信息构建动态检测失效流量模型的数据集,然后设计出动态检测失效流量的方法,接着对URL队列中的信息进行读取并且对Cookie等信息进行封装后发送请求,提取返回数据信息,并对返回数据信息进行失效流量检测,最后对重复返回数据信息进行处理,如是有效数据则持久化存储。本发明弥补了现有聚焦爬虫和增量爬虫在Cookie失效问题的处理上和数据重复处理上的不足之处,降低了爬取数据的失效和重复概率,对爬虫系统的设计提供了可借鉴的方案,提

(19)国家知识产权局 (12)发明专利 (10)授权公告号 CN 112765437 B (45)授权公告日 2022.05.17 (21)申请号 202110086472.3 G06F 16/955 (2019.01)

文档评论(0)

1亿VIP精品文档

相关文档