- 1
- 0
- 约1.55万字
- 约 12页
- 2023-06-06 发布于四川
- 举报
本发明涉及一种动态检测失效流量的网络爬虫方法,包括以下步骤,首先通过分析网络请求信息构建动态检测失效流量模型的数据集,然后设计出动态检测失效流量的方法,接着对URL队列中的信息进行读取并且对Cookie等信息进行封装后发送请求,提取返回数据信息,并对返回数据信息进行失效流量检测,最后对重复返回数据信息进行处理,如是有效数据则持久化存储。本发明弥补了现有聚焦爬虫和增量爬虫在Cookie失效问题的处理上和数据重复处理上的不足之处,降低了爬取数据的失效和重复概率,对爬虫系统的设计提供了可借鉴的方案,提
(19)国家知识产权局
(12)发明专利
(10)授权公告号 CN 112765437 B
(45)授权公告日 2022.05.17
(21)申请号 202110086472.3 G06F 16/955 (2019.01)
原创力文档

文档评论(0)