https://github.com/Kevinzhang29/doubanSpider github如上,只有十页用的是for循环,如果几千几万几百万条数据的话,爬虫该怎么写呢?
回复 (8)
N
爬虫前端多进程爬取,通过消息队列路由到后端,后端单DB起启动多个消费者接收处理数据并落地,在不是很大的并发量的情况下都可以扛住。
G
分而治之
Y
把获取url和爬取过程分离开 可以考虑用生产消费模型 配合async+多进程 这是我的一个例子,也是千万级别的请求数量 : ) https://github.com/Yuki-Minakami/PHelper
A
分开来处理
K
K
引用 godghdai分而治之
@godghdai 谢谢
K
引用 as13579e分开来处理
@as13579e 好的看一下上面的老哥代码
K
引用 nullcc爬虫前端多进程爬取,通过消息队列路由到后端,后端单DB起启动多个消费者接收处理数据并落地,在不是很大的并发量的情况下都可以扛住。
@nullcc 谢谢 最近正在做个demo测试一下
参与回复
登录后即可参与回复。登录