CNode

nowall被爬虫盯上了,怎么办?

Gguilin发布于14 年前最后回复14 年前5 回复7226 浏览0 收藏

nowall.be 是 nodejs实现的网页。代。理。其中链接可以包含整个互联网。所以当爬虫进入之后就会无休止的抓取。而且爬虫们很多都不遵守robots协议。

需要想个办法来屏蔽这些爬虫。

查看回复

回复 (4)

S
sevencity#1·14 年前

可以用做一个middleware,HTTP头来判断爬虫,然后屏蔽之。 例如Google爬虫的头是 googlebot(at)googlebot.com 百度是 Baiduspider

G
guilin#4·14 年前

是bug, 这种在js中动态拼装的url, 很容易出问题.

参与回复
登录后即可参与回复。登录