-
☆ A M B ☆
- 24,524 Posts
I think I know where the slowdown and occasional out-of-memory errors I’ve been getting on my site over the last few days has been coming from. My access logs are full of this kind of junk
85.17.211.164 - - [05/Aug/2010:03:25:07 -0700] "GET /media/style/manager/manager/manager/manager/manager/manager/manager/manager/manager/ HTTP/1.1" 404 6153 "-" "Mozilla/5.0 (compatible; Purebot/1.1; +http://www.puritysearch.net/)"
Cause errors like this
[Thu Aug 05 04:25:08 2010] [error] [client 85.17.211.164] (78)File name too long: Cannot map GET /media/style/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/manager/modx-from-the-inside.html HTTP/1.1 to file
According to what I’ve been able to find, it doesn’t respect robots.txt or anything else, and its IP keeps changing.
http://www.webmasterworld.com/search_engine_spiders/4033706.htm
I’ve blocked it by user-agent in my .htaccess file; we’ll see if it stays blocked.
I wonder if it’s an attempted DOS attack, or just some kid on a shared server trying to write a search bot.
-
☆ A M B ☆
- 24,524 Posts
It’s been around for a while, the earlier posts on the forum I link to are from last year. And the URL in the user agent is actually a search site.
I see that. Apparently its spider’s site search algorithm needs tweaking. You’d think someone would have mentioned it to them by now.
-
☆ A M B ☆
- 427 Posts
-
☆ A M B ☆
- 24,524 Posts
Another rather mean solution I ran across is to use a rewrite rule to redirect it right back to itself (its user agent string even includes its URL!).