보통 대형사이트들은 사용자 접속 로그 분석해서,
단위시간당 대량으로 접속하는 IP나 MAC을 구분하여 일정시간 시스템적으로 차단시키는 장비를 가동하고 있습니다.

웹크롤러 초짜들이 하는 가장큰 실수는 시드 URL하나에 대해서 너비/깊이 우선 탐색등,
고전적인 방식으로 URL을 수집해 보는 방식인데,
이렇게 하면, 시드 사이트에 과부하 요인으로 작용해 차단크리를 ㅊ맞게됩니다..

일반적으로 웹크롤러는 분산 서버로 동작하고,
수집 URL을 DB나 혹은 특정 파일시스템 등을 이용하여 하나의 서버에서 관리하는 형태로 구성됩니다.

URL 수집시 보통 Seed에서 뽑아낸 URL List를 다른 Seed에서 뽑아낸 URL과 적절히 썪어서, 순서를 거의 Random하게 구성합니다.
이렇게 해야만 대상사이트의 Log분석 장비의 필터링을 피해갈 수 있습니다.

최근 추세는 자주 변경되는 URL리스트 만을 집중적으로 크롤링하여, 서버에 가해지는 부하량을 최소화 하고 있습니다.

좋은 크롤러를 보는 기준은 초당 얼마나 많은 URL을 수집하느냐 입니다.
그래서 CPU 사용율이 허락하는 한 최대한 많은 소켓을 열어 단위시간 동안 많은 URL을 수집하도록 되어있습니다.

로그분석을 피하기 위해 Sleep이나 Delay를 줬다.. <- 면접에서 이렇게 말하면 패망의 지름길임을 명심하십쇼..

- 무서운이야기 : 우리회사 올해 PS없다고 직원사기가 많이 떨어졌다고 신문에서 봤다..