웹에서 소스 받고 소스 파싱해서 이미지랑 파일 긁어오는데 403이떠서 일단 헤더 조작으로 해결이 됫음
근데 헤더를 조작해도 계속 접속을 시도하니 중간중간에 다시 403이떠서 헤더를 여러개 만들어놓고 실패할때마다 순차적으로 갈아끼워보니 잘됨
질문할거는 헤더 조작전이야 그렇다쳐도 헤더 조작 이후에 간혹가다 403이 뜨는 원인, 이게 서버에서 알고서 막는건지 아니면 그냥 일시적인건지
그리고 만약 이런식의 크롤링이 들어왔을때 서버쪽에서 할 수 있는 대처가 궁금함, 거기에 맞춰서 내가 계속 바꿔야하니까...
일단 좃밥인 내 머리로 생각이 가능한건 당연히 내 파싱 키워드로 쓸만한걸 갈아치우는거랑
파일을 불러올때 시간변수를 줘서 어느정도 유효시간 지나면 요청 거부하는거 정도인데 다른게 또 있을까?
그냥 니가 웹브라우저라고 생각하고 똑같이 크롤링하면 된다 서버에서는 그걸 구분할 방도가 없거든
주기가 인간적으로 노무 짧으면 블랙리스트 딲 때릴 수야 있겠지만
지속적인 요청을 아이피로 막는지 에이전트나 시간같은걸로 막는지 좀 더 검토해야하지않음? 아이피로 막으면 클라우드같은데다 올려서 계속 바꿔 가면서 크롤링해야함
그래서 어디 야짤 사이트? 나도 좀 알려주라(속닥속닥)
일일 요청 횟수로도 알 수 있죠. 닝겐이 할 수 없을정도의 요청수는 무리
답변 감사, 어쨋든 너무 무리하게 요청만 안하면 딱히 막을 방법은 없다는거네... 이건 뭐 사용자한테 달렷으니
인간 행위에 기반한 웹 브라우저 사용 양식에 따라 요청을 보냈는데 그걸 크롤링이라고 막아버리면 그 사이트가 문제 있는거
그래서 그 야짤 사이트가 어디냐고 씨잌바알!!
야짤 아니양!
제가 대신 크럴링 해두릴테니까 그 야짤사이트 빨리 알려주십셔
exhentai?
어딘데 ㅅㅂ
레퍼러로도 막음. 아이피로도 막고. 빠르게 할려면 프록시 서버 몇대 필요함.