https://m.news.naver.com/main?mode=LSD&sid1=103
예시는 네이버 생활면 카테고리 찍었는데
다른 모든 뉴스 사이트가 다 예시가 될 수 있음
목표는 크롤러 구현
구체적 목표는 사이트 던져주면 지가 알아서 돌면서 페이지 수집
상용툴이 어디까지 개발해서 판매하나 해서 시험삼아 10개정도 다 다른거 사서 해봤는데, 죄다
1) 지정된 사이트에 지정된 형식으로 크롤링이 돌던가
2) 아니면 유저가 직접 하나하나 지정해서 맵핑해서 돌려야함
크롤링에 대한 기초 지식을 사용자에게 주입하는건 말도 안된다고 생각하고... 지정된 범위에서 초과할 경우 작동 안하는 것도 말도 안된다고 생각해서 직접 크롤러랑 스크래퍼 구현해봤음
스크래퍼는 잘 작동하는데 문제는 크롤러임
크롤링 하면 애가 한 페이지만 작동하던가, 아니면 전체 사이트 풀 스캔을 해버림
1) 특정 사이트에 대해서 최적화를 해버리면 다른 사이트에서 전혀 안돌아감... 네이버 생활면 카테고리 링크를 던져두면 다음 생활 카테고리 던져두면 첫페이지 수집하고 다음페이지를 못넘어감
2) 나오는 모든 링크를 스택으로 수집하고 재귀형식으로 돌리면 도메인 페이지 전체 링크를 풀스캔해버림. 막을 수 있는 로직이 없는것 같은데
옥스퍼드에서 만든 크롤링 인덱스 관련이나 아니면 석박에서 웹 구조 관련 논문 뒤져봤는데 도저히 XPath 나 css selector 의 구조로는 던져둔 카테고리와 링크만으로 원하는 페이지를 최적화해서 수집이 불가능한거 같은데...
혹시 이걸 해결한 상용툴이나 방법이 있을까?
크롤러 설정을 잘못 한거임