(솔직히 크롤러라기 보다는 스크래핑인데 그냥 넘어가자)
동적페이지는 자바스크립트로 값을 나중에 업데이트 하기 때문에 정적페이지처럼 python request.get 띡해서 값을 못 알아냄
결국 동적페이지 크롤링하려면 selenium pupeeter 같이 브라우저를 쓸 수 밖에 없음
기사 댓글을 가져온다, 멜론 차트를 가져온다
이런 간단한건 사람이 직접분석해서 AJAX라 하나 json 가져와서 추출하면 됨 아님 간단한 자바스크립트면 자스엔진으로 실행시켜도 되겠지
근데 검색엔진에 쓰는 진짜 크롤러면 한계가 있음
대다수의 최신웹을 차지하는 느려터진 자스로딩지옥에 결국은 크롬을 쓸 수 밖에 없을것
찾아보니 실제로 구글봇도 크롬기반이라 그러네 항간에 떠도는 말 중엔 크롬이니 v8이니 뭐니 만들 수 있었던 이유도 크롤러를 만들때 썼던 세계제일의 기술력 때문이라고
아님말고
근데 크롬 램 존나 처먹던데 뭔 수로 돌리는거지
댓글 0