수집된 데이터를 사용자에게 보여주는 알고리즘은 알겠는데
이 세상에 졸라 많은 웹서버의 내용은 어케 가져오는거임?
그냥 구글 봇이 무차별 아이피를 대입해서 이 아이피가 웹서버 인지 확인하고
그 웹서버의 모든 내용을 긁어오는거임?
수집된 데이터를 사용자에게 보여주는 알고리즘은 알겠는데
이 세상에 졸라 많은 웹서버의 내용은 어케 가져오는거임?
그냥 구글 봇이 무차별 아이피를 대입해서 이 아이피가 웹서버 인지 확인하고
그 웹서버의 모든 내용을 긁어오는거임?
당연히 크롤링이지
헐.. 그럼 내가 와이어샤크 틀어 놓으면 언젠가 구글이 나한테 요청하는 패킷을 볼수있는건가 ㄷㄷ
https://www.google.com/intl/ko/search/howsearchworks/crawling-indexing/
찾아보니
구글피셜이 있네
와 고마워 무차별이 아닌 DFS 방식이네 ㅋㅋ
교수님한테 물어봤음 크롤링인데 내부 검색 파싱 알고리즘이 상상 이상으로 효율적이라더라
답변 ㄳㄳ