일단 본문 크롤링후에
페이지내부에있는 list.php관련 url모두 수집하고 대기열에 넣은다음
코맨트가 있을경우 xml데이터를 서버에 요청해
http://gall.dcinside.com/comment_(ㅁㄻㄴㅇㄻㄴ)4.php?id=programming&no=1&page=1
숫자4앞에 ()는지워라
라고 데이터가넘오잔아
new_view부분을 파싱해서 그수만큼 코멘트 쿼리 &page=1,2,3,4순차적으로 저장해주면됨
쉽지?
일단 본문 크롤링후에
페이지내부에있는 list.php관련 url모두 수집하고 대기열에 넣은다음
코맨트가 있을경우 xml데이터를 서버에 요청해
http://gall.dcinside.com/comment_(ㅁㄻㄴㅇㄻㄴ)4.php?id=programming&no=1&page=1
숫자4앞에 ()는지워라
라고 데이터가넘오잔아
new_view부분을 파싱해서 그수만큼 코멘트 쿼리 &page=1,2,3,4순차적으로 저장해주면됨
쉽지?
저걸 몰랐음 ㅡ; 애초에 xml을 구문을 이해도 못하는 상황에서 브라우저 주소 변경하고 소스 크롤링 파싱해서 만들었으니 ㅡ;;
고마워 횽, 도움 많이 된 것 같음. 이번에 php 들어가고 공부 많이 하게 되면 많이 늘듯 ㅋㅋ 고마워요
근데 횽 나 궁금한게 있는데 왜 xml 데이터라구 행..? html 데이터 아님? 아니면 xml 형식으로 따로 가공해주는 작업을 하는거야?
오! 저 주소는 어떻게알았음?
뭘 어떻게알어... 소스보기하면 js파일있잔아 그안에 코멘트뷰 js코드에 저주소있는데
xml코드내부에 어트리뷰트의 값이 html이지
아...라이브러리 이용하나보구낭..난 그냥 소켓통신 이용해서 html text들을 불러들여다가 어쩌구저쩌구 하는줄 알았음...;;
자바로하는거야?
ㄴ 자바그런게 어딧음... 그냥 원하는 언어로하는거지
가공을 해서 그런게 아니라 디씨의 리스폰스가 xml
캐꼬꼬닭 뭔 개소리영, 니꼴리는 걸로만들어 난 c#쓰니까
읭? 디씨의 리스폰스가 xml이라니...따로 xml 데이터를 DC에서 제공해주는건가?????? xml 데이터 볼수 있는 주소점
본문 ㅎ
투명해서 정직한 DC설계 ㅋㅋㅋ
DC 코멘트 긁어 가는거삼?
C# 은 어떤 라이브러리로 크롤 하냐