matlab으로 만날 이미지 분석하고 그러는 계산기같은 스크립트들만 짰었는데
갑자기 web scraper를 만들어야 할 일이 생겼어. 당연히 matlab은 그런게 안되더라고.
그래서 Python + scraper를 찾아봤어. 쉽게 될 줄 알았는데, 잘 안되더라.
http://zinee-world.tistory.com/408
여기를 바탕으로 하고 있는데 사진말고 dc 댓글들만 긁어오고싶은데 그게 잘 안되네.
게시판에서 한 글을 들어갔을 때 크롬 검사로 보면 tr table 속성이 'reply'인 놈에 접근해서 텍스트를 빼면 되는데, 처음엔 xpath로 하려고 했더니 이게 디씨갤에는 안된다고 횽이 그러더라고.
해달라는거는 절대 아니고, 어디서부터 해야 할 지좀 알려줘
솔까 웹프로그래밍은 내 전공이랑 상관이 없고 다른일이 너무많이 쌓였는데 전혀 진척이 없어서 물어본다 ㅠㅠ
그런건 사용자 맣은 c#이나 java가 빠를텐데
C#이나 java는 내가 아예 안다고 하기가 민망할 정도라서 ㅠ
옛날에 듣기론 htmlaglitypack으로 요렇게 저렇게 정규식으로 추출하면 된다고 하던데. 예제가 있으면 주고 싶은데 모르겠다.;; 프알못이라...
http://stackoverflow.com/questions/34472520/extract-specific-content-from-html-table-with-c-sharp-htmlagilitypack