네이버 스토어팜 상품명, 가격, 이미지 긁어오는 스크립트다.
xlsxwriter랑 csv 라이브러리 썼다가 openpyxl로 바꿨다.
html 파서는 lxml이 가장 빠르대서 그걸로 써왔다.
지금 캐터고리 자동으로 결정해주는 기능 만드려고 하는데 네이버 스토어팜 상품 캐터고리가 사천 개가 넘는다.
xpath 검색문 만드는 데 시간이 제일 오래 걸렸다. 짜증.
네이버 스토어팜 상품명, 가격, 이미지 긁어오는 스크립트다.
xlsxwriter랑 csv 라이브러리 썼다가 openpyxl로 바꿨다.
html 파서는 lxml이 가장 빠르대서 그걸로 써왔다.
지금 캐터고리 자동으로 결정해주는 기능 만드려고 하는데 네이버 스토어팜 상품 캐터고리가 사천 개가 넘는다.
xpath 검색문 만드는 데 시간이 제일 오래 걸렸다. 짜증.
난 lxml로 속옷쇼핑몰 사진 긁는거나 만들었었는데 클라스가 다르시네여
그래도 파이썬이랑 lxml xpath 조합이라서 좋지만 개인적으론 DB에 넣는게 더 좋다고봄. 크로울러 여러개 뛰워서 크로울링 하게 만드는것도 재미있을듯(아주아주 기초적인 분산처리)
보는 사람이 엑셀로 보여달래. 원래 액세스로 해줬더니 액세스도 싫대.
분산처리는 파이썬 초보라서 쓰레드를 한 번도 안 써봐서 못 함. 나중에 시간 나면 할 지도... 오류 처리도 전혀 안 되어있다.
이런거 신기해요 로봇만드는거 어렵나요?
쉬워 어려우면 바보인 내가 못하겠지.
언어는 뭘로만드나요 c나 파이썬으로 만들수있어요?
아무 언어나 다 됩니다. html 파서 있으면 편하고요.
스레드 만드는것보다 ip별로 너무 자주 요청하면 밴되니까 여러서버를 장만해놓고 (한 4개정도) 거기서 동시에 긁어서 DB업데이트, 그럼 작업속도 4배까지는 안되더라도 꽤 향상될듯 근데 뭐 애초에 쇼핑몰 데이터가 아주 많은건아니니까 음냐... 1개로 긁어도 하루정도면 긁히지않으려나
차단될까봐 그게 제일 걱정이다. 내 경우는 천 개만 긁어오면 되서 프록시 지원해야 할 지 애매하다.
신기하네요 c언어로는 그렇게 글거오는 함수 대략 어떤거 쓰나요?
http://en.wikipedia.org/wiki/Comparison_of_HTML_parsers
감사합니다
잘만들었네
진짜 궁금한건데 쇼핑몰 파싱해서 뭐하냐