형들 안녕
난 컴퓨터 프로그래머를 꿈꾸는 좆대딩이야
내가 공부도 할겸 하나 만들고 싶은 프로그램이 있거든
프로그램은 간단해
네이버에서 제공해주는 어떤 웹페이지가 있는데, 이게 매일마다 조금씩 변경이 되거든?(웹페이지 url 은 고정)
난 이걸 매일 특정 시간마다 가져와서 변경된 정보를 가지고 뭔가를 분석하고 통계 내는걸 만들고 싶어
그런데 이 웹페이지에서 내가 추출하고 싶은 정보는 html 코드상으로 분석해보니깐
<html>
... 중략
<table class="어쩌구">
<tbody>
<tr>
<td> 내용
이런식으로 굉장히 거대한 html 문서 안에서 정말 일부분의 내용으로 있더라구..
이걸 수집해서 먼가를 짜는 프로그램인데 보통 어떤식으로 접근하는거야?
우선 내가 생각한건 이거야.
1. 웹페이지 url 에 get 방식으로 request 를 보낸다.
2. response 응답으로 넘어오는 html 을 메모리에 저장한다.
3. html 에서 내가 원하는 <table class="어쩌구"> 를 찾는다.
4. table 하위의 <td> 태그를 찾고 "내용"을 저장한다.
5. 찾은 내용을 가지고 지지고 볶아서 프로그램을 완성
일단 이런식으로 생각을 해봤는데, 너무 노가다 같은데..이렇게 하는게 맞을까?
네이버에서 내가 원하는 "내용" 만 얻을 수 있는 별도의 api(xml 이나 json 형식의 리턴값을 주는..)를 제공해 주지 않는한,
이런식으로 html response를 노가다로 분석하는 방법밖에 없는거 맞어?
그리구.. 내가 html 문서는 안다뤄봤는데.. xml 처럼 파서 라이브러리가 있고, 내가 원하는 태그 찾아가는거 쉬워?
고수형들 조언 기다릴게..
네..자바 라이브러리군요. 안그래도 자바로 짤려고 했었습니다. ㄳ
근데 제가 만들려는 프로그램의 개발 방향은 맞는건가요? 직접 html 까는거 말고 다른 방법은 없나요?
프로그램은 간단해 <- 간단한것도 못하는 멍청한놈아 니가하지 왜 물어보냐. 개발자 관련해서 매번 보는 제일 멍청한 질문이다.
노노노노// 멍청한 답변이시군요.. 난독증이라도 있는건지.. ^^
그 멍청한 머리로 생각 좀 하지 말고 논문같은거 좀 찾아봐라. 이런건 정말 마니 나온단 말이야.
어이쿠..이게 뭐 대단한 프로그램이라고 논문같은거까지 찾아봐야 한답니까? 이게 학술적인 프로그램입니까? 대단한 알고리즘이 필요한 겁니까? ㅎㅎㅎ 그냥 웹관련 프로그래밍 좀 해보신 분들한테 가볍게 물어보고 가볍게 답변 받을만한 질문이라고 생각했는데 제가 잘못 생각한건지..아니면 여기 분들 수준이 낮은건지 모르겠군요 ㅎㅎ
Berrzeb// 너는 답변하는 자세가 틀려먹은듯.. 그리고 크롤링과 이거랑 먼 상관이지? 내가 무작위 url 의 웹페이지 수집하는건가? 난 고정 웹페이지를 파싱하는 문제인데? 사실 첫번째 답변준분이 알려준 라이브러리를 살펴보면 내가 궁금했던건 해결될 가능성이 높아.. 그런 답변을 다는분이 있는가 하면.. 시비조로 답변다는 심성 꼬인 노노노노, DMW, Berrzeb 너네같은 애들이 문제야..
나는 분명 질문은 정중하게 했어. 답변에 시비조로 단 세놈(노노노노, DMW, Berrzeb.)같은 애들한테만, 받은대로 돌려줬을뿐..^^
Berryzeb// 난 크롤링이 내 질문과 직접적인 관계가 있다고 생각하지 않지만.. 설령 니 말대로 크롤링이 내 질문에 대한 답변이 될 수 있다고 쳐도.. 질문하는 내가 크롤링이란 개념을 들어봤어야 검색할 수 있는거 아니겠냐? 너는 답변으로 크롤링이라는 키워드를 주면 되는것이지 나보고 크롤링으로 검색안해봤다고 면박줄건 없다고 본다.
크롤링은 내가 알기로, 구글같은 검색엔진에서 웹페이지를 무작위로 돌아다니면서 수집하는 거로 알고 있다. 수집한뒤에 파싱하는건 그 다음 문제지.. 나는 정해진 웹페이지를 수집하는거기 때문에 크롤링과는 크게 상관없다고 보고, 굳이 따지자면 html parser 와 연관이 있는 질문이라고 본다.
IT♡담배// 제가 xml은 다뤄봤지만 html 파싱은 처음이라 그런데..제가 말한 수준의 태그에서 내용 검색하는건 쉽나요? 물론 내일 jsoup 라이브러리 받아다가 도큐멘터리 볼거긴 합니다 ^^
크롤링에 대해 나도 대충 알고 있었지만, 너가 말한후 사전적 정의를 찾아보니, 수집한 웹사이트를 db에 저장해서 색인작업을 하는것까지 포함하는 개념이더군.. 내 질문과 관련이 있기는 하다만 너무나 범위가 넓어지는거 같다..난 굳이 db까지 쓸필요가 없는 규모의 프로그램을 구상중이라서 ㅎㅎ 간단한 html parsing 만 해서 처리할거라서..
참..같은 질문을 가지고.. 한쪽에서는 검색하면 바로 나오는 초간단 문제로 취급하고.. 다른 한쪽에서는 스타트업 기업 창업을 위한 간보기 질문 하는걸로 취급하기도 하는구나..ㅎㅎㅎ 참 재밌다 재밌어 ^^
원래 욕먹으면서 크는거야 뭔 자바냐 파이썬으로 해라 requests beutifulsoup