형들 안녕


난 컴퓨터 프로그래머를 꿈꾸는 좆대딩이야


내가 공부도 할겸 하나 만들고 싶은 프로그램이 있거든


프로그램은 간단해


네이버에서 제공해주는 어떤 웹페이지가 있는데, 이게 매일마다 조금씩 변경이 되거든?(웹페이지 url 은 고정)


난 이걸 매일 특정 시간마다 가져와서 변경된 정보를 가지고 뭔가를 분석하고 통계 내는걸 만들고 싶어


그런데 이 웹페이지에서 내가 추출하고 싶은 정보는 html 코드상으로 분석해보니깐


<html>

... 중략

<table class="어쩌구"> 

<tbody> 

<tr> 

<td> 내용


이런식으로 굉장히 거대한 html 문서 안에서 정말 일부분의 내용으로 있더라구..


이걸 수집해서 먼가를 짜는 프로그램인데 보통 어떤식으로 접근하는거야?


우선 내가 생각한건 이거야.


1. 웹페이지 url 에 get 방식으로 request 를 보낸다.

2. response 응답으로 넘어오는 html 을 메모리에 저장한다.

3. html 에서 내가 원하는 <table class="어쩌구"> 를 찾는다.

4. table 하위의 <td> 태그를 찾고 "내용"을 저장한다.

5. 찾은 내용을 가지고 지지고 볶아서 프로그램을 완성


일단 이런식으로 생각을 해봤는데, 너무 노가다 같은데..이렇게 하는게 맞을까?


네이버에서 내가 원하는 "내용" 만 얻을 수 있는 별도의 api(xml 이나 json 형식의 리턴값을 주는..)를 제공해 주지 않는한, 


이런식으로 html response를 노가다로 분석하는 방법밖에 없는거 맞어?


그리구.. 내가 html 문서는 안다뤄봤는데.. xml 처럼 파서 라이브러리가 있고, 내가 원하는 태그 찾아가는거 쉬워?


고수형들 조언 기다릴게..