우선 비전공인이라
설명이나 어휘선택이 적절하지 않을 수도 있다는 것 미리 양해말씀 드립니다.
제가 원하는 작업은 이러합니다
ABC.com이란 특정 사이트가 있다고 치면
이사이트 내부 텍스트 정보를 전부 긁어서
엑셀 혹은 메모장 파일로 추출하고 싶습니다.
그런데 이 ABC.com이라는 사이트는
ABC.com/1
ABC.com/2
ABC.com/3
.
.
ABC.com/58
ABC.com/59
.
.
.
이런식으로 구성되어 있습니다.
가령 ABC.com/1 에서부터 ABC.com/100
까지의 모든 페이지 자료를 크롤링 하고 싶은데
이게 가능한 스크래핑 프로그램이 있을까요? 유료라도 상관없습니다
없다면 직접 코드를 짜야할까요? 제가 코딩능력이 없기에 아무래도 외주를 해야할거 같습니다
걍 파이썬으로 이런 작업을 하고싶은데 파이썬 설치부터 코드 실행까지 알려줘. 라고 gpt4한테 물어보면 다 짜줌 ㅋㅋ
for문 안에서 base url + i로 하면 되는 거 아님?
크롤링 제한 없으면 같단한데 제한있으면 조금 까다롭당 - dc App
내가 그래서 챗 gtp 한테 물어서 파이썬으로 북토끼 소설 크롤링함. 현재클라우드 플레어있어서 아무튼 뚫었는데 혹시 막힐까봐 방법은 공개안함 - dc App
존나쉬운데 뭐 대단한것마냥 공개안함 ㅇㅈㄹ ㅋㅋ
크롤링 프로그램은 잘 모르지만 없을 껄? 솔직히 여기에 물을 시간에 gpt한테 url 뽑아서 크롤링 하는 프로그램 있나고 물어봐. 걔가 없다고 하면 없는 거임. 그런대 bs4로 간단하게 파싱 가능한데 불필요하게 프로그램을 씀?
url/{정규표현식} 으로 get 요청 하고 response 바디 파싱하면 되겠네
나한테 맡기면 내가 싸게 해줄게