이걸 가져오고 싶은데
이렇게 가져와짐 (중간에 텍스트가 날아감)
파이썬 BeautifulSoup 쓰고 있어
json으로 넘겨서 쪼개면되잖아
아니 쪼개는건 문제가 아니야. beautifulSoup 내에서 쪼개는 매소드가 있어. 근데 위의 두 개 비교하면 알겠지만 내용 자체가 날아갔어
python 으로 크롤링 안해봐서 모르는데 보통 innertext 이거 들고 오는게 따로 있음
ㅇㅇ get_text 쓰면 되는데... 문제는 내용 자체가 날아갔어 ㅋㅋㅋ
들고온 원본 html 에는 들어있음?
아래 검정 바탕이 원본 html 가져온거야
크롤링 할려는 사이트 주소 줘봐 아마 저런겅우면 js 이용해서 동적으로 로딩하는 부분이라서 없는것 같은데
https://www.work.go.kr/empInfo/themeEmp/themeEmpInfoSrchList.do?thmaHrplCd=F00030
동적으로 로딩하는 부분이어도 저렇게 devtool로 볼 수는 있어?
ㅇㅇ devtool에 있는 elements.이건 지금 보이는걸 알려주는거라서 동적로딩 들어간것도 나옴
아 뒤적거리다 보니까 js로 로드하는 부분이 있네 ㅋㅋㅋ 셀레니움 배우러 가야겠다 알려줘서 고마워
셀레니움 없이 들고와야 한다면 들고 올 수 있긴 함
script가 td 내부에 있으니까 xpath 이용해서 script 찾고 정규식으로 var str = '*'; 이부분 찾아서 들고오면 됨
오 그럼 이제 js만 파싱하면 되겠네
동적 크롤링은 셀레니움 써야함
꼬박 두시간 써서 배우고 만들었는데 폐기해야 한다니ㅠㅠ
json으로 넘겨서 쪼개면되잖아
아니 쪼개는건 문제가 아니야. beautifulSoup 내에서 쪼개는 매소드가 있어. 근데 위의 두 개 비교하면 알겠지만 내용 자체가 날아갔어
python 으로 크롤링 안해봐서 모르는데 보통 innertext 이거 들고 오는게 따로 있음
ㅇㅇ get_text 쓰면 되는데... 문제는 내용 자체가 날아갔어 ㅋㅋㅋ
들고온 원본 html 에는 들어있음?
아래 검정 바탕이 원본 html 가져온거야
크롤링 할려는 사이트 주소 줘봐 아마 저런겅우면 js 이용해서 동적으로 로딩하는 부분이라서 없는것 같은데
https://www.work.go.kr/empInfo/themeEmp/themeEmpInfoSrchList.do?thmaHrplCd=F00030
동적으로 로딩하는 부분이어도 저렇게 devtool로 볼 수는 있어?
ㅇㅇ devtool에 있는 elements.이건 지금 보이는걸 알려주는거라서 동적로딩 들어간것도 나옴
아 뒤적거리다 보니까 js로 로드하는 부분이 있네 ㅋㅋㅋ 셀레니움 배우러 가야겠다 알려줘서 고마워
셀레니움 없이 들고와야 한다면 들고 올 수 있긴 함
script가 td 내부에 있으니까 xpath 이용해서 script 찾고 정규식으로 var str = '*'; 이부분 찾아서 들고오면 됨
오 그럼 이제 js만 파싱하면 되겠네
동적 크롤링은 셀레니움 써야함
꼬박 두시간 써서 배우고 만들었는데 폐기해야 한다니ㅠㅠ