웹페이지 글 크롤링하고 있는데 utf-8로 인코딩해도 한글이 깨지는이유
asdf(175.116)
2017-07-08 01:12
추천 0
가 뭘까여??
웹페이지에선
<html lang="ko"> <head> <meta charset="utf-8"> <meta name="viewport" content="width=device-width, initial-scale=1.0"> <meta http-equiv="X-UA-Compatible" content="IE=Edge"> <meta name="Author" content=""> <meta name="generator" content="2015.03"> <meta name="Description" content=""> <meta name="keywords" content=""> <meta property="og:title" content="" /> |
내 프로젝트에서도 죄다 'utf-8' 이게끔 해두고
soup = BeautifulSoup(page_body,
'html.parser',
from_encoding=
'utf-8')
이렇게 뷰티풀수프써서 'utf-8'로 해줬는데... 시블
꽈이썬2?
쓰리
sys.stdin out 다 체크해봄
이거만 해결하면 나머진 일사천리로 끝날꺼 같은데 죄다 파싱이라
euckr, cp949 다해봄. 근데 출력되는 깨진 문자열이 그대로인거로 봐서는 이거 from_encoding이 작동 안하는거 같은데...??? 흑
encode로 중간에 해봐도 깨진 문자열이 그대로임. 음 이거 전에 경험했었는데
넹 #-*- coding: utf-8 -*- 이걸 박아뒀슴죠
끙 그거도 아닌거 같아요. 황당하넹
깨딘 문자를 바이너리나 헥사 등으로 보면 어느 지점에서 문제인지 쉽게 찾아갈 수 있지
그게 무슨 말임? 예를 들면 원래 인코딩이 뭐였는지를 유추가능하단말?
아 빡치는데 그냥 원시적으로 해야겠음. 어차피 조회수만 카운트해서 근 2년동안 가장 조회수 높은거 순으로 10개만 추려서 그 글이 뭔지 정리하는거였으니깐 그냥 <span class="hit">[num]</span> 으로 다 조져서 후보군 주소 추리고 노가다로 확인해야겠음
https://stackoverflow.com/questions/36833357/python-correct-encoding-of-website-beautiful-soup
https://stackoverflow.com/questions/20205455/how-to-correctly-parse-utf-8-encoded-html-to-unicode-strings-with-beautifulsoup
https://stackoverflow.com/questions/7219361/python-and-beautifulsoup-encoding-issues
소용없소!
딱보니 꿈의 연봉 1400 이네
?? 웹 같은거 원래 안 다루는데 뭔솔. 그냥 필요때문에 한번만 써보면 됨