Html 읽어오는데 Bs나 셀레니움 쓰는데,
F12 페이지 정보에서
아이디는 없고 헤더랑 클래스 겹치는게 너무많아..
예를들어 selector('div.클래스이름')하면 180개가 뜨는데
그중 한개 가져오고싶은 값만 지정을 못하겠을땐 어떤걸로 선택해야하냐??
팁좀..
아 그리고 완전 다른 질문인데
크롤링 실시간으로 어떻게하냐?
실시간으로 인터넷꺼 데이터 어떻게 읽냐??
예를들어 주식 변동하는데 값 변하는거 읽다가 몇 이하면 팔아라 사라
하려면 어떤거사용해야함?
F12 페이지 정보에서
아이디는 없고 헤더랑 클래스 겹치는게 너무많아..
예를들어 selector('div.클래스이름')하면 180개가 뜨는데
그중 한개 가져오고싶은 값만 지정을 못하겠을땐 어떤걸로 선택해야하냐??
팁좀..
아 그리고 완전 다른 질문인데
크롤링 실시간으로 어떻게하냐?
실시간으로 인터넷꺼 데이터 어떻게 읽냐??
예를들어 주식 변동하는데 값 변하는거 읽다가 몇 이하면 팔아라 사라
하려면 어떤거사용해야함?
BS4 설명서 문서내에 다 답이 있더라 나도 그거 때문에 수시간을 삽질하다가 답 찾음
그거... 읽어봤는데... ㅠㅠ 이놈들이 웹사이트 만들때 똑같은 상자 ㅈㄴ 가져다 써가지고 부모하고 그 부모까지 선택해봐도 다 중복이더라... 어떻게 해결했어?
soup = BeautifulSoup(html, 'html.parser') MyTitles = soup.find('section', {'class' : 'article_body'}) Mytitles1 = MyTitles.find('p')
난 이렇게 했었음 'p'로 감싸진 기사 내용들을 긁기 위해서 MyTitles라는 변수에 article_body만 긁어오는 내용을 저장하고 그 안에서 'p' 안에 있는 내용만 따옴
나두 그렇게 간단하게 되면 좋으련만...ㅠㅠ 후에엥