뷰티풀 스프 라이브러리+ 리퀘스트 라이브러리 가져온 후에
헤더에 UA 정보 넣고
사이트 드가서 크롬 개발자 도구 켜서 가져오려는 정보가 담긴 정보의 선택자를 복사하면 그 관련 선택자들은 이제 계속 긁어올 수 있음
근데 대체로 인증 더 복잡하거나, 하는 애들이 많아서 대부분은 막힘
보통 최소 설정은
import requests
from bs4 import BeautifulSoup
url = "https://example.com"
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/120.0.0.0 Safari/537.36"
}
res = requests.get(url, headers=headers)
res.raise_for_status() # 요청 에러시 예외 발생
soup = BeautifulSoup(res.text, "html.parser")
# 예: CSS 선택자
elements = soup.select("div.content > a.link")
for el in elements:
print(el.get_text(strip=True), el.get("href"))
이렇게 하는데
기본적으로 사이트가 자스로만 될 경우에는 셀레니움 같은걸로 가져와야하고
막는 경우가 많은데 대부분은 이정도
페이크 에이전트 패키지 깔아서 에이전트 다방면으로 주고 구글 계정도 속일수있던데
나는 크롤링은 전문이 아님.