import requests
from bs4 import BeautifulSoup
# 특정 웹사이트의 URL
url = "https://namu.wiki/w/Official%E9%AB%AD%E7%94%B7dism?from=Official%20HIGE%20DANdism"
# 웹사이트에서 HTML 가져오기
response = requests.get(url)
html = response.text
# BeautifulSoup을 사용하여 HTML 파싱
soup = BeautifulSoup(html, "html.parser")
# 일본어 텍스트 추출
japanese_text = []
for element in soup.find_all(string=True):
if element.strip() and any(ord(c) > 128 for c in element):
japanese_text.append(element.strip())
# 추출한 일본어 텍스트 출력
for text in japanese_text:
print(text)
GPT로 이런 코드를 만들었는데요, 정상적으로 작동을 안해요...
일본어만 뽑으려고 하는데 한국어랑 영어도 나옵니다..
이렇게 HTML에서 특정 텍스트만 추출할 수 없는건가요????
도와주면 얼마? -
그냥 지금처럼 다 뽑은다음 일본어만 살리면 되는거아님?
한국어 영어 뺴고 출력하도록 정규식 쓰면 되잖아
제가 GPT 독학으로 배우고 있어서 모르겠어요 ㅠㅠ
gPT는 자꾸 거짓말쳐요