1. Google 검색 API 호출 (ex. 검색어: 히토미 오네쇼타)

2. 결과에서 신뢰할 수 있는 도메인 필터링 후 link 추출

3. 크롤러 (requests, BeautifulSoup)

→ HTML을 얻어내고 필요한 콘텐츠 영역만 필터링

4. GPT-3.5 Turbo로 1차 요약 → GPT-4로 2차 상세 정보 검증 및 추출

(성능/비용 최적화)

5. DB 저장 (검색어, 링크, 요약)

6. CSV로 export 후 Vector Store로 로딩 (예: Pinecone, Chroma)

7. Vector Store + GPT-4 기반 정보 최종 생성 (Prompt Engineering 적용)

8. 유저가 챗봇한테 질문하면 GPT4 + 벡터 스토어에 기반해서 답변

(ex. 순애물 작가 추천해줘)


이런식으로 인터넷에서 필요한 데이터를 수집하려고해 어떻게 생각해?