1. Google 검색 API 호출

2. 결과에서 신뢰할 수 있는 도메인 필터링 후 link 추출

3. 크롤러 (requests, BeautifulSoup)

→ HTML을 얻어내고 필요한 콘텐츠 영역만 필터링

4. GPT-3.5 Turbo로 1차 요약 → GPT-4로 2차 상세 정보 검증 및 추출

(성능/비용 최적화)

5. DB 저장 (검색어, 링크, 요약)

6. CSV로 export 후 Vector Store로 로딩 (예: Pinecone, Chroma)

7. Vector Store + GPT-4 기반 정보 최종 생성 (Prompt Engineering 적용)

8. 최종 정보 DB 업데이트


어떠냐