200이나 주고 5080을 샀는데 로컬 AI를 사용해보지 않는 건

너무 아까워서, 머리로만 생각하던 일을 실천해봤음.




해보고 싶었던 건 어떤 개발자가 만든 MORT라는 프로그램처럼,

보고 있는 화면을 실시간 번역하는 프로그램이었음.

근데 MORT는 파파고, DeepL 같은 번역 API를 사용해서 API 비용 문제랑

이전 대화내용을 기억못해서 문맥이 이어지지 않는다는 단점이 있음.

그래서 나는 한번 사용하고 안썼는데



"이걸 번역 API가 아니라 로컬 LLM으로 하면 모든문제가 해결되잖아?" 싶어서 바로 해봤음.


사용해본 LLM모델은 아래 3개

1. gemma3:27b-it-q4_K_M"

 ㄴ텍스트가 한 페이지 분량일 때 너무느림

2. qwen3:14b-q8_0

 ㄴ 그냥 존나 느림

3. gemma3:12b-it-q8_0

 ㄴ 평범하게 느림


5080에서 실사용하려면 "gemma3:12b-it-q8_0" 이 마지노선인거 같은 느낌이였다.

더 좋고 빠른 모델 있으면 추천점


아래는 작동 결과물

아마 프로그램처럼 GUI 추가하고 다듬으면 쓸만해지지 않을까 기대중