원래는 기존에 구축해 둔 RAG에다가 물려놓은 제미니2.5플래시 대체하려고 써봤는데
결론적으로는 작은 RAG는 잘 하지만 토큰 길이 때문에 당장 대체는 못하겠더라.
한번에 30만토큰 정도는 소화해야 300-400페이지짜리 문서 내에서 유기적으로 답변이 가능한데 Qwen은 4만 토큰이 최대라서 뭐 할 수가 없네.
토큰 작은 문서들은 잘 하더라.
근데 그거는 토큰 제한 때문에 어쩔 수 없는거고, 기왕 설치한 김에 물어보는데 답변 수준이 최소한 제미니2.5플래시 또는 프로에 근접하는 것 같다.
제미니 공홈 자주 써서, 거기서 물어본 것들 복사해서 qwen한테 질문하면 답변 구조도 유사하고, 추론하는거나 뱉어내는 답변량도 비슷해.
특히 프롬프트 따라 진행하는 것도 잘해서, 업무 상 필요해서 만들어둔 계산 프롬프트에 따라서 몇개 계산시켜 봤는데 모두 정답 나온다.
제미니처럼 인터넷검색이랑 문서분석툴 같은 것 붙여주면 제미니를 로컬로 풀지 않는 한 이만한게 있을까 싶네.
토큰 생성속도도 엄청 빨라서 7900xtx 쓰는데 제미니2.5플래시가 답변 뽑는 속도만큼 뽑힌다.
엔비디아는 더 빠르겠지?
4만토큰 꽉 채웠을 때 답변 뽑는데 얼마나 걸림? - dc App
4만토큰 근처 채우기도 어렵네. 지금 하나 물어보고 받은거 트래커 올려줄께. 38.49s | Req: 2308 (Ø 1154.00) | Resp: 3169 (Ø 1584.50) | 38.03 T/s
ㅎㄷㄷ 하드웨어 스펙이 어떻게 돼? - dc App
I5 11세대 노트북에 16GB램, 7900XTX를 egpu로 물림
써봤는데 답변이 너무 불안정하던데
Qwen3-30B-A3B-UD-Q4_K_XL.gguf <- 버전 이걸로 써봐. 나도 잼2.5플 정도는 되나 싶어서 이틀째 써보는 중
https://huggingface.co/unsloth/Qwen3-30B-A3B-128K-GGUF
요건
12만 토큰인데요... 토큰 모자른경우라면 써보심이? 물론 vram을 미친듯이 먹겠지만요 ㅎㅎ
qwen3 32b를 좀 써보긴했는데, 코딩관련된거 리즈닝이 너무 오래걸리고 (qwq때부터 그랬음...) 그렇다고 정확도가 아주 좋진않아서요. 그냥 제미나이 2.5 씁니다;;;
24GB 밖에 안되서 겁나는데 함 써보겠습니다. RAG가 주요 목적이라 토큰 길 수록 좋음. 전 코딩은 안해서 업무 관련 몇가지에선 제미니급 성능 나오는 것 같아서 기대하면서 써보는 중이에요.
rag만 생각하시는거면... 뭐 물론 써보셨겠지만, gemma3는 어떻던가요? 짧게 쓰기엔 괜찮은 느낌이긴했습니다만...
젬마3 27B QAT 버전도 역시 RAG용으로 써봤지만 역시 안되서 지웠어요. 기준이 항상 제미니라서 그것보다 한참 못한 것 같은 느낌이었어요.
혹시나 했는데 역시 짧은 질문에도 18만토큰으로 오버플로우 남. 고마웠어요.
그렇다면... 아싸리 /nothink 옵션 줘서 리즈닝 하는걸 꺼버리시는건? qwen쪽 리즈닝이 토큰 너무 먹어서요.
로컬 모델 12b밖에 못돌려서 눈물난다...
이거 적당한 글카에 램만 32기가 되면 cpu로도 잘 돈대.
난 2070s 8gb에 32램이라 8b 돌려보는데 은근 재밌음 ㅌㅋㅋㅋ 느리지만 아예 못쓸수준도 아니고 RAG 구현해서 쓰는데 은근 좋아 물롬 이게 모드 로컬에서 돌아간다는게 너무 매력적이야