5700x3d 6800xt(vram 16gb) ddr4 32gb로 게임만 젼내 하다가
유튭보고 흥미 있어서 오픈클로 lm스튜디오 텔액으렘 연동 시켰거든
로컬 llm모델은 Qwen 2.5 14B Instruct 4양자 모델 올렸고
근데 이쉥키 lm스튜디오에서 직접 채팅으로 질문하고 하면 빠릿하게 잘 돌아가는데
--> 이건 당연하겠지 오픈클로 거치지 않고 로컬 llm만 돌리는거니까
텔액으렘으로 뭐 질문하고 하면 오픈클로를 통하니까 이때부터 너무 오래걸린다.
답변할려고 노력하다가 혼자 뻗기도 함
간단한 인사만해도 답변하는데 1분이상 걸리는 듯
이거 해결방법 아는 횽 있음?
vram 부족 아마 작업관리자 보면 꽉차있을꺼임
vram안에 들어가는 14b인데도 그러나? 그러면 더 작은 모델을 써야하나?
@글쓴 ㅇㅇ(211.53) 나도 동일 Vram rtx5080인데 왠만한 양자화 모델도 vram 딸림. 더 작은 모델 써야하긴하는데 성능이 너무 구림.
꽉차면 그때부터 느려지거나 뻗음
다들 좀 그렇게 말하더라 LM스튜디오 대비 오픈클로가 느리다고 하던데 14B 4bit 양자화 했으면 16vram으론 거의 풀컨텍 가까이 될꺼임. 다른 kv캐쉬같은게 더 쌓이는거같기도 하고 나도 아직 왠지는 모르겠음
내부적으로 좃지랄하는게 많아서 그럴걸
로그 보고있으면 오픈클로가 로컬llm호출을 개긑이 하던데 그게 문제인가?