스테이블 디퓨전 같은 SOTA 비전 모델들은 그래도 4090 정도면 충분히 만족할 만한 성능으로 돌릴 수 있다고 들었는데
언어 모델들은 학습도 아니고 추론하는 데만 VRAM을 상상 이상으로 많이 잡아먹는다던데 마즘?
개인용 PC로 로컬로 돌리기엔 무리인건가
스테이블 디퓨전 같은 SOTA 비전 모델들은 그래도 4090 정도면 충분히 만족할 만한 성능으로 돌릴 수 있다고 들었는데
언어 모델들은 학습도 아니고 추론하는 데만 VRAM을 상상 이상으로 많이 잡아먹는다던데 마즘?
개인용 PC로 로컬로 돌리기엔 무리인건가
언어모델은 추론할 때 KV값이 점점 누적되고, 컨텍스트 길이가 늘어날 수록 메모리를 더 많이 사용하는 것으로 알고 있음 근데 메모리 사용을 극단적으로 줄인 모델들도 나오고 있음
이미지 픽셀 경우의 수보다 텍스트 경우의수가 1조배는 더 많음