오픈소스로 풀린다는 가정하에 능력자들이 로컬화+경량화까지 해준다면 rtx 그래픽카드 1개로 구동이 되려나 망상이 좀 껴있긴 한데 라마3+비트넷 로컬ai 모델이 rtx 글카로 돌아가면 ㄹㅇ 혁명적일거 같음 - dc official App
양자화 하고 램만 어느정도 빠방하면 느리더라도 돌릴방법자체는 나올듯 ㅋㅋ Vram에 올려서 돌리기는 가정집에선 힘들지 않을까
누군가는 해낼거라고 믿음. 내가 할줄 몰라서 아쉬울뿐 - dc App
100b 이하로 나온다면, llama.cpp, kobold.cpp에서는 2비트까지 양자화된 모델을 돌릴 수 있고, 일부 레이어를 CPU에 돌릴 수 있게 해서 느려도 어떻게든 돌릴 수 있을 것 같긴 합니다.
grok-1 처럼 300b+ 로 나오면 개인이 돌리긴 매우 어렵겠네요.
ㄴ정확한 소스인지는 모르겠지만 AI타임즈에서 140B일거라고 하더라 ㅇㅇ 말한대로 2비트 양자화로 어찌어찌 몸비틀어서 찍먹해볼 수준은 될거같음
가능성이 있긴 있구나 정말 다행이다
ㄴ램 64긱은 필요할거임
vram이 아니라 그냥 ram 64gb면 좋겠지만 세상이 그리 만만할리가 없지. 엔비디아 경쟁자가 마땅치가 않은게 너무 아쉽다 - dc App
ㄴㄴ 그냥 ram 말하는거 맞음. 120B 2bit 양자화 모델이 GPU 오프로드 없이 램 45기가인가 먹음. GPU 달려있으면 Vram이랑 램 같이 사용할텐데 아무튼 140B면 존나 큰건 맞아서 램 64기가는 필요하다는 소리 보통 가정집에서 64기가를 쓰진 않잖아
물론 성능저하와 속도는 감안해야하겠지
이런거 전혀 몰랐는데 이번에 배워간다 고맙다 지금 램 32gb에 rtx 3060 쓰는데 로컬 ai 수준 많이 올라오면 바로 업그레이드 할거임 - dc App
램살돈으로 서버대여해서 돌리는것도 방법이고. 그게 더 빠르고 쌀듯 ㅇㅇ 방법은 많음 140B로 GPT4급이라는게 안믿길뿐..
gpt4에 못미쳐도 로컬로 검열만 피해도 대단하다고 생각함. 이번에 메타가 큰일 해주길 - dc App
비트넷은 잘 뽑이기만 하면 특화 GPU가 나오기보다 일반 GPU용도로 쓰일거같다는 예감이 든다
그렇게 되면 참 좋은게 괜히 칩 따로 안만들어도 되니까 모두가 더 편해짐 - dc App
gb200같은 GPU들은 사전학습위주로 쓰이는 세상이 올지도 몰라
캬