https://github.com/ggerganov/llama.cpp
llama 모델을 cpu+ram으로 구동할 수 있게 해주는 llama.cpp 프로젝트가 요며칠 많은 개선이 있었음.
답변 생성 속도도 매우 빨라졌고, (개발자가 의도한 부분은 아니지만) 일부 환경에서 메모리 사용량이 대폭 줄기도 했음.
가장 핵심은, vicuna 모델도 지원하기 시작했다는거.
직접 써본 결과, 기존 라마 알파카랑은 비교 자체가 안될 정도로 답변 퀄리티가 높음. 공개 당시에 수치상으로도 그랬지만. 그리고 기존 llama의 컨텍스트가 512이던걸 2048까지 늘리면서 대화 기억도 매우 오래 함.
개인적으로 알파카 13b, 30b 갖고놀면서도 로컬 llm에 회의적이었는데 비쿠나는 확실히 다름. 체.감상 gpt-3.3정도는 되는 느낌임.
llama.cpp가 업데이트도 활발하고 개선될 여지가 아직도 한참 남았다고 하니까 더 기대해봐도 좋을듯
여기 애들은 라마 떡밥 식고 크게 관심 없길래 홍보 하고 간다
판도라의 내용물은 증발하지 않았다 ㅎㅎ
3.5가 무료랴서 그이상이 필요하다. 3.7정도
무료긴 하지만 로컬은 아니잖아
비쿠나 30b만 돼도 3.5는 잡을듯. 얼마나 속도 개선이 가능할지가 관건이고..
3.5이상만 찍어도 무조건 쓸듯
3.5이상이면 무조건 씀 나도
검열 없음. 그냥 마약같은거 물어봐도 답해줌
근데 라마로 뭐함?
비쿠나로 태번 가능?
그쪽은 내가 잘 모름
비쿠나에 하이에나 붙으면 그때야말로 황금시대가 열릴듯
라마 이거 토렌트는 받았는데 입문가이드같은거 없을까..?
대충 비주얼스튜디오 2019 깔고 깃헙에 나와있는 cmake 명령어 스튜디오 콘솔로 실행하면 됨
고마워 윈도는 그래픽카드가 구리고 m2 맥 있는데 맥에서 한번 해봐야겠네... m2 맥이 낫겠지?