https://github.com/ggerganov/llama.cpp



llama 모델을 cpu+ram으로 구동할 수 있게 해주는 llama.cpp 프로젝트가 요며칠 많은 개선이 있었음.

답변 생성 속도도 매우 빨라졌고, (개발자가 의도한 부분은 아니지만) 일부 환경에서 메모리 사용량이 대폭 줄기도 했음.

가장 핵심은, vicuna 모델도 지원하기 시작했다는거.

직접 써본 결과, 기존 라마 알파카랑은 비교 자체가 안될 정도로 답변 퀄리티가 높음. 공개 당시에 수치상으로도 그랬지만. 그리고 기존 llama의 컨텍스트가 512이던걸 2048까지 늘리면서 대화 기억도 매우 오래 함.

개인적으로 알파카 13b, 30b 갖고놀면서도 로컬 llm에 회의적이었는데 비쿠나는 확실히 다름. 체.감상 gpt-3.3정도는 되는 느낌임.

llama.cpp가 업데이트도 활발하고 개선될 여지가 아직도 한참 남았다고 하니까 더 기대해봐도 좋을듯

여기 애들은 라마 떡밥 식고 크게 관심 없길래 홍보 하고 간다