계속 이렇게 같은짓 반복함,
개빠간데 이거 맞아..?
무한 루프걸림 내 시스템 5080이고 램 64기가인데
처음에 렉걸리고 너무 안되서 Number of layers to force the experts into CPU. Saves
VRAM and can be faster than partial GPU offload. Not
recommended if the model fits entirely in VRAM.
이설정을 30으로 최대로 올렸더니 답변 하는데 1초만에 바로바로되긴 하는데
성능이 저러네..?
가사 번역시킬때도 4번은 시켜야 원하는대로 뽑아주더라ㅜ ㅠ
그냥 이미지 인식 못하는 16GB 짜리로 다시 설치해서 사용하면 괜찮을까?
LM 스튜디오로 했어 OLLAMA 어렵다고 GPT가 이거 추천해서-_-;
헤르메스나 오픈클로 물려서 쓴다던데 그것들은 또 뭔지..앞으로 가야할길이 참 먼데
속도 빨라진건 기쁜데 내가 설정한 셋팅때문에 저래 멍청이가 된건지 궁금해서
모델에 하자가 있나본데
해당 댓글은 삭제되었습니다.
클로드코드로 간단한 스프레드시트 용 스크립트 만들고 있는데 토큰 맨날 부족해서 결제하고도 5시간 기다리는거 스트레스 받아서 llm 처음으로 사용해보는 중인데 개발자 직접 댓글 달아줘서 고마움! 근데 지금 내사양에서 세팅 잘 만지면 제대로 동작하는거 맞아..? 처음에 질문하고 답변받는데 1분씩 걸리더라구..
@맥미니 아 못돌리는거 맞구나, 텍스트전용 16기가 짜리도 꽉차서 안되려나..?
@맥미니 엣 양자화 하면 돌아가는 거 아냐?!
@고닉치와 나도 그런줄 알고 supergemma4-26b-abliterated-multimodal-gguf-4bit 이거 다운받았는데 택도없다가 본문에 나온 세팅 1~30까지하는거 30으로 했더니 엄청빨리 작동은 되는데 바보가됨
@맥미니 젠장 4로 돌아가는 줄 알고 있었는데 어쩐지 이상하더라 ㅠㅠ
@맥미니 3bit 버전도 나오나요..? 이거 쓰려면 5090 24gb 버전 으로도 여유램 간당해서 벅차겠네..?ㅠㅠ 5090 뽐뿌오는구먼
해당 댓글은 삭제되었습니다.
근게 그 컨텍스트 제한 낮출수록 얘가 내가 이전에 질문한거 기억못하고 처음 질문받는것처럼 대답하는거 맞아?
@글쓴 ㅇㅇ(121.124) 어라 그사이에 답글이 ㅋㅋ 세션 컨텍스트가 아니라 응답 토큰 얘기였어 ㅋㅋ 그리고 세션 컨텍스트 낮추면 그 질문은 맞아. 로컬을 쓰려니 압축 방식도 여러가지있나보더라.
@고닉치와 최대로 높여도 돈주고 쓰는 상용모델들보다 기억력 떨어지네..난 로컬 llm이면 내컴퓨터니까 그런거 제한없어지는 줄 알았오 ㅠㅠㅠ빠가
@글쓴 ㅇㅇ(121.124) 상용모델이랑 비교하면 어쩔수없긴해... ㅋㅋ 그럴 수 있지!
컨텍스트길이 뺨을 맞았구나