이렇게 용량이 무식한거지? (Kimi k2.5 이런거)
물론 기술이 발전하여서 소규모 용량에서도 지능이 이전 구형모델보다 높을 수 있는 거고 대신 잡다한 지식이나 정보, 문학들 정보가 많이 사라져서 글쓰기 문체라든지 이런 정보가 약할수 밖에 없는 건 알고있음
용량이 많을수록 지능, 지식보유량을 떠나서 소설이나 문체, 글쓰기 수준도 상당해진다는 걸 알고있고
그런데 수학 과학쪽은 어느정도 정형화된 문서나 논문, 데이터자료만 가져오면 테라바이트급까진 요구안해도 되지 않나?
왜 이렇게 초거대한 용량을 자랑하는 지 모르겠음
데이터들을 무지성 가져오지않고 함축시켜서 고급데이터만 넣는게 거대 LLM 개발회사들(오픈웨이트포함) 의 주된 업무이긴 한데 왜 이렇게 용량이 큰 지 모르겠음
메타에서 저작권위반하면서까지 소설 이런것들 모은게 2TB급이라고 들었는데 거기서 압축하면 크게 용량을 유지할 필요가 있나?
사전학습용 대규모 언어모델 코퍼스데이터셋은 기본 수백 수천 테라바이트임 - dc App
그리고 키미 k2.5는 600기가임 - dc App
와 시발.. 근데 그거 좀 압축하고 좀 데이터 쳐내는 기술 적용해도 그정도인가..
@트럼프급전함 일단 0에서 말은 할줄아는 llm만들때에는 무작정 최대한 많은 데이터를 때려넣어서 학습하는게목적이라 - dc App
아 tb수준인줄 알았네 ㅈㅅ 그럼 oai 제미니 클로드같은 건 파라미터 규모 추산은 안되도 얘네들은 1000b단위로 굴리는 건가 신기하네
@밈차도구 키미 원본은 1t. 작은건 4bit
요즘은 멀티모달이라 단순텍스트말고 다양한게 존나게들어있지않을까싶음
아 그렇다 해도 그림 관련 ai들은 압축 잘해서 flux도 32b로 가능하던데 그렇게 압축시켜서 적용하는 건 무리인가
개인 서버만 해도 좀 큰 규모면 100TB 그냥 넘어가는데 1-2TB면 작다는 생각밖에 안 들지
와... 100TB나 쓴다고? 코딩 빌드한거 출력해도 많아도 200GB에 리소스 이런거 해도 1TB아님?
정형화된 문서만으로는 '모든 단어'와 '모든 표현'을 배우지 못해서 일반화 능력이 형성되지 못하고 정상적인 응답을 내지 못함
그리고 모델에는 텍스트가 저장되지 않음 그걸 학습할 뿐
학습만 하는 건 아는데 문학 이런 것도 데이터로 넣어야 하는것도 알고있음 그런데도 TB급으로 쓰는게 신기해서 그럼
@트럼프급전함 학습 데이터는 페타바이트급 아닌가
뜨아아... PB급이야? 메타가 토렌트로 받았던게 다시 알아보니 87TB급이던데... 그 정도 용량이면 인정이지
llm모델 용량이 뭐 위키백과 다운로드 해둔게 아님...
모델 용량은 파라미터 개수랑 관련 있는거지 거기에 먹이는 데이터 크기랑은 직접적으로는 관련없음 물론 파라미터 크기와 데이터셋 크기가 비례하는 편이지만 메타에서 데이터셋 만든거랑 모델 크기랑은 완전 다른 이야기임
@aa 응 그건 알겠는데 왤케 크나 싶어서 물어본거 T단위급은 최대한 끌어모아서 압축한거고 LLM회사들은 그럴만한 여력이 되고 성능을 최대로 유지시켜야 하니까 그렇게 하는 건가
테라바이트가 그렇게 큰것도 아님 요즘은 개인용 컴퓨터에도 달아놓는게 1테라 하드 아님?
그건 그렇지 기업단위에서 쓰는거랑 개인이 쓸수있는 거랑 차이는 있겠지만 내가 어쩌면 질문을 잘못했을지도
예전에 인간의 뇌 용량을 컴퓨팅으로 환산하면 2~3PB (1PB=1024TB) 정도 된다는 글을 본 거 같은데 그런 거 생각하면 적은 편 아닐까 물리적 크기로 봐도 30TB 하드 하나도 나오는데
그거 편차가 있지않나? 너무 러프하게 잡아서 500TB급 소리도 나오단데 별개로 확실히 가성비는 있긴 하다