전문가 혼합(MoE) 아키텍처는 스파스 라우팅을 통해 대규모 언어 모델(LLM)의 높은 추론 비용에 대한 일반적인 솔루션을 제공하여 방대한 매개변수 수에 대한 대가로 더 빠르고 정확한 모델을 제공합니다. 예를 들어, SwitchTransformer-c2048 모델은 1.6조 개의 파라미터를 가지고 있으며, 효율적으로 실행하려면 3.2TB의 가속기 메모리가 필요하기 때문에 실제 배포가 어렵고 비용이 많이 듭니다. 이 백서에서는 이 메모리 문제에 대한 해결책을 QMoE라는 새로운 압축 및 실행 프레임워크의 형태로 제시합니다. 특히, QMoE는 확장 가능한 알고리즘으로 구성되어 있으며, 비압축 실행에 비해 런타임 오버헤드가 거의 없는 효율적인 엔드투엔드 압축 추론을 위해 맞춤형 GPU 디코딩 커널과 공동 설계된 사용자 지정 형식으로 수조 개의 파라미터 MoE를 파라미터당 1비트 이하로 정확하게 압축합니다. 구체적으로, QMoE는 1.6조 개의 매개변수 SwitchTransformer-c2048 모델을 단일 GPU에서 하루 이내에 약간의 정확도 손실만으로 160GB(20배 압축, 매개변수당 0.8비트) 이하로 압축할 수 있습니다. 이를 통해 처음으로 이상적인 비압축 추론에 비해 5% 미만의 런타임 오버헤드로 NVIDIA A6000 4개 또는 NVIDIA 3090 8개 GPU가 장착된 단일 서버와 같은 저렴한 상용 하드웨어에서 1조 개 파라미터 모델을 실행할 수 있게 되었습니다.
전문가 혼합(MoE) 아키텍처는 스파스 라우팅을 통해 대규모 언어 모델(LLM)의 높은 추론 비용에 대한 일반적인 솔루션을 제공하여 방대한 매개변수 수에 대한 대가로 더 빠르고 정확한 모델을 제공합니다. 예를 들어, SwitchTransformer-c2048 모델은 1.6조 개의 파라미터를 가지고 있으며, 효율적으로 실행하려면 3.2TB의 가속기 메모리가 필요하기 때문에 실제 배포가 어렵고 비용이 많이 듭니다. 이 백서에서는 이 메모리 문제에 대한 해결책을 QMoE라는 새로운 압축 및 실행 프레임워크의 형태로 제시합니다. 특히, QMoE는 확장 가능한 알고리즘으로 구성되어 있으며, 비압축 실행에 비해 런타임 오버헤드가 거의 없는 효율적인 엔드투엔드 압축 추론을 위해 맞춤형 GPU 디코딩 커널과 공동 설계된 사용자 지정 형식으로 수조 개의 파라미터 MoE를 파라미터당 1비트 이하로 정확하게 압축합니다. 구체적으로, QMoE는 1.6조 개의 매개변수 SwitchTransformer-c2048 모델을 단일 GPU에서 하루 이내에 약간의 정확도 손실만으로 160GB(20배 압축, 매개변수당 0.8비트) 이하로 압축할 수 있습니다. 이를 통해 처음으로 이상적인 비압축 추론에 비해 5% 미만의 런타임 오버헤드로 NVIDIA A6000 4개 또는 NVIDIA 3090 8개 GPU가 장착된 단일 서버와 같은 저렴한 상용 하드웨어에서 1조 개 파라미터 모델을 실행할 수 있게 되었습니다.
번역 오류고 원문 a trillion이라서 1조 파라미터 모델 실행가능하다는것 / 추론에만 적용되는거라 학습은 또 다른 문제 / 이런 논문들은 실제 적용했을 때 성능하락 꽤 있는 경우가 있어서 검증 필요함
대충 보고 올렸는데 오류네 수정함
근데 성능하락이 없이 moe라도 저 하드웨어에서 1조개 모델 구동이 가능 하다면 엄청난 비용 절감 아님?
1bit 양자화가 된 버전이라서 가능한거고 moe자체는 기존에도 있던 개념임 아라키스가 써봤다가 생각보다 성능이 안나와서 폐기한 테크닉
그러니까 문제는 기존 sparse MoE도 아리키스에서 써봤다가 생각보다 잘 안돼서 폐기한거로 보이는데 이건 sparse MoE+quantization을 한건데 1조 파라미터 추론이 가능해진 것과 별개로 성능 하락폭이 어느정도일지가 중요한거
그렇구만 만약에 실제 모델에서 성능 하락이 크지 않고 일정하게 유지 된다면 비용 측면에서 꽤 괜찮은 방법일 수 있겠네