전문가 혼합(MoE) 아키텍처는 스파스 라우팅을 통해 대규모 언어 모델(LLM)의 높은 추론 비용에 대한 일반적인 솔루션을 제공하여 방대한 매개변수 수에 대한 대가로 더 빠르고 정확한 모델을 제공합니다. 예를 들어, SwitchTransformer-c2048 모델은 1.6조 개의 파라미터를 가지고 있으며, 효율적으로 실행하려면 3.2TB의 가속기 메모리가 필요하기 때문에 실제 배포가 어렵고 비용이 많이 듭니다. 이 백서에서는 이 메모리 문제에 대한 해결책을 QMoE라는 새로운 압축 및 실행 프레임워크의 형태로 제시합니다. 특히, QMoE는 확장 가능한 알고리즘으로 구성되어 있으며, 비압축 실행에 비해 런타임 오버헤드가 거의 없는 효율적인 엔드투엔드 압축 추론을 위해 맞춤형 GPU 디코딩 커널과 공동 설계된 사용자 지정 형식으로 수조 개의 파라미터 MoE를 파라미터당 1비트 이하로 정확하게 압축합니다. 구체적으로, QMoE는 1.6조 개의 매개변수 SwitchTransformer-c2048 모델을 단일 GPU에서 하루 이내에 약간의 정확도 손실만으로 160GB(20배 압축, 매개변수당 0.8비트) 이하로 압축할 수 있습니다. 이를 통해 처음으로 이상적인 비압축 추론에 비해 5% 미만의 런타임 오버헤드로 NVIDIA A6000 4개 또는 NVIDIA 3090 8개 GPU가 장착된 단일 서버와 같은 저렴한 상용 하드웨어에서 1조 개 파라미터 모델을 실행할 수 있게 되었습니다.