최근 발전한 quantization이랑 pruning은 아예 없애냐 아니면 형변환만 하냐의 차이만 있을 뿐 실질적으로 압축 방식이 동일함. 정확히는 quantization이 pruning의 일반화임. Gpt3의 경우 매우 undertrained된 모델(파라미터 대비 데이터가 부족)이므로 파라미터 하나당 저장되는 정보가 적음. 따라서 압축도 많이 할 수 있음. 반면 gpt4나 llama같은 모델은 이미 데이터를 충분히 넣었기 때문에 압축 시 성능 저하가 더 클것임을 예상할 수 있음. 가령 llama 7B의 경우 5배정도까지는 큰 성능 저하 없이 양자화로 압축할 수 있음.