내가 연구자가 아니라 정말 최신 동향은 모르겠는데

quantization은 지금 딥러닝 모댈들은 보통
bf16, fp16으로 실수를 표현하는데
얘를 아무리 줄여봤자 16배밖에 못줄인다
최소한 한 숫자를 표현하는 데에 1비트는 써야 함
글애서 이건 물리적인 한계가 존재함

sparsify는
메모리는 많이 줄일 수 있다만, 곱셈 연산이 sparse matrix에서 그렇개 만이 빨라지지 않는다. 하드웨어 발전이 만이 필요할 거 같음. 하드웨어적 한계가 존재함 아직은

모델 자체를 유의미하게 줄여야 하는데
나에 생각으론 speculative decoding쪽이 현재는 되게 promising한 방향인데 암튼
근데 요건 student model을 만드는 일이라 학습 코스트가 다시 든다는 단점이 잇다.
글치만 엄청 잘 댈 수 이쓸 거라고 생각함

- dc official App