gpt-oss 모델은 MXFP4
즉 마이크로 스케일링 정밀도를 사용해서
4비트 단위로 압축을 극한으로 수행함
근데 이게 일종의 범위를 눌러담아 하는거라
전용 가속 경로가 없는 구형 칩에서는
FP16으로 풀어서 돌리는 등의
메모리 낭비가 심했는데
Flash Attention이나 MXFP4 연산 커널들이
일일이 구현해야 하는 번거로움을 덜어주기 위해
허깅페이스에서 연산 커널 라이브러리를 만들어둠
그리고 이 중에는
triton으로 구현한 MXFP4 연산 커널이 존재하고
일종의 에뮬레이션을 통해
미지원 GPU도 성능 손실이나
메모리 낭비 없이 구동할 수 있게 해줌
1줄 요약
transformers 라이브러리로 써라
씨발 나도 도지 500층인데
어차피 8기가로 안되잖아 ㅅㅂ
MXFP4 transformers ㅊㅊ
그래서 십만 프랑짜리 빨간 벽돌집이 얼마나 값비싸진건진 잘 모르겠지만 추천