비록 양자화 개많이 하고, 최대 출력토큰도 16K지만 1T짜리 Kimi K2를 풀컨텍으로 돌려본 Groq vs 양자화했는데도 돌려본 제일 큰 모델이 358B GLM-4.7, 컨텍은 반토막인 131K에 최대 출력토큰도 40K인 세레브라스 근데 지금 Groq은 엔비디아가 기술자 다 뽑아가서 Kimi K2.5도 서비스 못 하는거 같음
회사 마다 모델 서빙하는 기술이 vllm같은게 아니야? 같은 커널 엔진 쓰는게 아닌거야??
쟤들은 독자 칩이라 자기들 칩에 맞게 짜서 돌리지
https://www.aitimes.com/news/articleView.html?idxno=204900
TPU도 그럼
@ㅇㅇ 아하 생유