프리필은 435대로 알고 있음
int4 int8섞인 4비트퀀트, reap아닌 unpruned.
스샷에 보이는것처럼 4인 혹은 4개 에이전트 굴릴시
최대 112토큰/초, 평균 요청당 28토큰/초
__________________
아래는 같은 glm5.2모델 굴릴 때의 콜드 프리필, 웜 프리필에 대한거랑 대략적인 컨텍스트별 성능저하에 대한 코멘트
mlx보다 ctx길이에 따른 디코딩, 프리필 성능이 0 ctx의 성능을 훨씬 오랫동안 유지하고 급격하게 1/4토막 디코딩을 보기 힘듦
또 mlx 쪽은 동시요청 성능이 거의 못 쓸정도로 떨어지고.
_______________
예시로 Deepseek v4 flash를 dgx spark 2대에서 돌릴 때
동시요청 1~3개일 때
0컨텍스트부터 99만 컨텍스트일때의 프리필, 디코딩 벤치 캡쳐
1개 요청시 |... 디코딩 .....|...프리필
..........0컨텍 50토큰/초 | 1400토큰/초
...8000 컨텍 37토큰/초 | 2100토큰/초
.32000컨텍 31 토큰/초 | 2000토큰/초
64000컨텍 33 토큰/초 | 1900토큰/초
128000컨텍 31 토큰/초 | 1900토큰/초
26만, 52만 컨텍도 디코딩 비슷,프리필은 1700, 1300대
스파크 이야기 나올 때마다 개인로컬장비 가용성 중에 m5u와 자주 비교되면서 10월에 맥스튜디오 울트라 나올텐데 설거지다 이런이야기가 자주 나와서 덧붙임.
m5u 512라면 최소 가격이든 메모리 용량이든 체급을 맞추고 비교해야한다고 봄
_____________
m3u의 glm5.2 벤치를 보면 프리필 150토큰/초, 디코딩 mtp시 24토큰/초 까지는 봤음.
512기가 기준, 스파크 4대면 4대가 필요할정도의 llm모델을 대상으로 effective 메모리 대역폭은 273 x 3.2~3.3정도로 850~900 쯤됨 (m3u 512기가의 800기가 대역폭과 디코딩 비교시)
____________
이게 m5max 기준으로 m5u마멋으로 개선이 되면 컨택스트가 짧을 때 + 1개 요청시에는 4대 스파크보단 높을텐데
64k컨텍스트 이상 혹은 2~4개 동시요청 조건이면 스파크4대가 2배이상의 프리필을 보여줄걸로 예상. 디코딩은 그정도 차이는 아닌데 위 두 조건이 겹치면 스파크가 좀 나을듯함
다만 이건 스파크 편향적인 시각이라서 공정한 비교가 아닐수도 있음. 맥스튜 실 사용자는 더 업데이트된 정보가 있을거고
_______________
난 스위치도 따로 샀지만 최근 스위치 없이 4대를 케이블4대로만 연결해서 일부 노드거쳐서 통신하는 경우에도 성능저하가 의외로 크지 않는 이야기가 있어서 좀 기다리면 스위치 없이 4대도 쓸만할수도 있음
로컬 가성비만 따지면 똥망
내 개인구매 이유는 내가 생성한 데이터 학습 막는데에 최우선이라 산거라 로컬 중에서는 이 가격대에 중급이상 모델 돌릴수 있는 대체제가 없음
m5u 512가 25~30k usd도 예상되기도 하고 아직 나오지도 않음
성능도 잘 나오고 가격이 싸면 선택지가 생기기에 진심 잘나오면 좋겠음
한 12대사서 fp16해보면 안되겠노 - dc App
fp16은 한 16대 있어야 하지 않을까 싶네. 소수 유저들이 있긴하던데 glm5.2는 fp8을 8대로 돌렸다던가 다른 모델인가 헷갈리네