1ebec223e0dc2bae61abe9e74683727034fca2364b6f87b64ad1d47a95cec2876c33dcd62f6cf53c2a20913cbebb83f479ac927ec3f6fe6aa719462fcc57b71d6b55f1114d70e38112612950f11a49764d3f

프리필은 435대로 알고 있음
int4 int8섞인 4비트퀀트, reap아닌 unpruned.


스샷에 보이는것처럼 4인 혹은 4개 에이전트 굴릴시
최대 112토큰/초, 평균 요청당 28토큰/초


__________________

아래는 같은 glm5.2모델 굴릴 때의 콜드 프리필, 웜 프리필에 대한거랑 대략적인 컨텍스트별 성능저하에 대한 코멘트

0490f719b7826af03ee886e22980756e7ed73395608cbb30f322ac7a8f7add42bbe49b




mlx보다 ctx길이에 따른 디코딩, 프리필 성능이 0 ctx의 성능을 훨씬 오랫동안 유지하고 급격하게 1/4토막 디코딩을 보기 힘듦
또 mlx 쪽은 동시요청 성능이 거의 못 쓸정도로 떨어지고.
_______________

예시로 Deepseek v4 flash를 dgx spark 2대에서 돌릴 때
동시요청 1~3개일 때
0컨텍스트부터 99만 컨텍스트일때의 프리필, 디코딩 벤치 캡쳐

1개 요청시 |... 디코딩 .....|...프리필
..........0컨텍 50토큰/초  | 1400토큰/초
...8000 컨텍 37토큰/초 | 2100토큰/초
.32000컨텍 31 토큰/초 | 2000토큰/초
64000컨텍 33 토큰/초 | 1900토큰/초
128000컨텍 31 토큰/초  | 1900토큰/초
26만, 52만 컨텍도 디코딩 비슷,프리필은 1700, 1300대


1ebec223e0dc2bae61abe9e74683727034fca2364b6f87b64ad6d57a94cec287b2f6ce06337b45bbbff1b52a118df2a154630e87cc22517e4a128f7dac82da49e100a60f11b24f7a4b5c985986fd622f5374




스파크 이야기 나올 때마다 개인로컬장비 가용성 중에 m5u와 자주 비교되면서 10월에 맥스튜디오 울트라 나올텐데 설거지다 이런이야기가 자주 나와서 덧붙임.
m5u 512라면 최소 가격이든 메모리 용량이든 체급을 맞추고 비교해야한다고 봄

_____________

m3u의 glm5.2 벤치를 보면 프리필 150토큰/초, 디코딩 mtp시 24토큰/초 까지는 봤음.

512기가 기준, 스파크 4대면 4대가 필요할정도의 llm모델을 대상으로 effective 메모리 대역폭은 273 x 3.2~3.3정도로 850~900 쯤됨 (m3u 512기가의 800기가 대역폭과 디코딩 비교시)


____________

이게 m5max 기준으로 m5u마멋으로 개선이 되면 컨택스트가 짧을 때 + 1개 요청시에는 4대 스파크보단 높을텐데

64k컨텍스트 이상 혹은 2~4개 동시요청 조건이면 스파크4대가 2배이상의 프리필을 보여줄걸로 예상. 디코딩은 그정도 차이는 아닌데 위 두 조건이 겹치면 스파크가 좀 나을듯함

다만 이건 스파크 편향적인 시각이라서 공정한 비교가 아닐수도 있음. 맥스튜 실 사용자는 더 업데이트된 정보가 있을거고





_______________

난 스위치도 따로 샀지만 최근 스위치 없이 4대를 케이블4대로만 연결해서 일부 노드거쳐서 통신하는 경우에도 성능저하가 의외로 크지 않는 이야기가 있어서 좀 기다리면 스위치 없이 4대도 쓸만할수도 있음



로컬 가성비만 따지면 똥망
내 개인구매 이유는 내가 생성한 데이터 학습 막는데에 최우선이라 산거라 로컬 중에서는 이 가격대에 중급이상 모델 돌릴수 있는 대체제가 없음

m5u 512가 25~30k usd도 예상되기도 하고 아직 나오지도 않음
성능도 잘 나오고 가격이 싸면 선택지가 생기기에 진심 잘나오면 좋겠음


0490f719b7826af03ee984e32980706e5eaa0f9c656d9504d4ea220d895e8a5611e58a41