1. GDDR7와 DDR5의 기본 차이
  • GDDR7 (GPU VRAM):
    • 대역폭: 약 1.8TB/s (RTX 5090 기준, 32GB, 28~32Gbps/pin).
    • 지연 시간: 높음 (GPU 병렬 작업 최적화).
    • 용도: GPU에서 빠른 데이터 접근.
  • DDR5 (시스템 RAM):
    • 대역폭: 약 80~100GB/s (64GB, 6400MT/s, 듀얼 채널 기준).
    • 지연 시간: 낮음 (CPU 작업 최적화).
    • 용도: 시스템 전반 데이터 저장.
VRAM 부족 시 DDR5로 데이터를 오프로드하면, 대역폭 차이(1.8TB/s vs 100GB/s, 약 18배)와 PCIe 병목(예: PCIe 4.0 x16, 32GB/s)이 성능에 영향을 미칩니다.



FP16 = 연산력  = 토큰 생성 속도 증가 


TPS = 초당 토큰 생성 속도 = 답변 빨라짐


로컬로 32B 모델 뭘 사야 가성비 있을까 계산하다가 황회장의 마음을 이해함


5090이랑 H100이랑 연산력이나 TPS는 비슷한데 VRAM 이것만 56GB 더 얹히고 가격이 4.5배가 됨.  황회장이 왜 5090을 안만드는지 알겠어. 


삼성은 그냥 GDDR7 램 이것만 따로 PCIE 추가 가능하게 만들어서  GPU랑 소프트웨어 동기화 가능!! 이렇게  파는게 더 효율적인거 같은데 (컴퓨터 일반 RAM 추가하듯이) 


왜 안만듬? 개인이나 기업시장이나 저게 더 효율적일텐데?  데이터가 커질수록 램은 다다익선인데 컴퓨터 일반램하고는 차이가 너무 큼 VRAM의 부족을 일반 RAM에게 넘겨도


저 짤처럼 3080TI,9070XT 처럼 몇기가 부족으로 성능이 40~50% 저하됨. 9070XT 32GB 버전은 램만 증가하고 일반성능은 똑같이 넣은거,가격도 .  만약 삼성이 PCIE에 GDDR7 램을


추가해서 판매한다면 막말로 5090에 램 부족분만 54GB 추가하면 얼추 서버급 성능이 나오는거임. (완전 같지는 않겠지)


(댓글 보고 추가함 기존 그래픽카드랑 만약 확장카드 만들어서 VRAM 연결해도 병목현상때문에 효율이 안좋다고함. 병목 % 는 소프트웨어로 얼만큼 최적화하고 하드웨어적으로 보완했는가에 달렸고. 데이터 크기의 상당부분이 그래픽카드쪽 메모리에 있으면 그만큼 병목 적어짐. 예를 들어 9070XT 같은 경우는 VRAM 4GB 부족으로 40% 성능저하가 왔는데 4GB를 채워서 20GB 만들면 데이터가 대부분이 그래픽카드쪽 VRAM이 처리해서 병목 줄어듬.  근데 만약 병목이 너무 심하면 그냥 그래픽카드 하나 더 사서 멀티 기능으로 부하 나누는게 나을거 생각)