- GDDR7 (GPU VRAM):
- 대역폭: 약 1.8TB/s (RTX 5090 기준, 32GB, 28~32Gbps/pin).
- 지연 시간: 높음 (GPU 병렬 작업 최적화).
- 용도: GPU에서 빠른 데이터 접근.
- DDR5 (시스템 RAM):
- 대역폭: 약 80~100GB/s (64GB, 6400MT/s, 듀얼 채널 기준).
- 지연 시간: 낮음 (CPU 작업 최적화).
- 용도: 시스템 전반 데이터 저장.
FP16 = 연산력 = 토큰 생성 속도 증가
TPS = 초당 토큰 생성 속도 = 답변 빨라짐
로컬로 32B 모델 뭘 사야 가성비 있을까 계산하다가 황회장의 마음을 이해함
5090이랑 H100이랑 연산력이나 TPS는 비슷한데 VRAM 이것만 56GB 더 얹히고 가격이 4.5배가 됨. 황회장이 왜 5090을 안만드는지 알겠어.
삼성은 그냥 GDDR7 램 이것만 따로 PCIE 추가 가능하게 만들어서 GPU랑 소프트웨어 동기화 가능!! 이렇게 파는게 더 효율적인거 같은데 (컴퓨터 일반 RAM 추가하듯이)
왜 안만듬? 개인이나 기업시장이나 저게 더 효율적일텐데? 데이터가 커질수록 램은 다다익선인데 컴퓨터 일반램하고는 차이가 너무 큼 VRAM의 부족을 일반 RAM에게 넘겨도
저 짤처럼 3080TI,9070XT 처럼 몇기가 부족으로 성능이 40~50% 저하됨. 9070XT 32GB 버전은 램만 증가하고 일반성능은 똑같이 넣은거,가격도 . 만약 삼성이 PCIE에 GDDR7 램을
추가해서 판매한다면 막말로 5090에 램 부족분만 54GB 추가하면 얼추 서버급 성능이 나오는거임. (완전 같지는 않겠지)
(댓글 보고 추가함 기존 그래픽카드랑 만약 확장카드 만들어서 VRAM 연결해도 병목현상때문에 효율이 안좋다고함. 병목 % 는 소프트웨어로 얼만큼 최적화하고 하드웨어적으로 보완했는가에 달렸고. 데이터 크기의 상당부분이 그래픽카드쪽 메모리에 있으면 그만큼 병목 적어짐. 예를 들어 9070XT 같은 경우는 VRAM 4GB 부족으로 40% 성능저하가 왔는데 4GB를 채워서 20GB 만들면 데이터가 대부분이 그래픽카드쪽 VRAM이 처리해서 병목 줄어듬. 근데 만약 병목이 너무 심하면 그냥 그래픽카드 하나 더 사서 멀티 기능으로 부하 나누는게 나을거 생각)
PCIE 속도는 안보이냐
내가 쓴건데 내가 모를까봐? 싸구려 보드 아니면 PCIE 16 2개,3개 달려있어
2개 3개 이런소리 하는거 보니 아직도 모르는거 같은데
뭔소리하는지 설명좀? 나는 연산력은 보존하되 소프트웨어로 vram 공유해서 같이 쓰자는건데? 지금 그래픽카드 멀티 지원 안하면 소프트웨어로 사용하듯이
니가 ai로 생성한걸로 추정되는 글에도 이야기가 적혀있음. 대역폭 차이로 인해 데이터를 오프로드 하면 병목이 생김 pcie 슬롯을 사용하여 옆에 존나게 빠른 gddr7을 꼽아도 pcie 4.0 기준 32gb라는 대역폭에 걸린다고 적혀있잖아 대역폭이 개병신이라 연산처리가 32gb 가 한계라고, 차라리 cpu와 붙은 메모리쪽으로 오프로드 하면 대역폭이 2채널만으로 80gb 가 나오는데 pcie 에 대역폭이 나오지도 않는 gddr7을 꼽는거 자체가 개병신짓이란거임
ㅋㅋㅋ 뭔 소리하나 했더니 그소리함? 내가 그것도 계산 안해봤을까? 최근 AMD 쪽에 AI 통합메모리 그걸로 계산 다 해봤거든요? ㅋㅋㅋㅋㅋ
얘는 뭔소릴 하냐 병신아 gddr7을 pcie 4.0에 꼽아놓으면 대역폭이 32gb 라고 시발 gddr이고 hbm이고 시발 걍 대역폭 32gb 짜리라서 ddr4 메모리보다 못한 개병신을 만드는거라고
시발 지금 5.0 시대잖아 나는 구형이고
시부랄럼아 5.0이라 해도 2배 64gb 인데 가정용 컴퓨터 2채널 cpu 메모리에 오프로드해도 80gb 대역폭이 나오는데 뭣하러 64짜리에 올리냐고 200만원에 epyc 9654 QS cpu 사서 12채널 ddr5 쓰면 대역폭이 500gb 가 나오는데 차라리 그게 낫지
RTX 5090 (32GB GDDR7) 결합: TPS 32B: 45 (GPU 단독). PCIe 5.0 x16 (64GB/s) 병목 없음 → TPS 45 유지. 12채널 DDR5 영향: 메모리 대역폭 500GB/s로 RAM 오프로드 속도 개선 (30~40% 저하 대신 20~25% 감소 가능). 예: RX 9070 XT 16GB TPS 14 → 17~18 추정 계산 해봤다니까? 넌 계산 제대로 해보고 ㅈㄹ하는거?
야 근데 내가 컴퓨터 사양 알아서 계산해봣는데 총 레인이 40개야 이론상 칩셋 4개,M.2 4개 그래픽카드 16개, 다른 그래픽카드 16개. 소프트웨어로 VRAM 공유하면 가능해. 근데 그래도 그래픽카드 자체 VRAM 성능은 못내지만 4GB 부족으로 40% 성능저하 오는것보단 나을꺼 같은데
4080오너인데 14b는 너무 작고 32b는 너무 큼 양자화가 의미가 있을까 싶은데 32b면 3090 병렬이면 할만 할지도?
vram 높은게 개깡패야
어제 qwq 32b 써봤는데 그게 딥시크 671b 모델하고 경쟁모델이거든. 근데 32b 모델인데 수학쪽은 잘풀더라. 수능 수학 끝자리 2개 주관식 던져줬더니 그록하고 차이 1~2분 났음 . 기업들의 데이터 최적화 능력이 대단해보임 . 몇년 더 참으면 개인도 14b쪽 AI 성능이 엄청 뛰어날수 있어.
삼성·SK하이닉스 같은 메모리 제조사가 GDDR7 PCIe 확장 카드를 만들어도, 실제로 GPU 로컬 VRAM 만큼의 성능을 내주기 어렵고(병목), 기존 GPU 설계와 호환성 문제를 해결하기가 까다롭습니다. 기업이나 소비자 모두가 기꺼이 투자할 만한 “가성비”나 “시장성”을 만들기 어려워서 현재는 그러한 제품이 거의 나오지 않는 것이죠.
지금 PCIE 5.0 까지 나왔잖아. PCIE 6.0도 개발하고 있고. 나는 구형 PCIE 4.0 기준인데 매리트가 없음?
거리 벌어지면 훠ㅓㅓㅓ얼씬 느려지지 않겠노? 왜 AMD가 한 칩에다 CPU GPU를 붙여 APU를 만드는 걸까 그럼 어차피 즈그들은 라라랜드니 해서 대역폭이 뽱뽱하실텐데
요즘유행하는 LLM 자동사냥 어그로 그런건가
해당 댓글은 삭제되었습니다.
엔비디아=그래픽 AMD= 통합메모리 투트랙으로 가고 있던데. CPU 자체에 AI 연산력을 넣고 내장그래픽+시스템메모리 통합으로 활용하는방식. 지금 노트북 라인쪽은 50TOPS 정도 나오는데 그거 토큰 생성량 15개정도 될걸? 애플도 통합메모리쪽으로 가잖아.
Talk is cheap.