말 그대로임


뭐하는 물건인지 소개 시작



엔비디아에서 제시하는 공식 사양은 이렇게 됨


실제로 분석한 사양은

CPU - 모름 /proc/cpuinfo에는 ARMv8 Processor rev 0라고 적혀있긴 함

GPU - Compute Capability 7..2 Volta 512 Core(5.5 TFLOP)

Tensor Core - 4x4 행렬 연산, INT8, FP16만 지원함(Turing Tensor Core에서 INT4 연산만 제외한거라 보면 됨)

NVENC - AVC(H.264), HEVC(H.265) VP9

NVDEC - AVC(H.264), HEVC, VP9, VP8


RAM - DRAM + VRAM LPDDR4X 256bit 32GB

사실 이게 할말이 제일 많음

일반적으로는 DRAM과 VRAM이 별개로 나눠지는데 얘는 그 두개가 합쳐져있음

이건 장점일수도 있고 단점일수도 있는데, swapiness를 최대로 맞춰놓고 VRAM을 최대한 끌어쓰는게 가능함(28GB까지는 해봄)

DRAM으로 할당된 RAM은 SWAP을 사용할 수 있지만 VRAM으로 할당된 RAM은 SWAP을 사용할 수 없음


eMMC - 32GB - 있긴 한데 졸라 느림 PM981a 하나 끼워서 줄테니까 그거 쓰셈


장점

VRAM이 큼

DRAM+VRAM 32GB이긴 하지만 일단 잘 할당한다면 3090보다 VRAM이 큼


CPU보다는 추론속도가 빠름

GPU 달려있어서 당연한거긴 함


사용전력이 적음

애초에 임베디드 목적으로 설계된거라 최대 출력모드(MAXN, Jetson_clock)으로 해도 50W까지밖에 안먹음


PCIe가 달려있음

그래픽카드를 꽂을 수도 있긴 한데 75W이상 먹는걸 꽂으면 보조전원 먹여도 지혼자 죽음

SAS RAID 컨트롤러나 USB 3.2같은거 꽂아서 쓰긴 괜찮음



단점

GPU가 Volta 아키텍처임

Tensor Core가 V100(Volta)와 RTX 20(Turing) 시리즈의 사이에 개발된 거라 INT8, FP16를 지원하지만(V100은 INT8 지원 X),

INT4는 지원 안하고 행렬연산이 INT8, FP16 4x4로 제한됨



사용 용도


첫번째는 각종 인공지능 추론용

이게 제일 정석임

애초에 이렇게 쓰라고 나오기도 한 제품군이기도 함


돌려본 것들은

Stable diffusion - 1.84it/s(xformers 적용, FP16)

LLMs(OPT-6.7B, GPT-J-6B, LLaMA 6B)

ASR(Whisper Large-v2)

이정도임


그냥 리얼타임을 기대하지 않고 넉넉하게 시간을 줘도 되는 것들이라면 그냥저냥 쓸만함

일단 VRAM이 큰게 장점이라 큰 LLMs만 아니면 일단 밀어넣고 보는게 가능함


두번째는 실시간 트랜스코딩 서버로 쓰는거임

어쨌든 전력 소모는 상당히 적은편이고 NVENC와 NVDEC가 달려있으니까 Jellyfin같은걸 올려서 영상 트랜스코딩 서버로 쓸 수 있음


그리고 질문 몇개 받은거

Q1. 몰루아카 돌아감?

공식적으로는 지원 안함. 다만 QEMU가 호환되도록 만드는건 가능할거임. 기본적으로 기존 GPU에 CUDA와 API가 동일하니까


Q2. 운영체제는 뭐씀?

NVIDIA에서 공식으로 제공하는 Jetson Linux를 사용함. 우분투 20.04 기반임

Pytorch나 Tensorflow는 직접 컴파일 해서 쓰는게 편함(torch.distributed 안쓰면 상관 없음)


파는 이유

암템을 너무 많이사서 재정이슈

더 궁금한거 있으면 댓글로 질문 ㄱㄱ


택포 80