1. 멀티코어 기반 인텔 SIMD 명령어 사용으로 행렬 계산
2. NUMA 기반 병렬처리 로드 밸런싱
3. OpenMPI 혹은 fork & pthread 노가다
4. OpenCL 이용해서 저렴한 gpu 및 내장 gpu로 행렬 계산
5. 저렴한 ARM 7시리즈 여러 유닛에서 Neon으로 행렬 계산
6. FPGA로 행렬 다중 계산 알고리즘 구현 후 회로로 합성 (NPU)
7. DSP 칩 여러 유닛에서 행렬 계산
8. AMD GPU 스트림

C수준에서 simd instrinsic 함수, 로드 밸런싱, 네트웍 통신 그리고 리눅스 커널에서 task 제어할 수 있는 api 사용법 등을 숙지해함

이런 노가다 싫으니까 수백만원주고 rtx 4090이나 h100 사는거