SIMD 명령을 적절히 잘 사용하면 단순한 연산의 반복일 경우

보통 C/C++ 로 짜내고 짜내서 최적화한 코드에 비해 2.5배 빠른 성능 코딩이 가능.


C/C++ 용 인터페이스인 intrinsic 문법을 쓰면 거의 SIMD assembly 와 비슷. ( 성능차이 5% 이내 )

여기까지는 몇 년 내공이 쌓인 사람의 수준이고


C++ 로 짜도 SIMD 에 필적한 성능을 뽑아낼수 있는 케이스가 ( SIMD 로 컴파일되는 ) 간혹 있음.


그런데 이게 가면 갈수록 컴파일러는 발전하고 꽤 많은 케이스를 SIMD 로 최적화 해내게 되거나,

더 큰 알고리즘 덩어리인 STL 이 최적화되어가니,


결국 low-level 최적화의 입지는 자꾸만 줄어듦.


그런데다가 이놈의 intrinsic 이니 assembly 코드는 다른 시스템에 가면 다시 짜야됨.

API 사용도 최소화하려는 판에 좀 넌센스지.