블럭 갯수 보니까 21억개 쓸 수 있더라고 그래서 굳이 블럭당 쓰레드를 1024개 할당 안하고,

Warp가 32개 니까 블럭당 쓰레드 32개만 해서 쭉 늘려서 쓰면 어떨까 싶은데 굳이 이렇게 쓰려고 하는 이유는


1. shared memory가 global memory보다 빠름

2. warp는 자동으로 쓰레드 동기화가 되서 _Syncronized() 를 안써도 댐


어떻습니꽈?