이 사람은 host <-> 디바이스 통신이 딱 두번 일어나네;;;


전에 어디서 봤을 때 gpu에서 커널이 많은 연산을 하는게 좋지 않다는 소릴 들어서

위에 7개로 나눠진 커널을 거의14개 정도로 나누고 각 커널마다 host <-> 디바이스 통신을 하도록 했었음;


일반적으로 gpgpu 쓰면 보고하는 speedups가 최소 8배인데, 난 2.x 정도 였던 이유를 몰랐거든...


이래서 기초가 부족하면 남들 하는거 많이 보기라도 해야되구나 싶음..