__m128i a0 = _mm_loadu_si128((const __m128i*)(pSrc + x - (nPitch * 2)));
__m128i a1 = _mm_loadu_si128((const __m128i*)(pSrc + x - nPitch));
__m128i a2 = _mm_loadu_si128((const __m128i*)(pSrc + x));
__m128i a3 = _mm_loadu_si128((const __m128i*)(pSrc + x + nPitch));
__m128i a4 = _mm_loadu_si128((const __m128i*)(pSrc + x + (nPitch * 2)));
__m128i a5 = _mm_loadu_si128((const __m128i*)(pSrc + x + (nPitch * 3)));

__m128i lo = xFilter_Wiener_8B<0>(a0a1a2a3a4a5);
__m128i hi = xFilter_Wiener_8B<1>(a0a1a2a3a5a5);


뭐가 틀렸게? 


난 이거 찾느라 한시간 날려먹은게 레전드네 ㅆ발