위의 코드 avx2 컴파일러 옵션 주고 1메가 넘는 haystack 대상으로 벤치마크 했더니





표준 라이브러리 구현보다 10배 빠름 ㄷㄷ



표준 라이브러리 구현도 당연히 나이브한 2중 루프가 아니라 나름 Boyer-Moore-Horspool 알고리즘으로 구현되어있는건데도 엄청 차이남

haystack 사이즈가 작으면 차이가 줄어드는데 아주 작아도 어지간하면 훨 빠른 듯


짤 e0/e1에 bool이라고 인레이 힌트 달려있는데 실제로는 bool이 아니라 u8의 벡터임

지그 lsp가 아직 존나 꾸짐





x86_64의 베이스라인인 sse2 옵션으로 돌려도 7배 빠르네