한글로 된 문장이 5억개 정도 있음
근데 이 문장들이 완전한 문장이 아님
예를 들어서 컴퓨터프로그래밍이 컴프더프르그라밍 이런식으로 읽을 수는 있는데 완전하지 않은 문장들임
이 문장들에서 임의의 주어진 문장이랑 비슷한 문장들을 최대한 빠르게 찾는게 해결하고자 하는 문제임
먼저 내가 지금 구현한 방법은 다음과 같음

5억개문장을 전부다 한영키 안누르고쓴 문장으로 바꿔버림
컴퓨터 => zjavbxj 이런식으로
그 다음 병렬로 5억개 문장 전부다 edit distance 계산해서 결과 뽑아냄
rapidfuzz에 ratio, partial_ratio 이거 가져다 썼음

5억개 문장을 대충 1억개씩 나눠서 각각 다른 인스턴스에 넣고 결과 추출하는 방법도 있는데 그러기엔 돈이 너무 마니듬

kdtree나 vp bk tree써보려고했는데 존나존나존나 오래걸리고 용량도 커서 포기함

인스턴스 최대한 적게쓰고 빠르게 계산하는 방법 뭐 없을까?

- dc official App