한글로 된 문장이 5억개 정도 있음
근데 이 문장들이 완전한 문장이 아님
예를 들어서 컴퓨터프로그래밍이 컴프더프르그라밍 이런식으로 읽을 수는 있는데 완전하지 않은 문장들임
이 문장들에서 임의의 주어진 문장이랑 비슷한 문장들을 최대한 빠르게 찾는게 해결하고자 하는 문제임
먼저 내가 지금 구현한 방법은 다음과 같음
5억개문장을 전부다 한영키 안누르고쓴 문장으로 바꿔버림
컴퓨터 => zjavbxj 이런식으로
그 다음 병렬로 5억개 문장 전부다 edit distance 계산해서 결과 뽑아냄
rapidfuzz에 ratio, partial_ratio 이거 가져다 썼음
5억개 문장을 대충 1억개씩 나눠서 각각 다른 인스턴스에 넣고 결과 추출하는 방법도 있는데 그러기엔 돈이 너무 마니듬
kdtree나 vp bk tree써보려고했는데 존나존나존나 오래걸리고 용량도 커서 포기함
인스턴스 최대한 적게쓰고 빠르게 계산하는 방법 뭐 없을까?
- dc official App
프갤로
프갤엔 엠생 틀딱들밖에 없어 - dc App
깃갤로
5억개 문장이랑 입력 간의 최소 편집 거리가 평균 어느 정도로 예상이 됨?
10이상 - dc App
각 글자(가-힣)가 포함된 문장의 목록을 만들어 두고, 입력이 들어오면 글자들 중 제일 크기가 작은 목록을 찾아서 편집거리 구해보는 건 어떰? 모든 글자가 아예 다른(비슷한 글자도 없는) 경우도 있나?