아 정보검색.
IR을 공부하는데 사실 이게 4학년때
인공지능에 딸린 분야에서 자연어처리하면서 살짝만 배웠거든여
그래서 형태소분석기로 명사, 동사 분리해낸다음
가지고있는 모든 문서의 term들을 링크드리스트에 넣고
리스트 순회하면서 TF와 IDF구해서 해당 입력쿼리(검색할 단어)에 대한
TFIDF Value가 높은놈으로 sorting해서 뛰어주는 방식으로 구현했는데
50줄정도되는 문서 100건만 있어도 초기 로딩시간이 3~4초 정도 걸리더라구요
이거 성능좀 개선시킬 방법 없나여?
대학원생도 아니고 학부생이 기본 맛보기만 배워서
이걸딱히 성능올릴방법을 모르겠네여 ㄷㄷㄷ
C로 구현해서 캐릭터단위로 처리해서 연산량이
차라리 자바나 씨샵으로 스트링단위로 처리한거보다 많아서 느린건가 쉽기도하고..
매번 형태소분석부터 다시 하는건 아니겠지요?
넹 형태소분석기는 최초 문서로부터 동사, 명사를 뽑아낸 후에 동일이름을 지는 Term파일로 따로 만들어서 그녀석들을 리스트로 처리했어요