아직 자연어 처리 분야는 국내에 그렇게 알려진게 없는걸로 알고있다. 너무 마이너한 사람들만 알고있다... 


끽해야 국내에서도 깃헙 주소만 공유하는정도로 알고있는데... 검색으로도 알수있는 정보가 많지는 않다이기.. 특히나 영어가 아닌 한글을 대상으로 자연어 처리하려니 더 그런것같다. 


챗봇만들때 단어나 문장 사이 유사성을 구하려고 

Fasttext라는 라이브러리 공식사이트에서 한국어 버젼 (위키백과 pre-trained model) 긁어온 버전으로 시험했는데 보니까 성능결과는 개똥망이더라.. 


대부분 블로그 포스팅된거 보면 모델 트레이닝을 직접 해서 새로운 모델을 만드는것같은데 굳이 그렇게 하는 이유가 무엇인지 모르겠다.. 그리고 표본도 적어도 한글문장이 몇만건은 되야한다는데.... 


혹시 직접 이런 스크립트 다뤄본 게이있으면 질문좀하자이기... 


1) 한글 문장 혹은 단어간 유사성 뽑아내는데에 최고성능 발휘하는 방법이 뭐있노이기??? fasttext나 gensim 공식사이트에 한글용 pre-trained 모델은 성능 똥망이더라.. 


제발이거 딱 하나만 알려줘라.. 제발 부탁한다 이기야.. 4주동안 헤메고 헤메도 답도 못찾았다... 나보다 뭔가 더 아는 게이들의 도움이 절실하다.