아직 자연어 처리 분야는 국내에 그렇게 알려진게 없는걸로 알고있다. 너무 마이너한 사람들만 알고있다...
끽해야 국내에서도 깃헙 주소만 공유하는정도로 알고있는데... 검색으로도 알수있는 정보가 많지는 않다이기.. 특히나 영어가 아닌 한글을 대상으로 자연어 처리하려니 더 그런것같다.
챗봇만들때 단어나 문장 사이 유사성을 구하려고
Fasttext라는 라이브러리 공식사이트에서 한국어 버젼 (위키백과 pre-trained model) 긁어온 버전으로 시험했는데 보니까 성능결과는 개똥망이더라..
대부분 블로그 포스팅된거 보면 모델 트레이닝을 직접 해서 새로운 모델을 만드는것같은데 굳이 그렇게 하는 이유가 무엇인지 모르겠다.. 그리고 표본도 적어도 한글문장이 몇만건은 되야한다는데....
혹시 직접 이런 스크립트 다뤄본 게이있으면 질문좀하자이기...
1) 한글 문장 혹은 단어간 유사성 뽑아내는데에 최고성능 발휘하는 방법이 뭐있노이기??? fasttext나 gensim 공식사이트에 한글용 pre-trained 모델은 성능 똥망이더라..
제발이거 딱 하나만 알려줘라.. 제발 부탁한다 이기야.. 4주동안 헤메고 헤메도 답도 못찾았다... 나보다 뭔가 더 아는 게이들의 도움이 절실하다.
설리 - dc App
도움될런지 모르겠지만, 단어간 유사도는 단어를 임베딩한 벡터와 벡터의 코사인유사도를 비교해봤습니다. 문장을 임베딩한다면 문장간 유사도 또한 구해지는 걸 확인해본 적 이써요
dialogflow는 영문만 가능한거 아니노..? 한글은 안되지않냐?
오메..... 구글검색해보니 코리안도 서포트 해주는구나.. 그런데 이걸 문장이나 단어간 유사도 측정하는 펑션만 따로 뽑아 쓸수가 있을까??? 무튼 충고 너무 고맙다 게이야 복받아라