대형의 기준은 내 PC 1대로 할 수 있는 실험 치고 대형.. ㅎㅎ

코퍼스 110만개 수집

형태소 중복 포함 2738만개 (고유명사가 많아서 그런듯) 이 중 빈도 높고 중복없는 1만개만 사용 예정

사용빈도 추출 후 정규화


요거 데이터화 하는데 GTX1050 고물로 노가다 1주일걸리고

본격적인 프로젝트를 하기 위해 먼저 단어를 임베딩할 필요가 있어서

오늘부터 word2vec 진행중 데이터가 엄청엄청 많으니까

확실히 학교나 블로그 예제 같은 것 보다 더 재밌는 결과가 많이 나오는 것 같음



짤은 두 단어와 가장 연관이 깊은 단어 3개 선정 학습량 0.5% 밖에 안되는데 재밌네 ㅎㅎ