대형의 기준은 내 PC 1대로 할 수 있는 실험 치고 대형.. ㅎㅎ
코퍼스 110만개 수집
형태소 중복 포함 2738만개 (고유명사가 많아서 그런듯) 이 중 빈도 높고 중복없는 1만개만 사용 예정
사용빈도 추출 후 정규화
요거 데이터화 하는데 GTX1050 고물로 노가다 1주일걸리고
본격적인 프로젝트를 하기 위해 먼저 단어를 임베딩할 필요가 있어서
오늘부터 word2vec 진행중 데이터가 엄청엄청 많으니까
확실히 학교나 블로그 예제 같은 것 보다 더 재밌는 결과가 많이 나오는 것 같음
짤은 두 단어와 가장 연관이 깊은 단어 3개 선정 학습량 0.5% 밖에 안되는데 재밌네 ㅎㅎ
일본인여자아이만세
KoNLPy의 Twitter 사용했음요 왜냐면 최종 목적이 문장 생성이라 다른 거는 어 + ㄷ 뭐 이런식으로 분리해서 너무 귀찮아가지고 ㅎㅎ
Twitter 성능 후질텐데 ㅇㅅㅇ
가장 좋은거에 비하면 굉장히 느린긴 한데 이미 전처리로 분리를 다 해놨기 때문에 이제는 더 이상 사용 안하는중
트위터 가볍지않나? 형태소 분류항목 자체가 좀 적어서 난 안썼긴했다만 퍼포먼스는 괜찮던데
속도는 빠른편일걸 결과물 퀄 말한건데 ㅇㅅㅇ;;
ㅇㅇ쓸만해요 그리고 오히려 받침 분리 이런거 안해서 문장 결합할 때 더 편하고 ㅋㅋ
결과물 퀄은 아직 갈 길이 멀어서 계속 파라미터 바꿔가면서 해볼라고 합니다 ㅠㅠ
강승식은 형태소 분석기 소스좀 공개 해주셨으면
울학교 교수님 말씀하시는건가유ㅋㅋㅋㅋㅋㅋ 형태소 분석 자체를 딥러닝으로 해보는것도 재밌을듯
코퍼스가 말뭉치 맞죠? 어디서 수집하셧나요?
데이터 수집은 손 노가다는 아니지만 매크로 노가다로 4일동안 웹사이트 돌아댕기게 하면서 했습니다 최대한 부하 안주기 위해 5초에 1번씩만 작동하게 해서..
크롤링 열심히 하셨네요...
저번에 보니까 국립국어원에서 말뭉치 만들 계획이란거 같던데 어서 만들어졌으면 좋겠네요
W2V 는 100 정도가 적당함 참고 - return 0;
ㄴ 감사합니다 저는 200으로 하고있어요 ㅎㅎ