한국어 데이터셋을 못찾아서 다음과같은 과정으로 학습데이터 구성해보려고 하거든요 .. 위키에서 문서하나 찾은뒤 그 문서를 문장단위로 전부 분리한뒤 문장끼리 유사도를 비교해서 (코사인유사도로 검사합니다) id sentence1 sentence2 label(문장이 유사하다면 1 아니라면 0) 이렇게 지정하려고하는데 어떨까요 ㅋㅋ.. - dc official App
제가 nlp조매하다 빠져나왔는데 한국어 임베딩책이 좋아요. 위키피디아나 나무위키 덤프데이터를 찾으면 데이터들을 얻을 수 있읍니다. 그나저나 버트는 요구사항이 상당히 높읍니다.