한국어 데이터셋을 못찾아서 다음과같은 과정으로 학습데이터 구성해보려고 하거든요 ..

위키에서 문서하나 찾은뒤
그 문서를 문장단위로 전부 분리한뒤
문장끼리 유사도를 비교해서 (코사인유사도로 검사합니다)
id sentence1 sentence2 label(문장이 유사하다면 1 아니라면 0)

이렇게 지정하려고하는데 어떨까요 ㅋㅋ..

- dc official App