내가 취미로 해서 그런건지 모르겠는데


한글 표본들을 프로세싱하는게 너무 어려움


결국 빅데이터나 머신러닝은 방대한 표본들을 가지고 통계를 내고 그 통계를 근거로 답을 추측해내는거잖아

근데 한글 문장에서는 특정한 단어를 추출해내는게 너무 어렵다

영어는 단순히 공백만 구분지어서 사전참조후 진행하면되는데

한글은 수많은 조사들을 제거하고 거기서 또 단어에 걸리는건 필터링을 해줘야 됨, 아울러서 띄어쓰기 문법이나 별별 좆같은 조합들이 많아서

너무 어려움.