안녕하세요 이번에 처음으로 머신러닝을 구현해보고자 합니다 ( 고졸에 관련직도 아니라 머신러닝에 관심만 많았는데 어찌하다보니 기회가 온것같네요)
품질분석을 위해 좌표값을 입력하면
A,B,C~H 까지 총 8개의 공정 중 어느 공정에서 나타난 불량인지 분류하는 머신러닝을 구현하고자합니다.
학습데이터 입력과정에서 A 공정에서 나타난 불량 CASE 는 충분히 많아 데이터 입력에 문제는 없지만 B나 C 같은 공정에서의 불량 샘플수가 적다는 것이 문제입니다.
그래서 오버샘플링으로 발생할 수 있는 가상의 좌표 ( 가상이지만 실제로 발생할 수 있는 ) 를 샘플데이터로 입력하여 A 공정과의 샘플 수를 맞춰보려고합니다.
실제로 이러한 오버샘플링을 많이 활용하시나요???
많은쪽을 제거하는게 아니라 적은쪽을 늘릴땐 생성한 데이터가 그 레이블의 특성을 잘반영하는지 고민해봐요 - dc App
예 감사합니다!