f : X -> Y 인 함수 f를 학습하기 위해서 최적화를 하는데,
training set에서 학습이 쉽지만 decision hyperplane에 중요하지 않은 많은 특징만 먼저 학습을 해서 일반화 성능이 떨어지고,
loss를 낮추면서 학습을 하다보니 어쨋건 training set S도 결국 어떤 학습하고자 하는 f에 대해서 나눠진거니까 학습이 어렵지만
decision hyperplane에 기여가 큰 특징을 학습하는데 성공해서 일반화 성능이 확 오르는거 아닐까
결국 training set도 함수 f에 의해서 나눠진거니 얘가 되게 배우기 어려운 기능들로 이루어져있었으면 저런 그래프 나올 것 같은데,,
뭔말인지모르겠노
걍 입력값이 뭐다를 정의해주는 확실한 특징이 여러가지 이유로 학습이 어려운데 loss를 계속 낮추다보면 그런 특징까지 결국 학습을 하지 않겠나
대충 맞는듯 ㅇㅇ
그럼 그냥 학습 자원이 좀 덜 필요할 수 있다인가
솔직히 후속연구를 봐야 될 듯 - dc App