f : X -> Y 인 함수 f를 학습하기 위해서 최적화를 하는데, 


training set에서 학습이 쉽지만 decision hyperplane에 중요하지 않은 많은 특징만 먼저 학습을 해서 일반화 성능이 떨어지고,


loss를 낮추면서 학습을 하다보니 어쨋건 training set S도 결국 어떤 학습하고자 하는 f에 대해서 나눠진거니까 학습이 어렵지만

decision hyperplane에 기여가 큰 특징을 학습하는데 성공해서 일반화 성능이 확 오르는거 아닐까


결국 training set도 함수 f에 의해서 나눠진거니 얘가 되게 배우기 어려운 기능들로 이루어져있었으면 저런 그래프 나올 것 같은데,,