gradient vanishing
역전파과정에서 비선형활성함수의 미분값을 계속 곱하는데 깊어질수록 비선형활성함수가 많아져서 많이 곱하면 곱할수록 0에 가까워진다 (비선형활성함수의 미분값이 0~1사이기 때문)
그래서 relu로 해결 relu 미분값 = 1 (0이하에서는 0)
vgg에서는 relu사용 근데 vgg기반 cnn에서 깊어질수록 어느시점에서 성능 떨어짐
이유 : gradient vanishing ????


ResNet
기존 cnn
인풋 x가 레이어를 통과 : H(x)
H(x)를 타깃값 y로 매핑하도록 학습

resnet
인풋 x가 레이어를 통과 : F(x)
H(x) = F(x) + x
F(x) + x를 최소화되록 학습 (왜?)
하지만 x는 현시점 고정값
F(x)를 0으로 매핑하도록 학습
즉 출력값을 입력값으로 매핑하도록 학습
그러면 좋음??? 머지


질문
1. 기존 activation함수들의 문제 gradeint vanishing을 해결하려고 relu만들었는데 relu를 사용한 vgg기반 cnn에서도 gradient vanishing이 있다함 왜 있음??

2. resnet에서 출력값에 입력값을 더한(F(x)+x)를 왜 최소화하도록 학습함?? 

어렵네요..