그래서 에러 시그널이 백프롭 될 때 크면 시그 모이드는 수렴하는 곳에서 델타값을 구하기 때문에 0.9999999-0.9999998 이런 식으로 델타값이 매우 작아짐. 그래서 그 다음 레이어로 백프롭 될 때 너무 작은 값이 들어가기 때문에 다음 레이어는 영원히 트레이닝이 안됨
Windforces(k920048)2017-05-01 13:55
CNN 이해하려면 컴퓨터 비전에서 간단한 수직선, 수평선 추출해 내는 소벨 필터만 보고 와도 이해가 된다
Windforces(k920048)2017-05-01 13:55
ReLU가 뭔가 거창하게 해놨지만, 그냥 램프함수인데 이게 공학적으로 좀 억지스러워서 거부하는 부분 아닌가? 시그모이드 쓰는이유가 현실적인 제한문제 때문인데, 학습이 멈춘다는 이유로 램프함수 만드는건 문제의 해법이 좀 잘못된듯 하다. 원래 공돌이는 뭐든 "발산"하는 구조를 극혐해야 정상인데. 무한루프가 일종의 발산이지. 니들도 브레이크 없는 무한루프는 좆같잖아. 해법을 다시 잡아봐야할듯 싶은데... ReLU 볼때마다 자꾸 거부감 생김.
시그모이드랑 렐루는 극한 취했을 때 하나는 수렴하고 다른 하나는 발산하지?
그래서 에러 시그널이 백프롭 될 때 크면 시그 모이드는 수렴하는 곳에서 델타값을 구하기 때문에 0.9999999-0.9999998 이런 식으로 델타값이 매우 작아짐. 그래서 그 다음 레이어로 백프롭 될 때 너무 작은 값이 들어가기 때문에 다음 레이어는 영원히 트레이닝이 안됨
CNN 이해하려면 컴퓨터 비전에서 간단한 수직선, 수평선 추출해 내는 소벨 필터만 보고 와도 이해가 된다
ReLU가 뭔가 거창하게 해놨지만, 그냥 램프함수인데 이게 공학적으로 좀 억지스러워서 거부하는 부분 아닌가? 시그모이드 쓰는이유가 현실적인 제한문제 때문인데, 학습이 멈춘다는 이유로 램프함수 만드는건 문제의 해법이 좀 잘못된듯 하다. 원래 공돌이는 뭐든 "발산"하는 구조를 극혐해야 정상인데. 무한루프가 일종의 발산이지. 니들도 브레이크 없는 무한루프는 좆같잖아. 해법을 다시 잡아봐야할듯 싶은데... ReLU 볼때마다 자꾸 거부감 생김.