그림 a 의 A point에서 s_n에 대해 large gradient로 징계한다는 내용이 이해가 안되네.
모든 포인트에서 -1의 gradient로 학습되는것 같은데 콕 집어서 A 케이스에 large gradient란 표현을 쓰는 이유가 짐작이 안되노.
metric loss 등 loss좀 아는 친구 있으면 답변좀~~
그림 a 의 A point에서 s_n에 대해 large gradient로 징계한다는 내용이 이해가 안되네.
모든 포인트에서 -1의 gradient로 학습되는것 같은데 콕 집어서 A 케이스에 large gradient란 표현을 쓰는 이유가 짐작이 안되노.
metric loss 등 loss좀 아는 친구 있으면 답변좀~~
여러번 읽다 보니까 sn,sp 양축에 대한 gradient가 아니라 그냥 sn axis에서의 gradient가 크다는 얘기를 하는것 같긴하네. 틀리게 이해한거면 답글 줘~
징계 ㅋㅋ
이거 triplet loss function 관련해서 세미나 하다가 페이퍼 리뷰 했었는데 설명해드림. 작년에 페이퍼 리뷰한거라 뜨문뜨문 기억해보면, 아마 training 과정에서 gradient descent 통해서 A,B,C 점 3개가 Target point인 T나 T'으로 가야하는데, 기존의 traning 과정에서는 그냥 무지성으로 x축에서 -1로 경사하강, y축에서 1로 경사하강 한다는 것을 의미함.
이게 왜 문제냐면, A가 T'으로 가기 위해서는 x축에서는 되게 조금 경사하강 해야하고(예를 들면 -0.1) y축에서는 대강 +1정도 경사하강해서 올라가야지 target point인 T'에 좀 더 빨리 근접한다는 이야기임. 즉, 같은 크기의 보폭만큼 움직여야 하면, T' 방향으로 optimal하게 움직여야하는데, 그냥 무지성으로 x축에서 -1, y 축에서 1 이렇게 움직여버리면 optimal한 training과는 거리가 멀어진다는 소리임. Large gradient라고 표현을 쓴 이유는 -1이 존나 커서임. 적절하게 -0.1정도(?) 움직여야 한다는게 저자의 생각임.