데이터 한 개씩(미니배치라면 어려 개) 신경망에 넣고, 나온 Loss 값에 대해서 Loss 함수에서의 그 값에 대해 각 가중치에 대한 편미분 값을 구하는 속도를 빠르게 하기 위해 chain rule로 미분을 국소적으로 바꿔서 구하는 게 내가 이해한 거 맞음?