오차의 제곱 합은 다음과 같습니다.

각 항에 대해 예측 값을 정답에서 뺀 다음 제곱한 후 1/2을 취합니다.

제가 궁금한 것은 이 모든 계산된 항들을 더하는 것입니다.

배치 크기가 커지면 항의 개수도 증가하므로 손실도 증가하게 됩니다.

동일한 신경 네트워크임에도 불구하고, 손실은 배치의 크기에 따라 달라집니다.

그렇다면 적절한 지표가 되려면 배치 크기로 나누어야 하는 것 아닙니까?

배치로 나누지 않을 경우 수백에서 수천 단위의 손실이 나옵니다.

이것이 맞습니까?