29acde68f5dc3f8650bbd58b3680726c87cb88

Q(s, a)가 스테이트 s에서 액션 a를 취하면 얻는 예상이득이라는데

Q-loss로 정의되는 저 Q(s', a')는 뭐임? 그리고 그걸 최대로 하는 행동 a'에 감마를 곱하고 r을 더한거랑 Q(s, a)랑 왜 최소로 만들려는건지 이해가 안됨