Q(s, a)가 스테이트 s에서 액션 a를 취하면 얻는 예상이득이라는데
Q-loss로 정의되는 저 Q(s', a')는 뭐임? 그리고 그걸 최대로 하는 행동 a'에 감마를 곱하고 r을 더한거랑 Q(s, a)랑 왜 최소로 만들려는건지 이해가 안됨
Q(s, a)가 스테이트 s에서 액션 a를 취하면 얻는 예상이득이라는데
Q-loss로 정의되는 저 Q(s', a')는 뭐임? 그리고 그걸 최대로 하는 행동 a'에 감마를 곱하고 r을 더한거랑 Q(s, a)랑 왜 최소로 만들려는건지 이해가 안됨
(s, a, r, s')로 구성된 튜플이 있음. s에서 a를하면 r을 받고 s'로 전이함.
q(s, a)를 학습시키는데 일단 a를 했으니 보상 r은 무조건 받는거니까 반영하고. s'로 넘어갔는데 거기서 거기서 할수있는 모든 행동 중 가치가 가장 높은 행동을 greedy하게 잡아서 업데이트
r + r*Q' 은 off policy td target 인거고 여기서는 기존 강화학습과 다르게 loss함수를 정했잖아 실제 값과 예측값의 차이를 최소화하는 방식으로 경사하강하는거지