Q러닝에서 World가 continuous하지 않으면 원래 return이 이상치가 잘 발생하는건가

왜 loss는 수렴했는데 결과가 가끔씩 튀누, 금방 돌아오긴하는데 아무리 랜덤 정책이여도 심한디