보통 input에 현재 상황을 집어넣고

output 수를 action 의 개수 만큼 하잖아


근데 이런 경우는 어뜩함? situation에 따라 action의 개수가 달라지는거임 


단순한 예제로

Frozen lake 예제에서 움직일수있는 방향은 총 네방향이긴한데,


4*4크기의 맵에서 구석에 캐릭터가 있으면 두방향으로 밖에 못움직이잖아


이런 경우는 reward 조정해서 못가게 해야하나? 아니면


e-greedy 방법에서 랜덤action 줄때 할수있는 action중에서만 랜덤으로 골라 주면 알아서 학습 잘되나?


모두의 딥러닝 모두의 RL 이거 보면서

프로젝트 작은거 하고있는데 이거땜에 막혔어~~~