이번 계절 학기 동안에 RL 한번 연습해보고 싶어서 openAI gym을 이용한 RL 코드를 가져와서 고쳐보고 있습니다.
그래서 rl을 이용한 길 찾기를 구현 해 보려고 커스텀으로 환경을 만들었습니다
action_space는 이전 노드, 다음 노드, 진행 이런식으로 생각해서
observation_space는 현재 위치, 갈 수 있는 노드 수, 갈 수 있는 노드의 속성[거리, 최고 속력, 지연 시간] 이 들어가야 한다고 생각했었습니다.
근데 예제들을 보면 관측 공간 shape가 mountainCar 이면 [위치, 속력] = (2, ), LunarLander 면 (8, ) 같이 고정되어 있더라구요...
관측 공간의 shape 가 Flatten(input_shape=) 레이어와 연결되어 있어서 일치하지 않으면 오류가 발생합니다 ㅠ
진행하면서 observation_space가 동적으로 바뀐다면 어떤 식으로 shape를 써야 할 지 감이 안 잡힙니다.
갈 수 있는 노드의 최대 수를 기준으로 shape를 써야할까요....
조언 부탁 드립니다. ㅠㅠ
observation space가 동적으로 바뀌는 환경 그 자체를 인풋으로 받으려고 하지 말고, 패딩같은거 이용해서 state representation을 통일시켜줘