1. 강화학습 하려면 상태값으로 줄 입력 데이터랑, 모델 행동 정의랑, 모델 행동별 강화/처벌 알고리즘 함수만 구현하면 됨??
2. 여기 입력데이터는 동영상데이터 줄건데 cnn+lstm으로 전처리 해주고?


+ 왜 cnn+lstm으로 전처리하냐는말 했냐면..
cnn은 단순 이미지특징 추출에만 사용할수 있어서 추출된 이미지를 다른모델에 입력데이터로 활용하면 이미지 크기가 줄어 연산량은 줄어들고 특징만 잘 추출했기떄문에 모델성능이 향상된데.
그리고 강화학습 혼자만으론 시간적 연속성을 학습못하기때문에, lstm같은 순환신경망이랑 결합해줘야한데. 그래서 cnn+lstm으로 전처리한걸 강화학습 모델에 전달하라고 하길레 이렇게 적은거야..