우선 현 대국 상황(문제)을 에이전트모델의 입력에 두고 출력에 다음에 어디에 돌을 놓을건지(해답)를 출력에 두고 학습할 예정

보상모델에는 문제와 해답을 입력에 두고 그 문제와 해답을 적용했을때 승리했다면 출력에 1점을 두고 학습

자가대국씀

- dc official App