솔직히 나도 제대로 이해한 건 아닌데 아는 것 까지만 적어봄
1. cnn이라는 추상화 알고리즘을 사용함. 대충 현재 바둑판에 놓인 돌 모양을 추상화(여러개의 레이어로) 해서 기록함
2. 기존의 기보 데이터로부터 사람들이 두지 않는 판세를 추상화해서 판별하고 제외함
3. 현재 추상화된 판세로부터 둘 곳의 후보를 줄이며 둬야될 지점들을 기록함
4. 현 상태를 1.0버전이라 정한다 가정하고 둘이 대결시킨 후 각 예측지점마다 나오는 승률의 결과를 봄
5. 여러판을 해보며 지점들마다 승률을 가중치로 기록하고 그걸 몬테카를로 트리로 관리함
6. 몬테카를로 트리 탐색을 이용하는 놈을 버전 1.1이라 정하고 1.0과 1.1을 대결시킴
7. 1.1과 1.2를 ... 100000과 100001을 계속 반복 대결 시킴
8. 버전 1.0과 버전 1000000을 대결시키면 버전 1000000의 승률이 압도적임. 이게 강화학습
9. 이렇게 강화학습을 하며 나온 승률 높은 판세의 추상화 데이터를 정책으로 기록함
10. 실시간 경기 시에는 끝까지 깊이 탐색을 하는게 아니라. 현재 판세를 추상화 시키고 그걸 키로 해서 몬테카를로 트리 탐색으로 나오는 정책을 이용할 경우 동일 시간 대비 더 나은 선택을 할 확률이 높아짐
내가 잘못이해하고 있을 확률이 높고
절차적으로도 안맞을텐데 내가 대충 이해한 건 저럼..
1. cnn이라는 추상화 알고리즘을 사용함. 대충 현재 바둑판에 놓인 돌 모양을 추상화(여러개의 레이어로) 해서 기록함
2. 기존의 기보 데이터로부터 사람들이 두지 않는 판세를 추상화해서 판별하고 제외함
3. 현재 추상화된 판세로부터 둘 곳의 후보를 줄이며 둬야될 지점들을 기록함
4. 현 상태를 1.0버전이라 정한다 가정하고 둘이 대결시킨 후 각 예측지점마다 나오는 승률의 결과를 봄
5. 여러판을 해보며 지점들마다 승률을 가중치로 기록하고 그걸 몬테카를로 트리로 관리함
6. 몬테카를로 트리 탐색을 이용하는 놈을 버전 1.1이라 정하고 1.0과 1.1을 대결시킴
7. 1.1과 1.2를 ... 100000과 100001을 계속 반복 대결 시킴
8. 버전 1.0과 버전 1000000을 대결시키면 버전 1000000의 승률이 압도적임. 이게 강화학습
9. 이렇게 강화학습을 하며 나온 승률 높은 판세의 추상화 데이터를 정책으로 기록함
10. 실시간 경기 시에는 끝까지 깊이 탐색을 하는게 아니라. 현재 판세를 추상화 시키고 그걸 키로 해서 몬테카를로 트리 탐색으로 나오는 정책을 이용할 경우 동일 시간 대비 더 나은 선택을 할 확률이 높아짐
내가 잘못이해하고 있을 확률이 높고
절차적으로도 안맞을텐데 내가 대충 이해한 건 저럼..
개소리하네
내가 뭘 잘못알고 있는지 알려주라 진심 궁금
뭐 이전에 이런 저런 짜집기된 정보를 보면.. 전투 담당 AI가 있고, 전체 큰 모습에서 보는 전략 담당 AI가 있는데.. 그것 중에 어떤 것을 현재 선택할지 선택하는 AI가 또 있다는 식으로 들었던 것 같은데.. 뭐 정확하게는 알지못하니깐. ㅇ
걍 Mastering the Game of Go with Deep Neural Networks and Tree Search.pdf 보면 12페이지 그림이 가장 근접한 내용 같은데. ㅇ