=>

바둑은 search space가 매우 크고, 바둑돌 형태와 착점을 평가하기 어려운 이유로 AI로 접근하기 어려운 겜이라면서 죽는소리로 시작.

바둑돌 형태를 평가하는 value network와 착점을 선택하는 policy network를 이용한 새로운 접근법을 논문에 실었고

이 deep neural networks는 인간 고수들의 대국을 이용한 지도학습과 자가 대국(games of self-play)으로 강화학습을 새롭게 스까서 학습했다고 함.

neural networks 는 최첨단(?) 몬테 카를로 트리 서치 프로그램을 돌려서 바둑을 두는데, 그 프로그램은 수천판의 자가 대국을 시뮬레이션한다고 함.


그리고 몬테 카를로 시뮬레이션과 value/policy networks를 스까서 만든 새로운 탐색 알고리즘도 제시하고 있음.

요 탐색 알고리즘으로 알사범님은 다른 찌끄레기 프로그램에게 99.8%의 승률을 보이셨고 유럽 바둑 챔피언을 5-0으로 바르셨다고 함.

정식 바둑판에서 인간 프로를 이긴 최초의 프로그램이고 최초 십년 후에나 가능할거라고 생각했던 [위업]이라고 자찬하면서 끝남.



다음 논문엔 십년내 최강의 기사를 바른 ... 이라는 ㅠ.ㅠ