위키백과
기보에만 최적화 되는 한계를 극복하기 위해 반복적인 자가 대국으로 정책망의 성능을 개선한다. 무작위로 선정된 신경망 사이의 자가 대국을 통해 학습하며, 승리하면 보상을 받고(+1) 패하면 보상을 잃는(-1) 방식으로 진행한다. 이 과정을 거쳐 강화학습 이전의 정책망과 비교해 80% 더 많은 대국에서 이길 수 있게 되었다.
내 생각에는 인공지능끼리의 무한경쟁이 강인공지능을 만들거라 본다..
반박환영
위키백과
기보에만 최적화 되는 한계를 극복하기 위해 반복적인 자가 대국으로 정책망의 성능을 개선한다. 무작위로 선정된 신경망 사이의 자가 대국을 통해 학습하며, 승리하면 보상을 받고(+1) 패하면 보상을 잃는(-1) 방식으로 진행한다. 이 과정을 거쳐 강화학습 이전의 정책망과 비교해 80% 더 많은 대국에서 이길 수 있게 되었다.
내 생각에는 인공지능끼리의 무한경쟁이 강인공지능을 만들거라 본다..
반박환영
일리야 셔츠케버도 딥러닝에 셀프플레이 같은 몇가지 작은 아이디어를 추가시키면 agi 가능할거라 함
그게 진1화 알고리즘 아니냐