Montezuma’s Revenge.



아타리 시절 슈퍼마리오랑 비슷한 게임이다.









Historical progress on Montezuma's Revenge. : M, R게임의 역사적인 발전상황

Time of publication : 발표 시기.



domain general : 인간이 익히는 일반적인 게임 규칙 (보편 영역) <- 점프하기, 이동하기
domain specific : 그 게임의 특별한 규칙 (특정 영역) <-이 게임의 특정한 함정 위치 같은 것들

domain knowledge : 전문화된 지식 <- 프로게이머들이 사용하는 특정한 기술들.



Go-Explore(preprint) : 출판 전 알고리즘


Human World Record : 인간 세계최고기록 = 1,220,000
Human Expert : 인간 전문가
Avg. Human : 인간 평균



Go-Explore < Human World Record (최고 수준 인간 : 1,220,000) < Go-Explore(domain knowledge)



참고 : 딥마인드사 DQN 시리즈 거의 모두 0점, MuZero 0점. 타 중소 인공지능 회사 알고리즘 대다수 인간 평균 근처거나 이하.

최고 수준 인간이 Go-Explore 보다 30배이상 잘한다.




대충 번역 :

그동안 Montezuma’s Revenge 게임은 많은 변수와 어려운 난이도로 수많은 알고리즘들이 실패했었다.

하지만 Go-Explore는 기본적인 게임규칙만(domain general) 가지고도 성공했다.

게임의 정교한 트릭들(domain specific)을 알려주지 않았는데도 인간 전문가(human expert) 정도이상으로 성장했다.

만약 인간 프로게이머들이 사용하는 특수한 기술(domain knowledge)을 알려주면 Go-Explore 인공지능이 그 기술을 배워서 가장 뛰어난 인간보다 더 잘한다. (핵심)

하지만 이 알고리즘은 아직 응용력이 최고 수준 인간에 비해 부족하다.

앞으로 더 많은 인공지능 기술 발전이 필요하다.



내 의견 :

2025년 AGI? ㅋㅋㅋㅋㅋㅋㅋㅋㅋ 2029년을 기대해보자.

이것도 논문 글만보면 엄청 뛰어난 것처럼 보여. 하지만 아니라는거. MuZero가 0점인게 개인적으로 많이 충격이다.

그래도 다행스러운 점은 이제 기본적인 규칙만 가지고도 인간 전문가정도로는 하는구나.