[2102.04518] A* Search Without Expansions: Learning Heuristic Functions with Deep Q-Networks (arxiv.org)이거고 이 논문 5페이지 큐스타 알고리즘 나온다큐스타 = Q러닝 + A스타Q러닝은 1989년에 영국인 크리스토퍼 왓킨스 라는 영국의 대학원생의 박사학위 논문으로 강화학습으로 러닝하는 방법이다.아래는 크리스토퍼 왓킨스의 박사학위 논문이다.인용횟수가 1만개 넘는다.학술자료 보기 (google.com)
콰이어트 스타라는게 정배 아니냐
1989년에 크리스토퍼 왓킨스가 Q러닝에서 [x a r y] 배열을 Q라고 했다.
큐러닝은 알파고때 기술이잖아
x 초기값 a action r reward y 나중값
맞음 알파고때 딮마인드 데이비드 실버가 크리스토퍼 왓킨스쪽 학교에서 강화학습 많이 배운듯
근데 요즘 나오는 큐스타는 오픈AI가 스트로베리에 적용한다는 비밀기술 말하는 거 아니냐
비밀기술이 아니고 모두 아는 기술을 잘 적용한 거 같다