https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=867863&page=1

님들이거 씹 여름인데?최신 강화학습 알고리즘을 ‘발견’하기강화학습(RL) 에이전트는 보통 우리가 손수 짠 규칙(TD, Q-learning, PPO 등)으로 학습합니다. 하지만 인간의 학습 규칙은 사람이 설계한 게 아니라 진화가 만들었죠.gall.dcinside.com



특정 도메인에 대해서 설계해놓은 범위값 내에서의 강화학습은 굉장히 강점이 보임


만약에 수학문제를 예로들자면, 그 수학문제가 이미 정답이 밝혀져 있고 그 정답을 찾을때까지 무한정 돌린다면 결국은 발견하게됨


하지만 인공지능은 정답이 밝혀져 있지않은 문제에 대해서의 강화학습은 이론적으로 '불가능 함' 


그 이유는 즉슨 산출물에 대한 점수를 매길 수 있는 '명확한 기준' 이 없기 때문임 


그래서 우리는 '인간의 자아' 라는 지도 교육자 를 두고 이것을 기준 으로 삼고 인공지능의 산출물을 하나씩평가해서 좋은건 남겨두고 별로인건 파기하는 방식으로 강화학습함 


이것도 물론 인공지능을 강력하게 만드는 강화학습 방법중에 하나지만 결국은 인간지성에 최종적으로 도달하게 됨으로써 한계에 직면하게 됨 


이 방식으로는 학습자 (인공지능) 은 지도자 (사람) 의 지성을 넘을 수 없음


그래서 나온게 저 논문인 '규칙 강화학습' 인데 


1. 즉, 에이전트의 손실 함수와 부트스트래핑 방식을 엔드투엔드로 함께 배우게 만드는 셈이죠. 에이전트는 여전히 정책과 예측을 내놓지만, 그 예측의 의미는 하드코딩이 아니라 ‘발견’됩니다.


2. 아타리에서는 57개 게임으로 학습한 버전(Disco57)이 수작업으로 만든 알고리즘보다 성능이 높으면서 실제 시간 관점에서도 더 효율적입니다.


3. 점점 더 복잡한 RL 손실과 타깃을 사람이 일일이 만들기보다, 학습 알고리즘 자체가 ‘학습되는’ 에이전트를 훈련할 수 있다는 것이죠.


강화학습할때 쓰는 지표인 '규칙' 자체를 '강화학습' 함으로써 더 수준높은 규칙을 인공지능에게 제공함으로써 성능을 높임 


이것은 '부분 재귀개선' 을 의미함 


이제 규칙을 만들기 위해서 인간의 두뇌를 짜낼 필요가 없다는거 


기존 강화학습 프로토콜은 "인간이 인공지능에게 규칙을 제공 → 인공지능이 규칙에 맞게 강화학습 → 최종 결과값을 인간이 검수하여 점수를 매김" 임 


하지면 이 논문이 적용된 강화학습 프로토콜은 "인공지능이 인공지능에게 규칙을 제공 → 인공지능이 규칙에 맞게 강화학습 → 최종 결과값을 인간이 검수하여 점수를 매김" 임 


첫 시작단계가 인간이 아닌 인공지능으로 대체됨으로써 재귀개선의 부분적 성공이라고 볼 수 있고 실제 실사용해본 결과 인간규칙 보다 인공지능규칙이 더 높은 점수를 받을 수 있엇음 


장기기억의 시대가 곧 인공지능에 의해 열릴지도 모른다는 생각을 하게 됨 


'규칙을 만드는 인공지능과 강화학습 하는 인공지능이 합쳐진 인공지능' 에게 '컨텍스트 에어리어 범위내의 토큰 반영률 높히는 방법' 을 연구하라고 시키고 그렇게 나온 인공지능에게 소설 맥락 벤치마킹을 해봄으로써 인간 지도자가 점수를 매기는 방식으로 계속 재귀개선 해보면 될듯?