https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=867863&page=1
님들이거 씹 여름인데?최신 강화학습 알고리즘을 ‘발견’하기강화학습(RL) 에이전트는 보통 우리가 손수 짠 규칙(TD, Q-learning, PPO 등)으로 학습합니다. 하지만 인간의 학습 규칙은 사람이 설계한 게 아니라 진화가 만들었죠.gall.dcinside.com특정 도메인에 대해서 설계해놓은 범위값 내에서의 강화학습은 굉장히 강점이 보임
만약에 수학문제를 예로들자면, 그 수학문제가 이미 정답이 밝혀져 있고 그 정답을 찾을때까지 무한정 돌린다면 결국은 발견하게됨
하지만 인공지능은 정답이 밝혀져 있지않은 문제에 대해서의 강화학습은 이론적으로 '불가능 함'
그 이유는 즉슨 산출물에 대한 점수를 매길 수 있는 '명확한 기준' 이 없기 때문임
그래서 우리는 '인간의 자아' 라는 지도 교육자 를 두고 이것을 기준 으로 삼고 인공지능의 산출물을 하나씩평가해서 좋은건 남겨두고 별로인건 파기하는 방식으로 강화학습함
이것도 물론 인공지능을 강력하게 만드는 강화학습 방법중에 하나지만 결국은 인간지성에 최종적으로 도달하게 됨으로써 한계에 직면하게 됨
이 방식으로는 학습자 (인공지능) 은 지도자 (사람) 의 지성을 넘을 수 없음
그래서 나온게 저 논문인 '규칙 강화학습' 인데
1. 즉, 에이전트의 손실 함수와 부트스트래핑 방식을 엔드투엔드로 함께 배우게 만드는 셈이죠. 에이전트는 여전히 정책과 예측을 내놓지만, 그 예측의 의미는 하드코딩이 아니라 ‘발견’됩니다.
2. 아타리에서는 57개 게임으로 학습한 버전(Disco57)이 수작업으로 만든 알고리즘보다 성능이 높으면서 실제 시간 관점에서도 더 효율적입니다.
3. 점점 더 복잡한 RL 손실과 타깃을 사람이 일일이 만들기보다, 학습 알고리즘 자체가 ‘학습되는’ 에이전트를 훈련할 수 있다는 것이죠.
강화학습할때 쓰는 지표인 '규칙' 자체를 '강화학습' 함으로써 더 수준높은 규칙을 인공지능에게 제공함으로써 성능을 높임
이것은 '부분 재귀개선' 을 의미함
이제 규칙을 만들기 위해서 인간의 두뇌를 짜낼 필요가 없다는거
기존 강화학습 프로토콜은 "인간이 인공지능에게 규칙을 제공 → 인공지능이 규칙에 맞게 강화학습 → 최종 결과값을 인간이 검수하여 점수를 매김" 임
하지면 이 논문이 적용된 강화학습 프로토콜은 "인공지능이 인공지능에게 규칙을 제공 → 인공지능이 규칙에 맞게 강화학습 → 최종 결과값을 인간이 검수하여 점수를 매김" 임
첫 시작단계가 인간이 아닌 인공지능으로 대체됨으로써 재귀개선의 부분적 성공이라고 볼 수 있고 실제 실사용해본 결과 인간규칙 보다 인공지능규칙이 더 높은 점수를 받을 수 있엇음
장기기억의 시대가 곧 인공지능에 의해 열릴지도 모른다는 생각을 하게 됨
'규칙을 만드는 인공지능과 강화학습 하는 인공지능이 합쳐진 인공지능' 에게 '컨텍스트 에어리어 범위내의 토큰 반영률 높히는 방법' 을 연구하라고 시키고 그렇게 나온 인공지능에게 소설 맥락 벤치마킹을 해봄으로써 인간 지도자가 점수를 매기는 방식으로 계속 재귀개선 해보면 될듯?
이제 저 굴레가 닫힐수만 있다면 참 좋을텐데..그래도 틈이 줄어들었다는것먼으로도 기쁘네요
저거 닫으면 이론적으로 기술적 한계는 사라지지.. 알파고 제로처럼
དགན་ཁ་སབས་ཟན། གལ་ཏ་AIཡང་དགན་ཁར་ཡད་ན་གང་འད་རད།
얼마 안 남은거 같다
ད་ན་དན་སང་ལན་པ་ཞག་རད། ཁམས་ཕན་ག་ཚག་གབ་ལ་མ་ཟད། མས་བཟས་རག་ནས་དས་རང་བང་སད་ཡག་ནང་ཤག་བའ་བཅད་དན་དང་། ར་ཕན་དང་ནད་ཀ་རགས་མཚན་སགས་ཀ་ས་ལན་གནས་སངས་ལ་ག་བ་ལན་པར་སབ་སང་
reward는 안건드리고 q value policy만 업데이트하는데 그게 왜 보상자동화가되농 글고 llm같은덴 못쓸거같은데 - dc App
ད་ན་དན་སང་ལན་པ་ཞག་རད། ཁམས་ཕན་ག་ཚག་གབ་ལ་མ་ཟད། མས་བཟས་རག་ནས་དས་རང་བང་སད་ཡག་ནང་ཤག་བའ་བཅད་དན་དང་། ར་ཕན་དང་ནད་ཀ་རགས་མཚན་སགས་ཀ་ས་ལན་གནས་སངས་ལ་ག་བ་ལན་པར་སབ་སང་