아직 모르겠어요? 큰 실험실들은 요리하고, 짓고, 숨고 있는 동안 말이죠.
다행히 오픈소스로 요리하는 것들도 있습니다.
Eureka: 코딩을 통한 인간 수준의 보상 디자인
용지 페이지: huggingface.co/papers/2310.12 …
LLM(Large Language Models)은 순차적 의사 결정 작업을 위한 고급 의미 계획자로서 탁월했습니다. 그러나 이들을 활용하여 손재주 있는 펜 돌리기와 같은 복잡한 하위 수준의 조작 작업을 학습하는 것은 여전히 미해결 문제로 남아 있습니다. 우리는 이 근본적인 격차를 해소하고 LLM으로 구동되는 인간 수준의 보상 설계 알고리듬인 유레카를 제시합니다. 유레카는 GPT-4와 같은 최첨단 LLM의 놀라운 제로샷 생성, 코드 작성 및 맥락 내 개선 기능을 활용하여 보상 코드에 대해 진화적 최적화를 수행합니다. 그런 다음 결과 보상은 강화 학습을 통해 복잡한 기술을 습득하는 데 사용될 수 있습니다. 작업별 프롬프트나 사전 정의된 보상 템플릿 없이 유레카는 전문가의 인간 공학 보상을 능가하는 보상 기능을 생성합니다. 10가지의 서로 다른 로봇 형태론을 포함한 29개의 오픈 소스 RL 환경 세트에서 유레카는 83%의 작업에서 인간 전문가를 능가하여 평균 52%의 표준화된 향상을 가져옵니다. 유레카의 일반성은 또한 인간 피드백(RLHF)으로부터의 강화 학습에 대한 새로운 무구배 컨텍스트 학습 접근 방식을 가능하게 하여 모델 업데이트 없이 생성된 보상의 품질과 안전성을 향상시키기 위해 인간 입력을 쉽게 통합합니다. 마지막으로, 교육 과정 학습 환경에서 유레카 보상을 사용하여 펜 돌리기 트릭을 수행하고 빠른 속도로 원을 그리며 펜을 능숙하게 조작할 수 있는 시뮬레이션된 그림자 손을 처음으로 시연합니다
- AGI Coming Soon-
댓글 1