https://twitter.com/karpathy/status/1662160997451431936
Very nice & inspiring, "no-gradient architecture" for high-level skills/learning. LLM here is the "prefrontal cortex" orchestrating the lower-level mineflayer API via code generation++.
— Andrej Karpathy (@karpathy) May 26, 2023
Meta-comment is that I remember how hopeless it felt to work on agents in environments like… https://t.co/NWQH4wFJbJ
Andrej Karpathy: 높은 수준의 기술/학습을 위한 매우 훌륭하고 고무적인 "무구배 아키텍처"입니다. 여기서 LLM은 코드 생성++을 통해 저수준의 마인플레이어 API를 조율하는 "전전두엽 피질"입니다.
메타 코멘트를 하자면, 2016년경 마인크래프트와 같은 환경에서 에이전트 작업을 할 때 매우 희박한 보상으로 어떻게 무작위로 장거리 작업을 수행할 수 있을지 막막한 느낌이 들었던 기억이 납니다. 이 장애물은 이제 상당 부분 해소되었습니다. 올바른 방법은 모든 것을 잊고 먼저 인터넷 텍스트로부터 (1) 세계 지식, (2) 추론, (3) 도구 사용(특히 코드 작성)을 모두 학습하는 LLM을 훈련시킨 다음 이런 방식으로 문제를 다시 지적하는 것이었습니다. 만약 제가 2016년에 에이전트에 대한 이러한 '무계단식' 접근 방식에 대해 읽었다면 분명 깜짝 놀랐을 것입니다.
또한 voyager/prompts/*.txt 디렉토리에 있는 소스 코드도 하하하 :D
맨바닥에서 강화학습을 돌리는 게 아니라 LLM을 만들어 놓고 그 위에서 작동시킨다는...ㅋㅋ일론 머스크 화들짝
념글에 있는거랑 어떤게 다른거임?
같은 거임. 올라왔었네.
이거 완전 agi 잖아. llm에 분야별 강화학습만 하면 되네? 게임오바
인류 따읻
겜매크로 안그래도 만들수있나했는데 이런식으로도되네