개인적으로는 강화학습이 슈퍼 인간 수준 지능에 도달하는 키라고 본다.
알파고 때도 보면 결국 pure 강화 학습이 학습 속도도 빠르고 더 고점에 도달했었음.
근데 AI가 더 똑똑해지기 위해서 강화 학습을 한다?
얼마나 똑똑한지를 나타내는 reward가 필수적인데, 가장 단순한 방법은 문제 풀게 시켜서
1. 정답을 맞췄는지,
2. 얼마나 잘 풀었는지를 보는것임.
그래서 O3랑 전공 관련 난제에 대한 대화를 나누고 대화를 기반으로 IQ를 추정하게 시켜봄.
근데 ㅅㅂ 소름돋을 정도의 정확도로 IQ를 맞춘다.
어처구니가 없어서 여러 번 시도해봤는데 일관된 대답을 얻었음.
그니까 한 마디로 '한정된 주제에서의 텍스트 대화'를 기반으로 지능 수준을 측정하는데에 성공하는 것임.
만약에 LLM이 특정 토픽에 대한 LLM의 대답을 기반으로 IQ 점수를 추정하고, 그걸 reward로 준다면 재귀 개선이 될 것 같다.
그럼 더 어려운 벤치 마크 낼 필요도 없는 것임.
더 높은 IQ reward를 받은 LLM이 토픽을 정하기/IQ 추정하기를 점점 더 잘할테니
댓글 0