RL로 인간 수준을 뛰어넘는건 가능할 거야

근데 한번 개선 시작되면 무한정으로 발전할 수 있는가는 다른 문제인데

알파고는 간 기보로 pretraining하고 RL로 슈퍼휴먼 수준 달성했지만 어느 순간 saturation 일어나서 성능향상이 멎었음

그 후 인간 기보 없이 바닥부터 RL만으로 학습한 알파고 제로는 알파고를 손쉽게 발라버릴 수 있는 수준까지 도달했고, 성장 정체도 일어나지 않았음

아예 바둑 룰에 대한 사전지식도 제외한 알파제로나 뮤제로는 바둑에선 알파고 제로 수준조차도 금방 역전해내고 그보다 더 어려운 현실세계의 문제를 풀어냈고

인간 데이터는 초반엔 성장을 돕지만 나중에는 오히려 성장을 막는 선입견의 역할도 한다는 거지

난 이걸 LLM에서도 프리트레이닝을 최소화하거나 배제할 수 있는 알파고 제로 모먼트가 필요할 수 있다는 의미라고 봄

물론 그게 없더라도 인간 수준을 넘는 모델들은 무조건 나올테고 문명은 어마어마한 발전을 하겠지만

거기서도 언젠가 벽에 부딪친다면 그런게 필요해질 것