RL로 인간 수준을 뛰어넘는건 가능할 거야
근데 한번 개선 시작되면 무한정으로 발전할 수 있는가는 다른 문제인데
알파고는 간 기보로 pretraining하고 RL로 슈퍼휴먼 수준 달성했지만 어느 순간 saturation 일어나서 성능향상이 멎었음
그 후 인간 기보 없이 바닥부터 RL만으로 학습한 알파고 제로는 알파고를 손쉽게 발라버릴 수 있는 수준까지 도달했고, 성장 정체도 일어나지 않았음
아예 바둑 룰에 대한 사전지식도 제외한 알파제로나 뮤제로는 바둑에선 알파고 제로 수준조차도 금방 역전해내고 그보다 더 어려운 현실세계의 문제를 풀어냈고
인간 데이터는 초반엔 성장을 돕지만 나중에는 오히려 성장을 막는 선입견의 역할도 한다는 거지
난 이걸 LLM에서도 프리트레이닝을 최소화하거나 배제할 수 있는 알파고 제로 모먼트가 필요할 수 있다는 의미라고 봄
물론 그게 없더라도 인간 수준을 넘는 모델들은 무조건 나올테고 문명은 어마어마한 발전을 하겠지만
거기서도 언젠가 벽에 부딪친다면 그런게 필요해질 것
해당 댓글은 삭제되었습니다.
ㄴ 아님 - dc App
유튜브 압축코덱 개선, 구글 데이터센터 쿨링 최적화 걍 기본적으로 NP-hard일수밖에 없는 문제들에 적용했는데 무슨 답이 명확히 있어 - dc App
RL은 룰베이스에서만 적용이 용이함
프레트레이닝을 배제하려면 언어모델에 대해 리워드 정의를 무슨 수로 할 것이냐가 일단 문제긴해 지금도 그게 안되니까 답이 확실한 문제 외에는 RLHF같은 간접적인 리워드에 의존중인거고 - dc App