이 점을 정말 강조하고 싶습니다. 알파고 제로는 테스트시점에 몬테카를로 트리 서치 없이 신경망만으로 실행하면 성능이 인간 최고 선수보다도 낮습니다. 알파고는 2016년에 개발되었는데 8년이 지난 지금, 2024년에도 순수 신경망만으로 바둑에서 슈퍼휴먼 수준을 달성한 모델은 "없습니다".
제가 이것을 많은 사람들에게 말하면 사람들은 보통 "그럼 스케일링하면 되는 거잖아?"라고 합니다. 물론 이론적으론 그렇습니다. 하지만 알파고제로 수준이 되려면 얼마나 그 규모를 키워야할까요.
어쨌든, 몬테카를로 트리 서치로 30초동안 생각하는 성능을 따라잡으려면 엄청나게(100,000배) 확장해야합니다. 참고로 이 수치도 훈련과정에선 몬테카를로를 쓰도록 했을때의 수치입니다. 훈련과정에서도 빼면 스케일링해야하는 수치는 그야말로 기하급수적일 겁니다.
노암브라운 강연중 내용
신경망으로 실행 현재의 사전학습모델 비유
몬테카를토 트리 서치 o시리즈 모델
이론적으론 사전학습모델만으로 o3 성능도 가능할지 모른다 그러나 그 데이터는 상상을 초월할거고 솔직히 이제 그만한 데이터도 없다
댓글 0