o1이 개발진들이 말하는거보면

LLM에 드디어 강화학습으로 성능을 개선하는데 성공한

알파고같은 느낌으로 적용된거라는데

인터뷰 내용도 보면

약간의 인간 전문가들이 만든 데이터를 가지고 강화학습으로 학습데이터를 생성하는 모델을 만들어서


그걸 기반으로 모델을 학습시키는 느낌이라서


계속 시간 지나면 Self play로 성능 계속 오를듯(이미 그럴 것 같기도함)


이게 아니면 한달 한달 지날때마다 성능 계속 상당히 좋아질거라고 장담한게 이해가 안됨