O1 까지만 추론 데이터셋 따로 학습한거였잖아
O3부터 이후에 나오는 O 모델은 다 알파고 제로같은 거 아님??
헉
그건 재귀개선이라고 볼 수 없음 그냥 흔한 self improvement 재귀 개선은 모델 학습이 끝난 시점에서도 계속 학습이 되어야함.
헉
그건 재귀개선이라고 볼 수 없음 그냥 흔한 self improvement 재귀 개선은 모델 학습이 끝난 시점에서도 계속 학습이 되어야함.