o1을 어떻게 훈련시켰냐면


우선 인간이 라벨링한 80만개의 자료로 보상모델을 만듬


보상모델은 풀이를 입력하면 그 풀이가 옳은지 그른지 판정내림


옳다고 판정받은 풀이를 o1에 학습시킨것임


o1은 처음에는 틀린 풀이도 만드는데


틀렸다는 판정을 받으면 다른 풀이를 만들도록 시도함


그 다른풀이들 중 옳다고 판정되는게 또 학습되고


이게 계속 반복됨


그러니까


풀이를 계속 만들어내고 맞으면 그풀이를 학습시키고 틀리면 다른풀이를 시도해서


그 다른풀이중에 맞는 풀이를 또 학습시킴