사전학습 컴퓨팅 대비 RL은 개 좆만한 상태인데
두개가 동등해지는거, RL이 사전학습을 역전시키는거는 못봤다는거임
그걸 보기위해서 스타게이트 같은거 존나짓고있는중
지금 RL이 사전학습 넘었을지 안넘었을지는 모르는거잖음 저건 o1이고 지금 o4나오고 내부모델은 더갔을텐데
그니깐그걸봐야지이제
사전학습도 돌파구 찾으면서 4.5보다 유효하게 크기 키울 수 있다는걸 잼3이 보여줬고 지금은 컴퓨팅 모자라서 모델 크기 줄이면서 몸비틀고 있잖아
지금 RL이 사전학습 넘었을지 안넘었을지는 모르는거잖음 저건 o1이고 지금 o4나오고 내부모델은 더갔을텐데
그니깐그걸봐야지이제
사전학습도 돌파구 찾으면서 4.5보다 유효하게 크기 키울 수 있다는걸 잼3이 보여줬고 지금은 컴퓨팅 모자라서 모델 크기 줄이면서 몸비틀고 있잖아