o1 개발진이 말했듯이
o1은 인간의 고품질 추론 데이터에 강화학습을 사용해서 고품질 생각의 사슬 데이터를 만들어내는 모델인데
중국이 워낙 인간이 많고 똑똑한 사람도 많고하다보니
박사급 인재들의 고품질 추론 데이터 수집이 훨씬 용이할듯함
QwQ도 그래서인지 이 짧은 기간 내에 매우 인상적이고...
정확히 구현을 어떻게 했는지는 공개 안했다만은
미국 긴장 많이 되겠음
o1 개발진이 말했듯이
o1은 인간의 고품질 추론 데이터에 강화학습을 사용해서 고품질 생각의 사슬 데이터를 만들어내는 모델인데
중국이 워낙 인간이 많고 똑똑한 사람도 많고하다보니
박사급 인재들의 고품질 추론 데이터 수집이 훨씬 용이할듯함
QwQ도 그래서인지 이 짧은 기간 내에 매우 인상적이고...
정확히 구현을 어떻게 했는지는 공개 안했다만은
미국 긴장 많이 되겠음
댓글 0