https://arxiv.org/abs/2501.12948
어차피 중간 내용은 벤치딸딸이라서 생략하고


요약


1. 딥시크 R1 제로는 SFT 없이 RL 만으로 훈련됨 

딥시크 R1 제로는 추론 개쩔긴한데,

인간이 이해하기 어려운 답변을 생성함(즉 논리적으로는 맞는데 너무 고차원적으로) 그리고 언어 혼합(출력한 답에 다양한 언어가 혼재함)의 문제가 있었음


2. 그래서 추론 능력은 냅두고 이 2가지 문제. 고차원적으로 어려운 답변+언어 혼합 을 해결한 모델 R1을 만들려고함. 시도한 방법은

RL전에 콜드 스타트 데이터+멀티 스테이지 트레이닝(다단계 학습)으로 해결했음

그렇게 하니까 Open AI O1 1217이랑 비슷한 성능 달성함


그니까 결론: 기본적으로 RL 전에 콜드 스타트 데이터 삽입과 다단계 트레이닝을 하니까 성능 더 좋아졌다 이거임


->해석


SFT-> 인간처럼 자연스럽고 정확한 답변을 생성하도록 훈련시키는 과정(인간이 작성한 데이터 셋 입력)


RL-> 내가 예전에 쓴 글 모델의 행동에 점수 매김


콜드 스타트 데이터->모델이 처음 훈련 시작할때 사용되는 초기 데이터인데, 기본적인 언어 패턴과 문법 위주로 구성된 데이터


다단계 학습-> 모델이 안정적으로 한번에 데이터 받아들이는게 아니라 여러 단계를 나누어서 받아들임