대형 추론모델한테 붙여주는 소형 합성데이터 생성기(Qwen 7b)


-> 합성데이터도 생성하고 스스로 보상함수 기반 평가도 진행해서 본체 대형모델에 반영



보상함수가 명확한 문제를 대상으로 셀프 파인튜닝할 수 있도록 하는 서포트 모델임



정답이 없는(모르는) 개방형 문제에는 아직 적용 불가능