1. 기존 방식과의 차이점

일반적으로 대규모 언어 모델(LLM)은 사전 학습(Pre-training) → SFT → RL 단계를 거칩니다. SFT는 인간이 레이블링한 데이터로 모델을 미세 조정하는 과정이며, 이후 RL로 인간 선호도에 맞춰 성능을 개선합니다.
하지만 DeepSeek-R1-Zero는 SFT 단계를 완전히 생략하고, 사전 학습된 기본 모델(DeepSeek-V3-Base)에 직접 RL을 적용했습니다712. 이는 기존 연구에서 SFT를 필수로 여겼던 관행을 깬 혁신입니다.
DeepSeek-R1-Zero는 인간 개입 없이도 재귀적 개선이 가능한 가능성을 열었지만, 완전한 자율성 달성에는 여전히 한계가 존재합니다. 향후 연구에서는 동적 보상 시스템과 메타 학습의 결합, 다중 에이전트 협업 등이 핵심 과제로 부상할 것으로 예상됩니다. 이는 AI의 자율성과 신뢰성을 동시에 높이는 새로운 패러다임을 제시할 것입니다.
인간의 개입이 없다고...?
이거 완전 알파고..재귀개선 아니냐...?
이제 한달 뒤에 asi 등장 할 수도 있는거냐? 미친....

- dc official App