https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=745843&search_head=10&page=1

언어 모델의 자가 학습: MIT SEAL 기술의 성과와 한계언어 모델의 자가 학습: MIT SEAL 기술의 성과와 한계 7B 모델이 GPT-4.1 생성 데이터보다 0.7% 높은 성능을 기록한 방법론 분석 2025년 6월 12일, Adam Zweiger와 Jyogall.dcinside.com





그니까 LLM이 데이터를 보고 '성능을 제일 높히는 형태'의 데이터로 편집하고, 그걸 학습 -> 여러 형태로 편집하고 학습한 결과 후보 n개를 생성 -> 제일 성능이 좋은 학습 결과를 채택 -> 과정 반복


물론 논문이나 본문에서도 너무 오랫동안 학습하면 한계점이 드러난다고는 했는데

이거 그냥 모델 하나가 아니라 에이전트를 학습하는 형태로 가면될거같은데?

이거 걍 재귀개선 뚫린거 아님?