https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=745843&search_head=10&page=1
언어 모델의 자가 학습: MIT SEAL 기술의 성과와 한계언어 모델의 자가 학습: MIT SEAL 기술의 성과와 한계 7B 모델이 GPT-4.1 생성 데이터보다 0.7% 높은 성능을 기록한 방법론 분석 2025년 6월 12일, Adam Zweiger와 Jyogall.dcinside.com그니까 LLM이 데이터를 보고 '성능을 제일 높히는 형태'의 데이터로 편집하고, 그걸 학습 -> 여러 형태로 편집하고 학습한 결과 후보 n개를 생성 -> 제일 성능이 좋은 학습 결과를 채택 -> 과정 반복
물론 논문이나 본문에서도 너무 오랫동안 학습하면 한계점이 드러난다고는 했는데
이거 그냥 모델 하나가 아니라 에이전트를 학습하는 형태로 가면될거같은데?
이거 걍 재귀개선 뚫린거 아님?
한계가 있다는말이 무슨뜻인지 모름? - dc App
아니 모델 하나를 죽어라 연속학습하니까 forgetting이 생긴거고, 에이전트나 expert 여러개를 선택적으로 학습하게 하면 된다고
지수적발전을 해야하는데 로그적 발전을 하시면
metric이 포화되니까 로그로 보이는거임
재귀개선까진 아직 어려움. 저건 한계점을 높이는 거지 스스로 계속 발전할 수 있는 형태가 아님.
파이썬의 부트스트래핑으로 만들어진 pypy의 속도가 무한정 빨라질 수 있는가? 를 생각해면 답이 나옴
@지각의문 그런가 드롭아웃도 따지고보면 스스로 발전하는게 아니라 보완해주는 뭔가를 계속 덧붙이는거 아닌가?