지금 oai는
1. 꽤 뛰어난 인간 수준의 범용 지능 (agent)
2. RLVR로 훈련된 각 분야 수십 개의 뾰족지능 (수학, 코딩 분야 등)
1번이 2번을 상황에 맞게 그때그때마다 도구처럼 라우팅 하는 걸 AGI라고 부르고 싶어 하는데
아직 이 구조가 완전히 실현된 것도 아니고
만약 이게 된다고 해도 이걸 AGI라고 부를 수 있을까 생각해보면 약간 의문임
RLVR을 반복 적용할수록 오히려 더 단순한 문제조차 놓치는 'hard-to-easy 불일치'가 심해지기 때문에
현실적으로는 이런 식으로 AGI에 근접한 거라도 만드는 게 최선인 거 같긴 한데
관건은 그렇게 만든 유사 AGI로도 재귀적 자기개선이 가능한지 여부인 듯
모로가도 서울로 가면 된다고 하듯이 재귀적 자기개선만 된다면 되는거 아닐까 - dc App