지금 oai는

1. 꽤 뛰어난 인간 수준의 범용 지능 (agent)
2. RLVR로 훈련된 각 분야 수십 개의 뾰족지능 (수학, 코딩 분야 등)

1번이 2번을 상황에 맞게 그때그때마다 도구처럼 라우팅 하는 걸 AGI라고 부르고 싶어 하는데

아직 이 구조가 완전히 실현된 것도 아니고

만약 이게 된다고 해도 이걸 AGI라고 부를 수 있을까 생각해보면 약간 의문임

RLVR을 반복 적용할수록 오히려 더 단순한 문제조차 놓치는 'hard-to-easy 불일치'가 심해지기 때문에

현실적으로는 이런 식으로 AGI에 근접한 거라도 만드는 게 최선인 거 같긴 한데

관건은 그렇게 만든 유사 AGI로도 재귀적 자기개선이 가능한지 여부인 듯