경험의 시대는 단지 대담한 비전이 아니라, AI의 새로운 기반입니다. 모방이 지금까지 우리를 이끌었다면, 상호작용은 우리를 더 멀리 데려갈 것입니다.
그들이 주장하는 미래는, 경험을 통해 배우는 에이전트의 시대입니다. 이 새로운 패러다임에서 에이전트는:
풍부하고 역동적인 환경과 상호작용하고 실시간 피드백(현실 기반 보상)으로부터 학습하며
학습을 위한 합성 데이터를 생성하고 계획, 자기 개선 같은 능력을 개발합니다.
그리고 이 모든 것을, 인간이 엄선한 데이터셋에만 의존하지 않고 수행합니다.
이는 LLM 중심의 스케일링에서 추론 중심의 스케일링으로의 전환을 의미합니다 — 이는 이미 추론 특화 모델들에서 나타나고 있는 현상입니다.
강화학습 기반의 초지능 시대는 아직 시작되지 않았습니다. 그러나 그 시작은 임박했습니다. 아름다운 미래가 다가오고 있으며, 그 전환을 함께 목격하게 되어 감사합니다.
- dc official App
추론 기반으로 AI가 새로운 지식을 생산해내고 순환되면 그게 특이점임. 인간이 생각지도 못한 관점이나 이론을 제시한다던가, 풀 수 없는 난제로 여겨졌던 문제들을 푼다던가
확실히 이번 돌파구는 강화학습이 맞는듯