"저는 사람들이 Math 벤치마크를 보며 LLM이 AGI로 향하고 있다고 주장하는 사람들을 볼 때마다 어안이 벙벙해집니다. 

이 모든 진전이 데이터 검색을 기반으로 이루어 진 것인데 말입니다.


이러한 데이터 검색(Discrete Search)을 기반으로 작동한다는 실증적 데이터가 딥러닝, 특히 LLM이 수학을 할 수 없다는 것을 입증합니다."



"구글이 제미나이에 알파프루프를 포함시킬 것이라는 것은 순전히 마케팅이 목적입니다.

이것은 더 광범위한 트렌드의 결과입니다 - 모든 AI의 발전에 LLM 브랜딩을 하는 것, 설령 LLM과 별 연관이 없어도 말입니다."



ARC-AGI: AGI 개발의 진척도를 평가하기 위해 만들어진 벤치마크. 비공개 데이터를 사용하며 인터넷에 연결되지 않은 상태로 평가하는 것이 전제. 85%를 달성한 모델은 AGI로 평가함.


현재 최고기록은 MindAI의 55%이며, 이의 간소화 버전인 ARC-AGI-PUB의 GPT-o1 점수는 18점.