"2025년 ARC-AGI가 촉진시킬 o3 오픈소스 복제는 AI연구 커뮤니티를 진전시킬 것이다"
"o3는 AGI가 아니다. 2022년부터 준비하고 있던 ARC-AGI-2의 인간 점수는 95점이지만, o3는 30%에 머물렀다"
"결국 o3는 전문가의 라벨링, 인간이 생성한 CoT데이터에 의존한다"
"인간에게 쉬운 작업이 AI에게 더 이상 어렵지 않을 때가 와야만 AGI라고 부를 수 있을 것이다"
https://arcprize.org/blog/oai-o3-pub-breakthroughOpenAI o3 Breakthrough High Score on ARC-AGI-PubOpenAI o3 scores 75.7% on ARC-AGI public leaderboard.arcprize.org
"o3는 AGI가 아니다. 2022년부터 준비하고 있던 ARC-AGI-2의 인간 점수는 95점이지만, o3는 30%에 머물렀다"
"결국 o3는 전문가의 라벨링, 인간이 생성한 CoT데이터에 의존한다"
"인간에게 쉬운 작업이 AI에게 더 이상 어렵지 않을 때가 와야만 AGI라고 부를 수 있을 것이다"
https://arcprize.org/blog/oai-o3-pub-breakthroughOpenAI o3 Breakthrough High Score on ARC-AGI-PubOpenAI o3 scores 75.7% on ARC-AGI public leaderboard.arcprize.org
시험 어렵게 내니까 격차 훨씬 벌어지네
ARC-AGI-1 인간 점수가 85점임. 오히려 2버전은 쉬워졌거나 비슷하다고 봐야지.
저 마지막 문장은 계속해서 증명하는 중이므로 크게 신경쓸 필요 없을듯 - dc App
정보란으로 - dc App
근데 o3 ARC2 에서 30점이면 좀 충격이네. ARC1을 학습해서 푼 거 아니고서야 저렇게나 점수 차이가 날 수 있나? - dc App
원문 보고 왔는데 Furthermore, early data points suggest that the upcoming ARC-AGI-2 benchmark will still pose a significant challenge to o3, potentially reducing its score to under 30% even at high compute (while a smart human would still be able to score over 95% with no training). 이게 어떻게 30퍼에 머물렀다고 번역이 되냐? 달성 할 수도 있다는 우려 아니냐? - dc App
근데 어차피 따라잡힌 벤치는 의미가 없고, AI가 정복 못한 분야 찾는 게 더 중요함 그래야 그 분야를 정복하니까 저것도 시간문제지 못풀진 않을듯
이제 그냥 즐기면 됨. 오히려 점수 낮은 벤치가 나오면 이제 기쁨 프론티어매스 처럼. 얘네들이 얼마나 금방 무너질까 보는 맛이 쏠쏠해.
OpenAI 애들도 같은 마음일거임. 왜냐면 프론티어매스도 OpenAI가 지원해줬고, 더 더 어려운 문제 만들어달라고 요구했다고 함. ARC-AGI도 마찬가지로 내년에 OpenAI랑 협력해서 새로운 벤치마크 만들거라고 함. OpenAI는 그냥 더 빡센 평가에 목말라있음