Base LLMs (no reasoning) are currently scoring 0% on ARC-AGI-2.
— ARC Prize (@arcprize) March 24, 2025
Specialized AI reasoning systems (like R1 and o3-mini) score <4%. Even AI systems with high adaptation like o1 pro and o3 low score single-digits (est.) pic.twitter.com/Dl0awtcRdK
[일반] Arc-agi2 결과 뜸
익명(39.117)
2025-03-25 07:23
추천 22
댓글 23
다른 게시글
-
o3 full은 그래서 어느정도 성능인거임[일반] 익명(115.139) | 25.03.25추천 0
-
네뷸라가 제미니 프로 띵킹 맞는듯 [2][일반] 익명(black542) | 25.03.25추천 3
-
로봇에 허리가 있으니 동작이 훨씬 자연스럽네 [3][일반] 익명(121.170) | 25.03.25추천 30
-
의료행위를 하는 휴머노이드 로봇 [4][📪정보] 익명(220.73) | 25.03.25추천 1
-
애플은 ㄹㅇ 개씹좆망이네 [9][일반] 익명(memory1669) | 25.03.25추천 1
-
오늘 딥식 v3.1 나왔는데 [2][일반] 익명(220.65) | 25.03.25추천 2
-
요즘 그림 ai는 딱 이정도 인거 같던데 [13][일반] 익명(58.227) | 25.03.25추천 0
-
구글에 딥 리서치 검색하니까 나온거 [2][일반] 유람(eba1eba) | 25.03.25추천 1
-
한국은 양안걱정 크게안해도될듯 [6][일반] 익명(121.168) | 25.03.25추천 1
-
딥리서치 덕에 나는 일상에서 AI 발전 굉장히 크게 느껴짐 [6][일반] 익명(prison9540) | 25.03.25추천 4
O3는 로우도 가격이 미쳐 돌았네ㄷㄷ
걍 말이 안되긴 한다 o3 ㅋㅋ 안푸는 이유가 있네 - dc App
와 미친 arc2 제대로 만들었네
저거 인간은 100점나옴?
ㄴㄴ 100점까진 아니고 Arc는 선진국에서 어느정도 교육받은 보통 인간이라면 80점 이상 나올 수 있게 설계함
그럼 저걸 특붕이들이 풀면 8,90점 나온단거노
보통인간 85점인데 사람이 틀리는 건 실수도 많고, 전체적인 규칙은 파악했는데 사소한거 놓치는 정도임. 30x30 격자에 규칙찾아서 색칠하는 문제들인데 빼먹고 한칸 안 한다거나 잘못된 색을 넣는다거나 이런것들. 그에 반해 AI 는 틀리면 그냥 얼척없이 틀리는 수준. 그리고 ARC AGI 1 기준으로는 답안 두 개 내서 둘 중 하나라도 맞으면 정답처리였음. 근데 사람은 답안지를 하나만 내니까(두개 만들라고 해도 못만들지) 사실 역량차이는 아직 많이 나는거지
arc-agi 골대옮기기 시전했노
성과를 못내니까 테스트를 더 정확히 할 수 있게 변경하는거임
바꿔말하면 원래 테스트가 벤치딸이었다는소리 ㅇㅇ
트윗 보니까 인간이 풀기에 어렵진 않네 잘만들었노
워우
저번에 무슨 인간평균 넘었다더니 문제 바꾸니까 또 개떡락 진짜 벤치딸 좆도 의미 없네 ㅋㅋㅋ
벤치딸 존나 의미없었네 ㅋㅋ 문제 좀만 바꾸면 다시 떡락하는 벤치 뭔 소용이있노
o1프로가 제일 낫네
o3 얼마나 좆같이 비싼거임
벤치딸 의미없다고 하지마라. 의미 존나 큼. 이런식으로 계속 측정 기준을 다각화하고. 동일 측정기준이라도 계속 심화하고 이걸 ai가 연속해서 만족할수록 우리가 바라는 ai에 가까워지는거임 - dc App
rpg게임 유저 레벨별 사냥터로 바꿔서 생각해보셈 - dc App
문제 바뀌었다고 저렇게 좆박는거 보면, 오픈AI에서도 ARC-AGI 점수딸 치려고 비슷한 유형의 문제 ㅈㄴ 생성해서 학습시킨게 맞는거같네. 진짜 "추론"이 가능한 모델이었으면 이정도로 떨어질리가 없는데.
진짜 "추론"은 무엇을 의미합니까? 나는 그것에 의문을 품는다.
https://arcprize.org/play
<--- 니가 가서 풀어보셈. 위 아래 오른쪽 왼쪽, 갯수세기 이런걸 개념적으로 이해하고 있으면 틀릴 수가 없음. 지금의 LLM은 추론하는 시늉을 하는거지 실제로 이해하지는 못했기 때문에 점수 ㅈ박은거고 ㅋㅋ
흐으음