본문 바로가기
숨터 가볍게 읽는 공간
이미지 차단
전체 베스트 최근
← thesingularity 게시판

[일반] Arc-agi2 결과 뜸

익명(39.117) 2025-03-25 07:23 추천 22


7ced8076b58268f139ea98bf06d6040398e0fc8fd207a2f5b8

https://x.com/arcprize/status/1904269312740987377?t=8HX_J0CeMLTlXTReYi4qOQ&s=19

Base LLMs (no reasoning) are currently scoring 0% on ARC-AGI-2.

Specialized AI reasoning systems (like R1 and o3-mini) score <4%. Even AI systems with high adaptation like o1 pro and o3 low score single-digits (est.) pic.twitter.com/Dl0awtcRdK

— ARC Prize (@arcprize) March 24, 2025


흠..

댓글 23

  • dccon
    바다기린(hancomputer) 2025-03-25 07:37
  • O3는 로우도 가격이 미쳐 돌았네ㄷㄷ

    익명(211.253) 2025-03-25 07:59
  • 걍 말이 안되긴 한다 o3 ㅋㅋ 안푸는 이유가 있네 - dc App

    익명(wanted7407) 2025-03-25 08:29
  • 와 미친 arc2 제대로 만들었네

    익명(shore1232) 2025-03-25 09:10
  • 저거 인간은 100점나옴?

    ㅇㅇ 1(222.114) 2025-03-25 09:22
  • 답글

    ㄴㄴ 100점까진 아니고 Arc는 선진국에서 어느정도 교육받은 보통 인간이라면 80점 이상 나올 수 있게 설계함

    익명(shore1232) 2025-03-25 09:29
  • 답글

    그럼 저걸 특붕이들이 풀면 8,90점 나온단거노

    익명(haircut2819) 2025-03-25 09:59
  • 답글

    보통인간 85점인데 사람이 틀리는 건 실수도 많고, 전체적인 규칙은 파악했는데 사소한거 놓치는 정도임. 30x30 격자에 규칙찾아서 색칠하는 문제들인데 빼먹고 한칸 안 한다거나 잘못된 색을 넣는다거나 이런것들. 그에 반해 AI 는 틀리면 그냥 얼척없이 틀리는 수준. 그리고 ARC AGI 1 기준으로는 답안 두 개 내서 둘 중 하나라도 맞으면 정답처리였음. 근데 사람은 답안지를 하나만 내니까(두개 만들라고 해도 못만들지) 사실 역량차이는 아직 많이 나는거지

    ㅇㅇ 4(121.190) 2025-03-25 17:27
  • arc-agi 골대옮기기 시전했노

    익명(chill9312) 2025-03-25 09:30
  • 답글

    성과를 못내니까 테스트를 더 정확히 할 수 있게 변경하는거임

    ㅇㅇ 2(180.224) 2025-03-25 10:47
  • 답글

    바꿔말하면 원래 테스트가 벤치딸이었다는소리 ㅇㅇ

    ㅇㅇ 2(180.224) 2025-03-25 10:47
  • 트윗 보니까 인간이 풀기에 어렵진 않네 잘만들었노

    익명(1.227) 2025-03-25 09:35
  • 워우

    니지카엘(eltldd001) 2025-03-25 10:00
  • 저번에 무슨 인간평균 넘었다더니 문제 바꾸니까 또 개떡락 진짜 벤치딸 좆도 의미 없네 ㅋㅋㅋ

    익명(leaf4518) 2025-03-25 10:12
  • 벤치딸 존나 의미없었네 ㅋㅋ 문제 좀만 바꾸면 다시 떡락하는 벤치 뭔 소용이있노

    ㅇㅇ 3(220.70) 2025-03-25 11:26
  • o1프로가 제일 낫네

    네덕근첩(naverduck1234) 2025-03-25 12:00
  • o3 얼마나 좆같이 비싼거임

    익명(flexible7412) 2025-03-25 12:02
  • 벤치딸 의미없다고 하지마라. 의미 존나 큼. 이런식으로 계속 측정 기준을 다각화하고. 동일 측정기준이라도 계속 심화하고 이걸 ai가 연속해서 만족할수록 우리가 바라는 ai에 가까워지는거임 - dc App

    익명(aquarium0201) 2025-03-25 14:35
  • 답글

    rpg게임 유저 레벨별 사냥터로 바꿔서 생각해보셈 - dc App

    익명(aquarium0201) 2025-03-25 14:36
  • 문제 바뀌었다고 저렇게 좆박는거 보면, 오픈AI에서도 ARC-AGI 점수딸 치려고 비슷한 유형의 문제 ㅈㄴ 생성해서 학습시킨게 맞는거같네. 진짜 "추론"이 가능한 모델이었으면 이정도로 떨어질리가 없는데.

    ㅇㅇ 4(121.190) 2025-03-25 17:18
  • 답글

    진짜 "추론"은 무엇을 의미합니까? 나는 그것에 의문을 품는다.

    익명(121.165) 2025-03-25 18:02
  • 답글

    https://arcprize.org/play
    <--- 니가 가서 풀어보셈. 위 아래 오른쪽 왼쪽, 갯수세기 이런걸 개념적으로 이해하고 있으면 틀릴 수가 없음. 지금의 LLM은 추론하는 시늉을 하는거지 실제로 이해하지는 못했기 때문에 점수 ㅈ박은거고 ㅋㅋ

    ㅇㅇ 4(121.190) 2025-03-25 18:39
  • 흐으음

    ㅇㅇㅇㅇㅇ(lsh0320jpgpw) 2025-03-26 22:13

다른 게시글

  • o3 full은 그래서 어느정도 성능인거임
    [일반] 익명(115.139) | 25.03.25
    추천 0
  • 네뷸라가 제미니 프로 띵킹 맞는듯 [2]
    [일반] 익명(black542) | 25.03.25
    추천 3
  • 로봇에 허리가 있으니 동작이 훨씬 자연스럽네 [3]
    [일반] 익명(121.170) | 25.03.25
    추천 30
  • 의료행위를 하는 휴머노이드 로봇 [4]
    [📪정보] 익명(220.73) | 25.03.25
    추천 1
  • 애플은 ㄹㅇ 개씹좆망이네 [9]
    [일반] 익명(memory1669) | 25.03.25
    추천 1
  • 오늘 딥식 v3.1 나왔는데 [2]
    [일반] 익명(220.65) | 25.03.25
    추천 2
  • 요즘 그림 ai는 딱 이정도 인거 같던데 [13]
    [일반] 익명(58.227) | 25.03.25
    추천 0
  • 구글에 딥 리서치 검색하니까 나온거 [2]
    [일반] 유람(eba1eba) | 25.03.25
    추천 1
  • 한국은 양안걱정 크게안해도될듯 [6]
    [일반] 익명(121.168) | 25.03.25
    추천 1
  • 딥리서치 덕에 나는 일상에서 AI 발전 굉장히 크게 느껴짐 [6]
    [일반] 익명(prison9540) | 25.03.25
    추천 4
목록으로
읽기 전용 미러