오늘 갤에 올라온 putnam - axiom같은 벤치가 출시 100일이 넘었는데도
지표로 사용 안되는 이유는 너무 간단함
데이터 신뢰성, 충분한 볼륨, 합리적인 난이도 배분, 업계 다수가 인정하는 검증방식 이걸 못갖췄기 때문임
검증도 안된 벤치에서 점수 낮게 뜨면 그걸 누가 인정하노?
그리고 애초에 o1프리뷰에서 48%(변형후 35%) 수준이면 점수가 낮은것도 아님ㅋㅋㅋ
arc-agi는 20%딱이었는걸
오늘 갤에 올라온 putnam - axiom같은 벤치가 출시 100일이 넘었는데도
지표로 사용 안되는 이유는 너무 간단함
데이터 신뢰성, 충분한 볼륨, 합리적인 난이도 배분, 업계 다수가 인정하는 검증방식 이걸 못갖췄기 때문임
검증도 안된 벤치에서 점수 낮게 뜨면 그걸 누가 인정하노?
그리고 애초에 o1프리뷰에서 48%(변형후 35%) 수준이면 점수가 낮은것도 아님ㅋㅋㅋ
arc-agi는 20%딱이었는걸
댓글 0