제미니 설명:
"어려운 문제 집중"은 면죄부가 아니다: LLM이 어려운 문제에서 높은 점수를 받는 것은 훌륭하지만, 그것만으로 기본적인 추론 능력이 갖춰졌다고 볼 수 없습니다.
AIW 문제에서 보이는 취약성은 단순한 "어려운 문제 집중"의 문제가 아니라, 모델의 근본적인 추론 능력 결함을 드러냅니다.
표준 벤치마크의 허상: 현재 사용되는 표준 벤치마크들은 실제 LLM의 추론 능력을 과대평가할 가능성이 있으며, 모델 간의 진정한 성능 비교에 적합하지 않습니다.
즉, 어려운 문제를 잘 푸는 것처럼 보여도, 기본적인 추론 능력이 취약한 모델들이 많다는 의미입니다.
마치 r1처럼? 그리고 그것도 잘하는 o1 프리뷰? - dc App
어려운 문제는 잘 풀지만 쉬운 문제는 이해도 제대로 못하려면 내부구조가 어떻게 되어있어야 하는거지