실제 제목

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

생각의 환상: 문제 복잡성의 렌즈를 통해 본 추론 모델의 강점과 한계




대충 문제 복잡도가 높아지면 생각 길이도 길어짐(직관적으로 이해 가능)
근데 복잡도가 어느 수준을 넘어가면 오히려 생각 토큰이 짧아지고 중도포기해버리는 현상이 있다고 함(게으른 새끼들...)


그리고 모델들의 AIME 24랑 25 점수가 비일관적으로 나오고, 다른 벤치들 사이에서도 이런 관계가 발견되는데 이는 데이터 오염이 원인으로 보임.

즉 벤치마크 점수(최종 문제 정답률)만으로 모델의 생각 수준이 높고 낮고를 판단하면 안될 수 있음.




대충 gpt랑 대화한 내용