MATH는 gpt3같은 기존 언어모델이 scaling만으로 해결 불가능한걸 찾으려고 작정하고 만든 벤치마크임

MATH 벤치마크 논문에서는 gpt한테 단계적인 추론이 필요한 수학문제 풀게했더니 아무리 scale up을 해도 성능이 잘 안늘어났음. 단순 계산으로 파라미터를 10^35개까지 늘려야 MATH 40%를 풀수있다는 결과가 나왔었음 이래서 수학적, 단계적 추론이 LLM한테 치명적인 결함 취급받았지 기호주의자들이 자주 걸고넘어지는거도 이부분이었고


작년에 전문가들한테 조사했던 2025년에 MATH 50% 달성가능할 거란 예측도 기술발전이 가속화된다는 가정 하의 나름 낙관적인 예측이었음. 근데 예측 다좆까고 걍 2022년 6월에 달성해버린거임