문제 비공개라 훈련못하고


현재도 2% 만 푸는데 ... 실제적 브렉스루 혁신없으면 진짜 어려워보인다.

전문 수학자들이 해결하는데 수 시간에서 수일이 걸리는 수준






제시된 논문에서 설명하는 FrontierMath 벤치마크의 주요 특징들을 정리하겠습니다:


핵심 특징:


1. 독창성과 난이도

- 수백 개의 새롭고 매우 어려운 수학 문제들로 구성

- 전문 수학자들이 해결하는데 수 시간에서 수일이 걸리는 수준

- 현재 최첨단 AI 모델들은 2% 미만의 문제만 해결 가능


2. 문제 검증 시스템 

- 자동화된 검증이 가능한 수치해답 형태로 구성

- Python 기반의 실행 환경에서 코드 실행을 통해 결과 확인

- 답안은 pickle 모듈을 통해 저장되어 자동 채점


3. 분야 다양성

- 현대 수학의 주요 분야를 포괄 (MSC2020 분류의 70% 이상 커버)

- 가장 많은 비중: 정수론(17.8%), 조합론(15.8%), 군론(8.9%) 

- 대수기하학, 미분기하학, 위상수학 등 다양한 분야 포함


4. 문제 난이도 평가 체계

- Background(1-5): 필요한 수학적 배경지식 수준

- Creativity: 핵심 아이디어 도출에 필요한 예상 시간

- Execution: 최종 답안 도출에 필요한 예상 시간


5. 품질 관리

- 60명 이상의 수학자들이 문제 출제 및 검토

- 각 문제는 최소 1명 이상의 전문가 피어리뷰 진행

- 문제의 정확성, 명확성, 난이도 평가 등 검증


이 벤치마크의 주요 목적은:

1. AI 시스템의 고급 수학적 추론 능력을 엄밀하게 평가

2. 데이터 오염 가능성을 최소화하며 새로운 문제들로 구성

3. 자동화된 검증을 통해 효율적인 평가 가능

4. 현대 수학의 다양한 분야에 걸친 포괄적인 능력 측정


FrontierMath 벤치마크의 문제 공개 정책은 다음과 같습니다:


1. 대부분의 문제는 비공개

- 벤치마크의 대부분의 문제들은 공개되지 않았습니다

- 이는 벤치마크의 평가 가치를 유지하고 데이터 오염을 방지하기 위함입니다


2. 샘플 문제만 공개

- 논문에서는 5개의 대표 샘플 문제만 공개됨

- 각 난이도 구간에서 무작위로 선택된 문제들

- 공개된 샘플 문제들:

  1. 정수론 관련 고난도 문제 (연구 수준)

  2. 대수기하학 관련 중-고난도 문제

  3. p-진 해석학 관련 중간 난도 문제

  4. 군론 관련 중-하 난도 문제

  5. 대수기하학 관련 기초 난도 문제


3. 벤치마크 접근

- 벤치마크를 사용하여 모델을 평가하고 싶은 팀은 math_evals@epochai.org로 연락하도록 안내

- 실제 평가는 비공개 문제들로 진행됨


4. 보안 관리

- 문제들은 암호화된 채널을 통해 관리

- 온라인 저장 시 패스워드로 보호된 아카이브 사용

- 표절 검사 도구를 통해 문제의 독창성 확인


이러한 정책은 벤치마크의 평가 가치를 보존하면서도, 벤치마크의 특성과 난이도를 이해할 수 있도록 샘플을 제공하는 균형을 맞추고 있습니다.