문제 비공개라 훈련못하고
전문 수학자들이 해결하는데 수 시간에서 수일이 걸리는 수준
제시된 논문에서 설명하는 FrontierMath 벤치마크의 주요 특징들을 정리하겠습니다:
핵심 특징:
1. 독창성과 난이도
- 수백 개의 새롭고 매우 어려운 수학 문제들로 구성
- 전문 수학자들이 해결하는데 수 시간에서 수일이 걸리는 수준
- 현재 최첨단 AI 모델들은 2% 미만의 문제만 해결 가능
2. 문제 검증 시스템
- 자동화된 검증이 가능한 수치해답 형태로 구성
- Python 기반의 실행 환경에서 코드 실행을 통해 결과 확인
- 답안은 pickle 모듈을 통해 저장되어 자동 채점
3. 분야 다양성
- 현대 수학의 주요 분야를 포괄 (MSC2020 분류의 70% 이상 커버)
- 가장 많은 비중: 정수론(17.8%), 조합론(15.8%), 군론(8.9%)
- 대수기하학, 미분기하학, 위상수학 등 다양한 분야 포함
4. 문제 난이도 평가 체계
- Background(1-5): 필요한 수학적 배경지식 수준
- Creativity: 핵심 아이디어 도출에 필요한 예상 시간
- Execution: 최종 답안 도출에 필요한 예상 시간
5. 품질 관리
- 60명 이상의 수학자들이 문제 출제 및 검토
- 각 문제는 최소 1명 이상의 전문가 피어리뷰 진행
- 문제의 정확성, 명확성, 난이도 평가 등 검증
이 벤치마크의 주요 목적은:
1. AI 시스템의 고급 수학적 추론 능력을 엄밀하게 평가
2. 데이터 오염 가능성을 최소화하며 새로운 문제들로 구성
3. 자동화된 검증을 통해 효율적인 평가 가능
4. 현대 수학의 다양한 분야에 걸친 포괄적인 능력 측정
FrontierMath 벤치마크의 문제 공개 정책은 다음과 같습니다:
1. 대부분의 문제는 비공개
- 벤치마크의 대부분의 문제들은 공개되지 않았습니다
- 이는 벤치마크의 평가 가치를 유지하고 데이터 오염을 방지하기 위함입니다
2. 샘플 문제만 공개
- 논문에서는 5개의 대표 샘플 문제만 공개됨
- 각 난이도 구간에서 무작위로 선택된 문제들
- 공개된 샘플 문제들:
1. 정수론 관련 고난도 문제 (연구 수준)
2. 대수기하학 관련 중-고난도 문제
3. p-진 해석학 관련 중간 난도 문제
4. 군론 관련 중-하 난도 문제
5. 대수기하학 관련 기초 난도 문제
3. 벤치마크 접근
- 벤치마크를 사용하여 모델을 평가하고 싶은 팀은 math_evals@epochai.org로 연락하도록 안내
- 실제 평가는 비공개 문제들로 진행됨
4. 보안 관리
- 문제들은 암호화된 채널을 통해 관리
- 온라인 저장 시 패스워드로 보호된 아카이브 사용
- 표절 검사 도구를 통해 문제의 독창성 확인
이러한 정책은 벤치마크의 평가 가치를 보존하면서도, 벤치마크의 특성과 난이도를 이해할 수 있도록 샘플을 제공하는 균형을 맞추고 있습니다.
파이썬으로 풀이 과정도 중요하게 검증한다 ㄷㄷㄷ
이거 100프로 해결 6년 예상함
저거 순수 추론으로 해결하면 진짜 창조적인 작업 왠만한거 다 대체가능할듯
ㄴ 저건 사만다, 자비스도 못 풀듯 인공의식이 아닌 진짜 초지능의 영역 같아보임
내년이면 다 풂
ㄴ 과도한 망상은 몸에 해롭다 게이야 그게 됐으면 진작에 오픈ai에서 반박 나왔지