다중 모델 아니라 텍스트 하위 집합만 평가했다는데
멀티모달자료 다 0점처리하고 점수 매긴건지
멀티모달 문제 제외하고 점수 매긴건지 따라 다른데
후자면 점수가 비교했을때 높게 측정된 편이고 전자면 성능이 매우 좋은거(대체로 멀티모달 성능이 아직 텍스트보다 낮기 때문에)
다중 모델 아니라 텍스트 하위 집합만 평가했다는데
멀티모달자료 다 0점처리하고 점수 매긴건지
멀티모달 문제 제외하고 점수 매긴건지 따라 다른데
후자면 점수가 비교했을때 높게 측정된 편이고 전자면 성능이 매우 좋은거(대체로 멀티모달 성능이 아직 텍스트보다 낮기 때문에)
논문 24페이지에 다른 모델한테도 텍스트 시험만 줬을 때 결과 첨부되어있음 물론 그 조건에서도 4o가 짐 (8.9%)
https://static.scale.com/uploads/654197dc94d34f66c0f5184e/Publication%20Ready%20Humanity's%20Last%20Exam.pdf
아 4o랜다 o1 말한거임