보리스, 우리 미니 모델의 성능을 확인해 봐. AIME 2024, GPQA, LCB에서 pass@1 기준으로 o3mini high를 모두 뛰어넘었어.

그리고 솔직히 현재의 벤치마크들이 모델의 지능을 충분히 반영하지 못한다고 생각해. 우리 대형 모델인 Grok3는 pass@1에서 더 낮은 성능을 보이지만, 직접 테스트해보면 미니 버전보다 더 똑똑하다는 게 느껴져. 그리고 솔직히 말해서, 내 테스트 기준으로 o3mini high는 o1보다 못한데, 점수는 더 높게 나오더라.

그러니까 함부로 남을 속임수라고 비난하기 전에 네 주장부터 제대로 검토해 봐. 그런 식으로 말하는 건 정말 무례한 일이야

- dc official App