쳇봇 아레나는 사용자들이 두 개의 모델을 사용해 보고 평가해보는 시스템입니다.

정답을 학습할 수 있는 MMLU와 같은 벤치마크와 달리 실제 사용자의 선호도를 정확하게 평가할 수 있다는 장점이 있습니다.

실제로 OpenAI의 안드레 카파시가 유일하게 신뢰하는 2개의 평가 지표 중 하나입니다.
Reference:
https://x.com/karpathy/status/1737544497016578453?s=46&t=NORpsj0R4coZAENOyHWtdg




새로 나온 구글 바드 버전에서의 결과가 나왔는데 구식 GPT-4 버전(0314, 0613)을 제치고 2위를 차지했습니다. 1위인 GPT-4 Turbo 에 이은 점수 입니다.
구글이 어느 정도 추격을 했다는 것을 보여 주는 것 같습니다.
바드는 구독이 따로 필요 없다는 장점도 생각해 봐야 되겠네요.Reference:
https://x.com/lmsysorg/status/1750921228012122526?s=20