쳇봇 아레나는 사용자들이 두 개의 모델을 사용해 보고 평가해보는 시스템입니다.
정답을 학습할 수 있는 MMLU와 같은 벤치마크와 달리 실제 사용자의 선호도를 정확하게 평가할 수 있다는 장점이 있습니다.
실제로 OpenAI의 안드레 카파시가 유일하게 신뢰하는 2개의 평가 지표 중 하나입니다.
Reference:
https://x.com/karpathy/status/1737544497016578453?s=46&t=NORpsj0R4coZAENOyHWtdg
새로 나온 구글 바드 버전에서의 결과가 나왔는데 구식 GPT-4 버전(0314, 0613)을 제치고 2위를 차지했습니다. 1위인 GPT-4 Turbo 에 이은 점수 입니다.
구글이 어느 정도 추격을 했다는 것을 보여 주는 것 같습니다.
바드는 구독이 따로 필요 없다는 장점도 생각해 봐야 되겠네요.Reference:
https://x.com/lmsysorg/status/1750921228012122526?s=20
정답을 학습할 수 있는 MMLU와 같은 벤치마크와 달리 실제 사용자의 선호도를 정확하게 평가할 수 있다는 장점이 있습니다.
실제로 OpenAI의 안드레 카파시가 유일하게 신뢰하는 2개의 평가 지표 중 하나입니다.
Reference:
https://x.com/karpathy/status/1737544497016578453?s=46&t=NORpsj0R4coZAENOyHWtdg
I pretty much only trust two LLM evals right now: Chatbot Arena and r/LocalLlama comments section
— Andrej Karpathy (@karpathy) December 20, 2023
새로 나온 구글 바드 버전에서의 결과가 나왔는데 구식 GPT-4 버전(0314, 0613)을 제치고 2위를 차지했습니다. 1위인 GPT-4 Turbo 에 이은 점수 입니다.
구글이 어느 정도 추격을 했다는 것을 보여 주는 것 같습니다.
바드는 구독이 따로 필요 없다는 장점도 생각해 봐야 되겠네요.Reference:
https://x.com/lmsysorg/status/1750921228012122526?s=20
🔥Breaking News from Arena
— Arena.ai (@arena) January 26, 2024
Google's Bard has just made a stunning leap, surpassing GPT-4 to the SECOND SPOT on the leaderboard! Big congrats to @Google for the remarkable achievement!
The race is heating up like never before! Super excited to see what's next for Bard + Gemini… pic.twitter.com/QPtsqZdJhC
실시간 리더보드
https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
원하시면
모델 평가에 직접 참여하실 수도 있습니다.