지금 제미나이 2.5 프로가 최고모델이라고 얘기하고
그 근거로 벤치마크 데이터를 보여주는데

이때까지 경험상
벤치에서 앞선다고 나오는 여러 모델들을 써보면
한국어 사용자 입장에선
gpt4o~o3를 못이긴다는 느낌이 들었습니다

제미나이와 gpt에게 같은 질문을 하면
gpt가 좀더 본인에게 만족스러운 결과를 내기도 하고(본인 메모리 때문에 그런거같긴함)

최근에는 논문 읽고 문단단위로 번역해달라 뭐 그런질문을 하면
계속 요약을 준다던지 하더라고요

그래서 사용자경험 측면, 특히 한국어 사용자 입장에서 저런 벤치마크 데이터는 그렇게 와닿지 않는데

이 갤러리에서는 저런 벤치마크 향상을 순수하게 agi 에 한발 더 가까워졌다는 측면에서 환호를 하는것인지

실사용에서 저정도 벤치마크 성능향상폭이 체감이 돼서 환호를 하는건지 궁금합니다...

- dc official App