적어도 4 오푸스나 o3같은 초고성능 LLM에게 판단시켜야 하는 거 아님?
벤치마크를 자꾸 이상하게 만드네
어제 시작한 연구가 아닐테니 당연하지; 지수발전중이라 연구 시작해서 결론나면 다음 모델이 그거 터트리고 있음 - dc App
아니 내 말은 인간성 벤치같은건 최신모델도 포함된 단순 문제풀이만 보는 벤치인데 왜 결과물 식별하는 모델이 o3 mini 따리냐는거임
연구가 하루아침에 되는게 아니잖음
그럼 이걸로 봐https://llm-stats.com/models/compare/gpt-4o-2024-08-06-vs-gemini-2.5-pro
0326모델 아니고 구버전 4o니까 4.1으로 비교해봐도 되고https://llm-stats.com/models/compare/gemini-2.5-pro-vs-gpt-4.1-2025-04-14
어제 시작한 연구가 아닐테니 당연하지; 지수발전중이라 연구 시작해서 결론나면 다음 모델이 그거 터트리고 있음 - dc App
아니 내 말은 인간성 벤치같은건 최신모델도 포함된 단순 문제풀이만 보는 벤치인데 왜 결과물 식별하는 모델이 o3 mini 따리냐는거임
연구가 하루아침에 되는게 아니잖음
그럼 이걸로 봐
https://llm-stats.com/models/compare/gpt-4o-2024-08-06-vs-gemini-2.5-pro
0326모델 아니고 구버전 4o니까 4.1으로 비교해봐도 되고
https://llm-stats.com/models/compare/gemini-2.5-pro-vs-gpt-4.1-2025-04-14