https://github.com/lechmazur/confabulations/
답변 거부율은 빼고 환각 낮은거만 보면 클로드 계열이 선두에 그록 4랑 제미나이 2.5가 섞여있음
제작자가 RAG에 사용하는걸 가정하고, 답변을 안 하면 RAG 적용시에 쓸모 없으니까 답변 거부율을 50% 합쳐서 계산하는거 같음
결과적으로 환각이 무조건 낮아야 하고 모르면 모른다고 답변하는 것을 선호한다면 클로드 4, 그록 4, 제미나이 2.5가 이 벤치에서 우수하다고 봐야할거 같음
GPT-5는 최대한 답변해주는 스타일 중에 환각이 낮은 편이라고 봐야할 듯
념글에 있더라
그거 보고 나서 벤치 사이트의 그래프랑 좀 더 자세히 확인해봤음
ㅇㅇ 보통 환각 벤치들이 주어진 텍스트가 존재하는 상황에서 평가하다 보니 비응답 비율을 안좋게 두고 평가하는데 사실 실사용 측면에서는 애매하면 응답 안해버리는 걸 더 좋아할 수도 있으니
채팅 플랫폼에서는 응답 안 하는게 나은거 같음 모른다 그랬을때 알려주거나 찾아보라고 하면 다시 스무스하게 진행됨 환각 나오면 리롤하거나 질문 수정하거나, 심하면 세션도 새로 파야하고 귀찮아