https://github.com/lechmazur/confabulations/

답변 거부율은 빼고 환각 낮은거만 보면 클로드 계열이 선두에 그록 4랑 제미나이 2.5가 섞여있음




제작자가 RAG에 사용하는걸 가정하고, 답변을 안 하면 RAG 적용시에 쓸모 없으니까 답변 거부율을 50% 합쳐서 계산하는거 같음


결과적으로 환각이 무조건 낮아야 하고 모르면 모른다고 답변하는 것을 선호한다면 클로드 4, 그록 4, 제미나이 2.5가 이 벤치에서 우수하다고 봐야할거 같음

GPT-5는 최대한 답변해주는 스타일 중에 환각이 낮은 편이라고 봐야할 듯