https://huggingface.co/spaces/allenai/ZebraLogic
Zebra Logic Bench - a Hugging Face Space by allenaiZebra Logic Bench - a Hugging Face Space by allenaihuggingface.co쉬운 퍼즐 ,어려운 퍼즐 항목이있는데 쉬운 퍼즐은 인공지능의 점수가 다 큰 차이가 안 나지만 어려운 퍼즐은 점수 차이가 상당함
어려운 퍼즐과 전체적인 정답률 산점도
맨 오른쪽 맨 위에 압도적 선두가 o1 프리뷰 , 그보다 확 떨어져 있는게 o1 mini
나머지 모델들은 전부 모여 있음
o1 제외 나머지 모델들의 추론 능력은 다 비슷비슷하다고 봐야 할듯 , 3.5 소넷이 그나마 o1 제외 한 모델중에서는 추론 점수가 제일 높긴 했는데 큰 차이는 나지 않았음
70%는 푸는게 개쩌노
근데 왜 지피티사용하면 o1 프리뷰만 내놓으면 되는 걸 복잡하게 선택가능하게 다 끼워넣는거야? 달e는 그림전용이라 그런다고 치는데..
연산력이 많이 들고 현재 상태에서는 모든 사용자가 다 그 정도까지 필요가 없으니까
프리뷰는 답변이 늦으니까. 간단한 질문도 생각하면 귀찮지.
아 .. 감사합니다