물병문제: 딥식과 달리 가볍게 성공
다음은 강건너기 문제를 테스트해봄. 다른 모델의 결과를 보고 싶으면 아래링크 참고.
https://gall.dcinside.com/mgallery/board/view/?id=thesingularity&no=567324
강건너기(영문): 답은 구했으나 정답까진 실패.
혹시나 해서 o1-preview 영문으로 테스트하면 원하는 답인 다리로 이동한다를 얻어냄.
중국에서 만든 인공지능이니 중국어를 가장 잘하는 것이 아닐까 하여 번역을 부탁해봄.
음??????
결론: o1-mini 처럼 다른 지능을 낮추고 추론에 과적합한 것으로 보이며, 문제 이해능력은 다소 떨어져보임.
번외: 한국어를 못하는가 해서 추가질문.
qwen에서도 수학과 코드에는 강력하지만 일반 상식 및 추론에는 아직 부족하다구 해놨슴. 앞으로 좋아지길 기대... - dc App
성능 및 벤치마크 제한 사항 : 이 모델은 수학과 코딩 분야에서는 탁월하지만 상식적 추론 및 미묘한 언어 이해와 같은 다른 분야에서는 개선의 여지가 있습니다. - dc App