착시 념글의 아래 댓글이 맞다는 가정하에 실험을 설계해봄


24b0d121e09c28a8699fe8b115ef046c64f0204f



보통의 사람은 연속된 이미지를 쉽게 추론하지만, LLM은 텍스트로만 전달받아 텍스트화 하기어려운 정보를 사용하면 문제를 풀수 없을 것이라 가정하고 보기를 구성함. 문제자체는 매우 쉬우니 쉽게 풀수 있을것임.


문제: 이미지에서 빈 3번칸에 들어갈 적절한 것을 A-F 중에서 고르고 이유를 설명해줘



24b0d121e09c28a8699fe8b115ef046c63f429499b



24b0d121e09c28a8699fe8b115ef046b696d9137



24b0d121e09c28a8699fe8b115ef046c69f02f4894


24b0d121e09c28a8699fe8b115ef046a7468e8c4


(기타: 념글에 이어 문제작성에 도움을 주시는 1206에 감사를)