예를 들어 이렇게처럼, 이미지 부분만 따로 찍으면서 원문 그대로 올리면 틀리는 문제를,
이런 식으로 이미지로 주지 않고, 이미지를 텍스트로 풀어서 설명해주면 진짜 엄청 쉽게 맞추던데
저 둘 차이가 꽤 큼
그림을 텍스트로 풀어서 설명해주면 2026 9모 물리학1 50점 만점 받는데
그림 부분만 따로 찍으면서 올리면 겨우 33점 받음
GPT 5 띵킹 지능 테스트하기 위한 목적인데, 어떤 기준으로 하는게 맞을까?
예를 들어 이렇게처럼, 이미지 부분만 따로 찍으면서 원문 그대로 올리면 틀리는 문제를,
이런 식으로 이미지로 주지 않고, 이미지를 텍스트로 풀어서 설명해주면 진짜 엄청 쉽게 맞추던데
저 둘 차이가 꽤 큼
그림을 텍스트로 풀어서 설명해주면 2026 9모 물리학1 50점 만점 받는데
그림 부분만 따로 찍으면서 올리면 겨우 33점 받음
GPT 5 띵킹 지능 테스트하기 위한 목적인데, 어떤 기준으로 하는게 맞을까?
gpt ocr지능이 좀 안좋은편임. 잼민이로 ocr해서 텍스트 변환후 gpt 쓰셈
그림을 말로 어떻게 설명함 특히 물리 문제는 말로 설명하기 힘들건데
좌표계로 설명함 은근 어렵진 않음
2번째 사진에 중간에 내가 그림에 대한 설명: ~~~ 이 부분
후자가 더 점수가 높아서 하는 말은 아니고... 단순 지능만 따져볼거면 후자가 맞는 것 같음. LLM들이 결국 텍스트로 세상을 이해하는거다보니... 이미지를 올리면, 이미지모델->텍스트 출력과정에서 정보 손실이 있을 수 있거든. 이러면, LLM이 문제인지 i2t모델이 문제인지 애매해지는 것 같음.
OAI OCR 성능이 딸려서 그럼