그냥 내부적으로 이미지 캡셔닝 모델이 따로 있어서 캡셔닝 모델이 그림을 보고 요약하는 글을 생성하면 text-only gpt4가 그걸 참고해서 답변하는 단순한 방식일 확률이 매우 높다. gpt4 자체가 멀티모달이 된 것이 아님. 그건 아직 공개 안됨. 따라서 이거가지고 신기해할 필요도 없음.