최근에 멀티모달 임베딩 쪽으로 조금 공부했는데, image + text to image + text 임베딩의 유사도를 이용해서 검색을 하면,  image to text or text to image mapping은 안이루어지고 같은 모달리티끼리 비교되던데...


사람 뇌를 생각하면 꼭 같은 모달리티라고 더 비슷하게 생각하는 건 아닌 것 같은데 (전혀 다른 종의 강아지 사진(리트리버와 불독)과 특정 강아지 종의 이름인 단어 "리트리버"의 유사도를 생각해보면), 이걸 어떻게 해야 해결할 수 있을까...