dalle2,imagen 등은 이미지와 텍스트 데이터를 동시에 스스로 학습하여 처리 및 생성하는 멀티모달 모델이다(o)

더 자세히: dalle2, imagen 등은 이미지 encoder와 텍스트 encoder를 동시에 학습하여 multimodal embedding space로 representation을 mapping한후 constrastive learning을 수행하는 CLIP에 텍스트를 prior로 입력하여 생성한 image embedding을 condition으로 하여 이미지를 생성하는 self-supervised multimodal 모델이다(o)