다만 이미 그럴싸한 이미지 뽑는건 23년 상반기쯤에는 이미 완성이 된 상태였고 그 이후에는 인물 피부톤 같은게 좀 인위적이라거나 손가락 개수나 발가락 개수가 안맞는다거나 하는 디테일한 문제 신경쓰다가

어느 정도 해결된 이후로는 돈될거 같은 동영상 쪽으로 다 넘어간 상태에 가깝지

컵에 꽉찬 액체 이미지 생성 못하는 문제는 학습시에 90퍼센트 정도 찬 컵을 보고 full-filled라고 학습시킨 문제라고 생각함

학습데이터가 별로 없어서도 있겠지만, 애초에 학습할때 데이터가 잘못 입력된게 아닌가 의심스럽다는 말임

컵에 꽉차서 넘쳐흐를 정도의 액체 이미지 사진을 llm에게 보여줬을때 llm은 명확하게 그것이 컵에 꽉찬 어떤 액체라는걸 인지하는 것을 보면 그럴 가능성이 높다고 생각함

짤로 올린 이미지는 스파더맨 웹 패턴이 프린팅된 기모노를 t2i로 뽑은 이미지임
(young woman, kimono featuring Spider-Man web patterns, standing)

당연한 이야기겠지만 구글에 검색해봐도 그런 기모노는 존재하지 않음. 하지만 t2i는 그 작업을 수행했음

애초에 그림 ai자체가 4090 gpu에서도 돌아갈만큼 낮은 사양의 컴퓨팅 파워로도 돌아가도록 만든 ai 모델이라 꽤 멍청하다는 사실도 감안을 해야하고