ai 그림 생성에 일관성이 해결되려면 멀티턴 멀티모달 데이터셋이 필요한데
(User:1번 그림체로 2번 캐릭터를 뽑아줘. AI: 네. 여기 있습니다.(3번그림)) 같은거
이런건 어디서 구하기도 빡세다는게 문제네
편법으로 구현하는거 아니면 결국 t2i 일관성을 위해서는 멀티턴 이미지-텍스트 멀티모달이 필수적일듯
지금 그나마 근접한건 nai의 인페인트용 모델인가
얘네는 뭘 썼는지 몰라도 단순히 인페인트할때 한쪽에 레퍼런스 띄워두면 참조해서 일관성 어느정도 지키던데
캐릭터도 아티스트 스타일도 어느정도...
인페인트 할때 사실상 디노이즈 스트렝스는 1인 상태에서 주변만 참조해서 생성하는게 아마 로컬에서 일반적으로 쓰는거랑 다르다는건데
이미지를 생성할 잠재공간의 일부분을 컨텍스트 창처럼 활용할 수 있다는 거지
로컬에서도 이런 편법이 좀 나와주면 좋을텐데
아니면 이미 있는데 내가 모를 뿐인가
gpt한테 물어봐도 별다른 대답은 안나오는군
결국 로라를 쓰라 이거지
그림 일관성 예전에 OAI에서 4o로 가능하다면서 글 올렸었지 않나용? 지들끼리만 써서 괘씸해서 그렇지…
오픈ai는 멀티모달 멀티턴 데이터셋이 있는거지 애초에 멀티모달 모델 학습시키려면 필요조건이라서 구글도 가지고 있을 테고
이미지 프롬프트? IP-adapter로 검색해보면 많이나올걸
ip 어댑터는 결국 어댑터임 모델 자체가 가진 지식이 아니기 때문에 성능은 영...
그게 4o인데 공개를 안함