ai 그림 생성에 일관성이 해결되려면 멀티턴 멀티모달 데이터셋이 필요한데

(User:1번 그림체로 2번 캐릭터를 뽑아줘. AI: 네. 여기 있습니다.(3번그림)) 같은거

이런건 어디서 구하기도 빡세다는게 문제네

편법으로 구현하는거 아니면 결국 t2i 일관성을 위해서는 멀티턴 이미지-텍스트 멀티모달이 필수적일듯

지금 그나마 근접한건 nai의 인페인트용 모델인가

얘네는 뭘 썼는지 몰라도 단순히 인페인트할때 한쪽에 레퍼런스 띄워두면 참조해서 일관성 어느정도 지키던데

캐릭터도 아티스트 스타일도 어느정도...

인페인트 할때 사실상 디노이즈 스트렝스는 1인 상태에서 주변만 참조해서 생성하는게 아마 로컬에서 일반적으로 쓰는거랑 다르다는건데

이미지를 생성할 잠재공간의 일부분을 컨텍스트 창처럼 활용할 수 있다는 거지

로컬에서도 이런 편법이 좀 나와주면 좋을텐데

아니면 이미 있는데 내가 모를 뿐인가

gpt한테 물어봐도 별다른 대답은 안나오는군

결국 로라를 쓰라 이거지