디퓨전 모델의 특성상 정해져 있는 해상도규격에 국한되기 때문애 기술적인 구조상 단편적인 일러스트 만 생성할 수 있음
그리고 인공지능에게 자신이 그린그림을 다시 참조해서 그려보라고 하면 불가능함 왜냐면 디퓨전 모델에는 '연산공간' 이라는 현재 텍스트 모델과 고급 보이스 모델도 가지고 있는 일관성 유지를 위한 윈도우가 없음
그래서 OAI 는 이미지의 일관성 유지를 위해서 이미지를 토큰화 하는 방법을 개발하게 된거임
토큰 이라는 동일 한 방식을 공유 하고 있기때문애 오디오 , 텍스트 , 이미지 등등의 서로 교합할 수 없는 각각의 데이터들을 동일한 연산공간 내에서 처리할 수 있게 된거임
그리고 이것은 우리가 그토록 바라는 일관성 유지 모델의 새로운 활로임
로라 와 그림체데이터 떡칠해서 마치 일관성을 유지하는것 처럼 보여지는 구형 방식에서 벗어나야 함
디퓨전 성애자들에게 묻고싶음 그래서 디퓨전은 저거 할 수 있음?
진짜 AI그림으로 현직자들 대가리 따고 싶으면
OAI가 새로운 지평을 열어둔 이 멀티모달 신경망에 집중해야함
그냥 젖보똥 부곽하는 씹덕 딸깜 그림 하나로는 만족못하잖아?
얘내들 굴려서 만화도 만들고 서사도 그려내려내서 생명을 불어넣어야 직성이 풀리지
디퓨전 패러다임 좆같긴 함 쓸데없이 연산만 많이하고.. 딱봐도 한계있음. GAN 버려졌듯이 더 좋은거 나와서 diffusion도 버려져야됨
이미지 데이터를 처리하는 방식의 변화가 필요하다 현재로서 다음 돌파구로 제시할 수 있는게 토큰화 고 ㅇㅇ 디퓨전은 곧 구닥다리 될거임
메타가 발표한 인물프롬처럼 이미지 프롬같은거 넣을수도 있을듯. 그 외에 레이아웃, 구도도 제대로 안돼 인물 여러명 넣으면 망가지고 컨트롤넷 써도 학습데이더 부족한 부분은 망가짐. 현 상태론 한장짜리 컨셉아트나 외주할때나 쓰이고 만화는 뭐 돌파구 안나오면 멀었음
추론을 통해서 이해한게 아니라 천문학적인 통계로 접근하는 말그대로 일반화 패턴인식이니 ...
소라가 디퓨전 트랜스포머 기반인건 아냐? - dc App