그게 그 그림에 가장 알맞는 프롬프트 아닐까?
프롬프트 공유사이트 별로 없는게 짜증나네 지들만 생성하고
Tagger
태거로 변환한거로 sd에 먹이면 그대로 안나옴
그야 그대로 안 나오겠지 마법처럼 뭐든 해결됐으면 지금쯤 너도나도 쓰려고 했지 아직은 노력이 필요한 도구임
그게 역으로 되던가
LLM이 실제로 보는 게 아니라 비전 모델이 이미지 투 텍스트로 하는 거라 비전 모델 성능에 따라 갈리는 거여서 LLM이랑은 크게 연관 없지 않을까
아 그림생성 ai를 llm으로 봤네
텍스트 주어진거 해석해서 자기가 만들어낸 이미지니 이미지를 주면 역으로 되어야 정상 아닐까?
트랜스포머 기반이라 틀리진 않은 것 같기도 단일신경망일 경우엔 다를 듯
I2M이 아니라 단일신경망으로 모달이 자체적으로 처리 돼야 정상 지금의 경우엔 그림생성 모델이나 LLM이 직접 처리하는 게 아니라서
포워드 패스는 기본적으로 단방향 훈련성을 가져서 역방향 추론은 불가능한건 둘째치고 디퓨전은 마르코프체인 기반이라 시드가 조금만 달라져도 픽셀 분포에 막대한 영향력을 끼치는데 시드값을 모르는 이상 프롬프트 예측을 불가능에 가까움
가장 효과적인 프롬프트 예측 방법은 성능 좋은 vlm한테 다양한 형태의 캡션을 제공해달라고 하고 수동으로 테스트 해봐야함
Tagger
태거로 변환한거로 sd에 먹이면 그대로 안나옴
그야 그대로 안 나오겠지 마법처럼 뭐든 해결됐으면 지금쯤 너도나도 쓰려고 했지 아직은 노력이 필요한 도구임
그게 역으로 되던가
LLM이 실제로 보는 게 아니라 비전 모델이 이미지 투 텍스트로 하는 거라 비전 모델 성능에 따라 갈리는 거여서 LLM이랑은 크게 연관 없지 않을까
아 그림생성 ai를 llm으로 봤네
텍스트 주어진거 해석해서 자기가 만들어낸 이미지니 이미지를 주면 역으로 되어야 정상 아닐까?
트랜스포머 기반이라 틀리진 않은 것 같기도 단일신경망일 경우엔 다를 듯
I2M이 아니라 단일신경망으로 모달이 자체적으로 처리 돼야 정상 지금의 경우엔 그림생성 모델이나 LLM이 직접 처리하는 게 아니라서
포워드 패스는 기본적으로 단방향 훈련성을 가져서 역방향 추론은 불가능한건 둘째치고 디퓨전은 마르코프체인 기반이라 시드가 조금만 달라져도 픽셀 분포에 막대한 영향력을 끼치는데 시드값을 모르는 이상 프롬프트 예측을 불가능에 가까움
가장 효과적인 프롬프트 예측 방법은 성능 좋은 vlm한테 다양한 형태의 캡션을 제공해달라고 하고 수동으로 테스트 해봐야함