gpt4에서 이미지를 올리면 분석해주고 뭔가를 요구하면 그려주잖아. 그런데 그 두가지를 결합해야하는거 아닐까?
그래야 이미지를 올리고 이런 스타일로 이런이런 내용으로 해줘 이게 가능한데
있는데 내가 모르는건지?
댓글 4
이미지 분석하는 모델이, 이미지 분석하는 방식이랑
달리3가 이미지 생성하는 방식이 달라서 그럴걸.
밑에 통합 업데이트보면 약간 연결은 할 것 같은데 그래도 생각하는 연결은 아닐거임.
익명(175.206)2023-10-29 14:53
답글
내가 얕게 알기로는
이미지 인식하는 모델은, 이미지 세그멘테이션이라고 하나, 일단 영역을 나눔. 강아지 부분, 고양이 부분, 사람 부분, 배경 부분. 등등. 그런 다음에 각각을 분석함. 학습 잘 한 큰 모델이면, 무슨무슨 강아지. 무슨 표정을 짓고 있는 사람 등등을 내뱉음. 그리고 GPT는 그 텍스트 내용을 분석해서 전달해주는 것 같음.
근데 달리3는, 이건 더 잘 모르지만, 난수에서 그림 생성 해내는 걸거임. 계속하다보니까 아, 이런 난수 조합에선 이런 그림이 나오는구나. 그럼 이런 텍스트는 이런 난수랑 조합하면 되겠다. 그래서 텍스트 입력하면 비슷한 그림이 나옴.
즉, 이미지 모델은 이미지 분석 -> 텍스트 생성 이거고, 달리는 텍스트 -> 이미지 이건데 이 두가지 텍스트가 동일한 게 아님.
익명(175.206)2023-10-29 15:05
답글
텍스트는 텍스트인데, 서로 사용하는 방식이 좀 달랐던거임. 그래서 두 텍스트를 연결시키는 작업도 필요할거임. 근데 쉽게 바로 할 순 없으니까 시간이 좀 걸리는 것 같음.
인 것 같은데 잘 몰루겠음. 잘 아는 특붕이가 설명해주겠지.
이미지 분석하는 모델이, 이미지 분석하는 방식이랑 달리3가 이미지 생성하는 방식이 달라서 그럴걸. 밑에 통합 업데이트보면 약간 연결은 할 것 같은데 그래도 생각하는 연결은 아닐거임.
내가 얕게 알기로는 이미지 인식하는 모델은, 이미지 세그멘테이션이라고 하나, 일단 영역을 나눔. 강아지 부분, 고양이 부분, 사람 부분, 배경 부분. 등등. 그런 다음에 각각을 분석함. 학습 잘 한 큰 모델이면, 무슨무슨 강아지. 무슨 표정을 짓고 있는 사람 등등을 내뱉음. 그리고 GPT는 그 텍스트 내용을 분석해서 전달해주는 것 같음. 근데 달리3는, 이건 더 잘 모르지만, 난수에서 그림 생성 해내는 걸거임. 계속하다보니까 아, 이런 난수 조합에선 이런 그림이 나오는구나. 그럼 이런 텍스트는 이런 난수랑 조합하면 되겠다. 그래서 텍스트 입력하면 비슷한 그림이 나옴. 즉, 이미지 모델은 이미지 분석 -> 텍스트 생성 이거고, 달리는 텍스트 -> 이미지 이건데 이 두가지 텍스트가 동일한 게 아님.
텍스트는 텍스트인데, 서로 사용하는 방식이 좀 달랐던거임. 그래서 두 텍스트를 연결시키는 작업도 필요할거임. 근데 쉽게 바로 할 순 없으니까 시간이 좀 걸리는 것 같음. 인 것 같은데 잘 몰루겠음. 잘 아는 특붕이가 설명해주겠지.
그럴듯한듯