걍 해석대상 모델의 은닉층 정보를 이미지화해서 비전모델류 거쳐서 flatten을 멀티모달모델 피드포워드에 들어가는 의미벡터사이즈로 뽑고
마치 엄밀한 논리절차에 의해 해석대상모델의 입력값에서 출력값이 나온것처럼 작성한 텍스트로 은닉층정보에서 flatten까지의 가중치만 학습한뒤 이를 텍스트로 디코딩하면 블박에 멀티모달모델의추론이 적용되어 텍스트로 표현되지않을까?
마치 엄밀한 논리절차에 의해 해석대상모델의 입력값에서 출력값이 나온것처럼 작성한 텍스트로 은닉층정보에서 flatten까지의 가중치만 학습한뒤 이를 텍스트로 디코딩하면 블박에 멀티모달모델의추론이 적용되어 텍스트로 표현되지않을까?
댓글 0