GPT는 언어모델이니까....아무래도 인식 모델 하나 연동 시켜서 텍스트 내뱉게 하고, 그걸 토대로 대화 나누는 거 같음. 물론, 공개는 안 했지만 그게 확률 높을 듯.
API에 비전 부분 설명 보면 512*512 해상도로 쪼개서 인식하고 512*512마다 60토큰정도 필요하대. 별도 모델 있을거같음
GPT는 언어모델이니까....아무래도 인식 모델 하나 연동 시켜서 텍스트 내뱉게 하고, 그걸 토대로 대화 나누는 거 같음. 물론, 공개는 안 했지만 그게 확률 높을 듯.
API에 비전 부분 설명 보면 512*512 해상도로 쪼개서 인식하고 512*512마다 60토큰정도 필요하대. 별도 모델 있을거같음