텍스트로 이미지를 싱성해내는 기술이 충분히 건재한데 그걸 정확히 반대로 하면 그게 멀티모달이지. 지금도 나와있는건 많음그걸이제 llm에 얼마나 잘 접목시켜서 분석까지 제대로 하느냐가 관건인거지
아니지 미드저니같은건 태그로 나눠서 만든거라 맥락을 거의 이해못하는데 LLaVA는 맥락을 완벽하게 이해하든데? 이거 4월에 나온기술이고 아직 덜 알려진거같은데 gpt보다 더 신기함
그게 llm의 영역이라니까? 무슨무슨 물건이 있고 사람들이 무슨 행동을 취하는것까지는 img to txt의 영역이지만 그 정보를 가지고 llm이 추론하는거야
gpt-4랑은 언어 능력의 차이가 나니까 아무래도 놀랍긴 하지'
해당 댓글은 삭제되었습니다.
이미지 인식후 분석
좀더 넓게는 이미지뿐아니라 소리나 촉각도 포함이고
걍 알고리즘 대응이 텍스트에서 끝나지 않는것을 말하는거 아닌가
그건 멀티모달이랑 상관 없음