텍스트로 이미지를 싱성해내는 기술이 충분히 건재한데 그걸 정확히 반대로 하면 그게 멀티모달이지. 지금도 나와있는건 많음
그걸이제 llm에 얼마나 잘 접목시켜서 분석까지 제대로 하느냐가 관건인거지