지금 LLM들의 이미지 이해 방식은 입력된 이미지를 픽셀별로 텍스트로 바꿔서 비전 모델이 LLM에게 전달하는건데

이건 너무 한계가 많음
LLM이 근본적으로 시각에 대한 이해를 할 줄 알아야지 많은 제약이 사라질거라고 봄

가속해라

- dc official App