지금 LLM들의 이미지 이해 방식은 입력된 이미지를 픽셀별로 텍스트로 바꿔서 비전 모델이 LLM에게 전달하는건데 이건 너무 한계가 많음 LLM이 근본적으로 시각에 대한 이해를 할 줄 알아야지 많은 제약이 사라질거라고 봄 가속해라 - dc official App
댓글 0