미드저니 달리 그외 잡다한 생성형ai의 한계가
개인화가 안된다는 거임 겨울 그림 그려달라고하면
학습한 겨울 풍경에서 그럴듯한걸로 뽑아서줌
내가 머릿속으로 구상하는 디테일한 이미지를 반영을못함
비록 4o가 퀄리티는 약간 떨어저도 내가 상상하는
그림을 얼추 비슷하게 뽑아줄테니 그것만으로
너무 행복함 난 내가 머릿속으로 그리는 그림을
뽑아주는걸 기다림 그외에 오디오기능도 기대중
개인화가 안된다는 거임 겨울 그림 그려달라고하면
학습한 겨울 풍경에서 그럴듯한걸로 뽑아서줌
내가 머릿속으로 구상하는 디테일한 이미지를 반영을못함
비록 4o가 퀄리티는 약간 떨어저도 내가 상상하는
그림을 얼추 비슷하게 뽑아줄테니 그것만으로
너무 행복함 난 내가 머릿속으로 그리는 그림을
뽑아주는걸 기다림 그외에 오디오기능도 기대중
LLM의 "멀티모달"은 특별한게 아님. LLM을 다뤄봤으면 알겠지만, Function calling 기능으로 TTS모듈, STT모듈, 이미지 생성 모듈, OCR모듈 등 다양한 기능을 LLM애드온으로 붙여놓은거임.
고로 4o는 이미 멀티모달이고, Function calling을 지원하는 그 모든 LLM은 멀티모달로 만들 수 있음.
"Function Calling으로 모듈 붙이는 건 맞는데, 그게 진짜 멀티모달이라 하기엔 부족함. 멀티모달의 핵심은 텍스트, 이미지, 음성 데이터를 따로따로 처리하는 게 아니라, 통합적으로 이해하고 맥락 파악하는 능력임. 예를 들어 텍스트로 설명한 그림을 보고 음성으로 설명해주는 거나, 이미지에서 텍스트와 연관된 행동을 추론하는 건 단순 모듈 연결로안됨