진정한 의미의 멀티모달을 처음 성공시켰다는 점에서는 충분히 의의가 있지만


말그대로 처음이라서 실제로 까고 보면 문제도 한계점도 많을 것 같음


당장 시연 영상에서도 찐빠 몇 번 났었고


텍스트 모델도 기존에 비해 상상도 못할만큼 발전했다 수준은 아닌데 (추론 능력만 보면) 음성이라고 크게 다를 것 같진 않음