원래는 애가 학습할 수 있는 데이터가 텍스트에 국한됐었는데


얘는 신경망 자체가 멀티모달이니깐 당연히 텍스트뿐만 아니라 음성, 소리, 사진 등 훨씬 많은 데이터로부터 학습을 하고 가중치를 조정했을 거잖아


입출력에 대한 이해를 넘어 내부적인 세상에 대한 이해 (그냥 비유임) 자체가 더 다각도로 변한 거임