언어모델+이미지모델+오디오모델 이러면 사실상 인간이랑 데이터 학습 측면에서 다를 바가 없는데 바로 AGI 탄생 아니냐 인간도 자연에서 얻는 데이터가 언어,시각적 이미지,청각적 이미지가 사실상 전부잖아.미각,후각 이런거 빼면 ㅇㅇ
그렇게 단순하지 않아
스케일만 키우면 뭐 된다며