세상에 존재하는 거대한 데이터에는 3가지 종류가 있다. 첫번째, 텍스트. 두번째, 이미지. 세번째, 동영상 (및 음성). 첫번째는 이제 거의 정복했고, 두번째는 반정도, 그리고 세번째는 아직 손도 못대고 있다. 이미지와 동영상을 아직 제대로 활용하지 못하는 이유는, 텍스트에서의 "next word prediction"같은 학습 프레임워크를 찾지 못했기 때문이다. 만약 이미지나 동영상에서 next word prediction만큼 효과적이고 범용적인 학습 프레임워크를 개발한다면, 그것은 곧 AGI의 시대를 열 것이라고 나는 확신한다.