소라에 대한 저의 정신적 모델은 비디오 생성을 위한 'GPT-2의 순간'입니다.

2018년에 출시된 GPT-2는 일관성 있고 문법적으로 정확한 텍스트 단락을 생성할 수 있었습니다. GPT-2는 일관성이 없거나 사실을 착각하는 등의 실수 없이 전체 에세이를 작성할 수는 없었지만, 후속 세대의 모델에 박차를 가했습니다. GPT-2 이후 5년도 채 되지 않아 GPT-4는 이제 연쇄 사고나 긴 에세이 쓰기와 같은 기술을 환각 없이 구사할 수 있게 되었습니다.

마찬가지로  소라는 예술적이고 사실적인 짧은 동영상을 제작할 수 있지만 현재 소라는 일관된 캐릭터와 설득력 있는 스토리라인을 갖춘 40분짜리 TV 프로그램을 제작할 수는 없습니다. 하지만 장기적인 일관성 유지, 완벽에 가까운 사실성, 실질적인 스토리라인 생성 등의 기술은 차세대 소라 및 다른 동영상 생성 모델에서 등장할 것이라고 생각합니다

이것이 어떻게 전개될지에 대한 몇 가지 예측을 해보겠습니다:
- 비디오는 텍스트만큼 정보 밀도가 높지 않기 때문에 비디오를 통해 추론과 같은 기술을 학습하려면 훨씬 더 많은 컴퓨팅과 데이터가 필요할 것입니다.
- 따라서 비디오와 연관된 정보로 다른 양식을 활용하는 것이 학습 프로세스를 부트스트랩하는 데 중요해질 것입니다.
- 고품질 텍스트 데이터 세트와 마찬가지로 고품질 비디오 데이터에 대한 엄청난 경쟁이 벌어질 것입니다.
- 비디오에 대한 경험이 있는 AI 연구원의 수요가 높을 것이지만, 기존의 NLP 연구원이 언어 모델 확장의 성공에 적응해야 했던 것처럼 새로운 패러다임에 적응해야 할 것입니다.
- 영화 산업의 혼란은 GPT-4가 글쓰기를 변화시킨 것과 유사하게 전개될 것입니다(평균 품질을 뛰어넘는 도구 및 보조 수단으로, 그러나 여전히 전문가의 작업과는 거리가 멀 것입니다).


https://twitter.com/_jasonwei/status/1762930762180161795