들어가기 전에,

제목에 비디오 완몰가가 아니라 비디오 가상현실이라고 해야 정확하지만

편의상 완몰가로 할게. 많이 쓰여서 자연스러운 느낌이니까.


현재 gpt4로도 텍스트 완몰가는 가능하다.

하지만 문제가 있다면

토큰 수 딸려서 기억에 한계가 있는 것이랑

인간 수준 추론 능력이 아니라는 것 때문에 어색한 게 있다는 점인데,

첫번째 문제를 해결할 기술은 나왔고, 두번째 추론 능력도 빌게이츠 말로는 2년 내로 해결될 거라고 했음.

그렇다면 거의 완전한 텍스트 완몰가는 gpt5가 나올 올해 말에 가능하지 않을까?


그리고 올해 말에 나올 멀티모달 ai

구글의 gemini,

open ai의 gpt5

현재 ai들이 텍스트랑 이미지를 이해하고 텍스트랑 이미지를 생성해주는 것처럼,

앞으로 나올 멀티모달 ai들은 비디오를 이해하고 비디오를 생성해줘.


그렇다면 비디오 완몰가도 올해 안에 가능하지 않을까? 물론 초기 버전 느낌으로 말이야.

가장 쉽게 생각해볼 수 있는 건

현재 gpt4로 하는 텍스트 완몰가에서 비디오를 입힌 것을 떠올릴 수 있겠다.

나는 텍스트나 음성으로 입력을 하고, 멀티모달 ai는 비디오로 도출하는 것이지.


"나는 학교로 들어갔다" 라고 텍스트나 음성으로 입력하면, ai는 학교에 들어가는 비디오를 만들어 주거나.

"옆자리 친구에게 밥 먹었어? 라고 묻는다"라고 입력하면,

ai는 친구가 배고픈 표정으로 '아니.. 지각할까봐 못먹었어..'라고 대답하는 비디오를 만들어 주거나.

초기 버전의 비디오 완몰가는 이런 식이지 않을까?


물론 초기 버전은 이런 식으로 딜레이가 있지만, 기술이 발전해서 실시간으로 영상을 생성해줄 수 있는 단계까지 도달하면

vr 기기랑 연결해서 즉각적으로 영상과 상호작용할 수 있을 것이야.

특히나 그쯤되면 추론 능력도 인간 수준으로 올라와서

ai가 인간 세상 자체를 완벽히 이해할 것이기 때문에 만들어질 영상에서 전혀 어색함이 없을 것이야.


이렇게 완전한 비디오 완몰가는 2025년 쯤에 나올거라고 생각해. 시기 예측은 그냥 직감이야.

------------------

23년 말 멀티모달 ai(gpt5, gemini) 등장 -> 완전한 텍스트 완몰가, 초기 비디오 완몰가

25년 -> 완전한 비디오 완몰가

------------------


우리가 꿈에 그리는 뇌에 직접 전기 신호를 줘서

후각, 미각, 촉각 그리고 현실 같은 몰입도를 주는 최종 단계의 완몰가는

28~30년에 agi나 asi의 도움으로 가능할 거 같에.

하지만 그 전에 우리는 비디오 완몰가로 지루함을 달랠 수 있을거야.


지수적으로 발전하는 기술과 최근 그 가속도를 보자면, 내가 보수적으로 예측한 것일 가능성도 충분해.

어떤 식으로 흘러갈지는 올해 말에 멀티모달 ai들을 직접 써봐야 알 것 같다.


전문가는 아니지만 열심히 생각해봤다. 재미로 읽어주삼.