2020년 1월에 Lex Fridman이 MIT에서 당시 최첨단 딥러닝 기술들을 설명해준 강의임

지금 보면... 불과 3년 좀 넘었는데 완전 석기시대 이야기임

(Lex Fridman은 MIT 연구원이고, 연구원 스펙보다는 유명인들 인터뷰하는 유튜버로 더 유명한 사람임)


위 영상에서 나온 예를 들면


1. 2019년 당시 딥러닝은 한계에 부딪혔다는 주장들이 많았고, 이에 대한 논문과 책들도 많이 나옴

-> 지금 그거 썼던 사람들 이불킥할듯


2. 당시 세계에서 가장 컸던 언어 모델은 Nvidia의 'Megatron'이었음. 무려 8.3B개의 파라미터를 가진 초대형 모델!

-> GPT4부터는 trillion 단위가 등장하고 있고, 오픈 소스 모델들도 70B~180B 모델들이 돌아다니고 있음.


3. GPT-2를 직접 사용한 예시를 보여주는데 이상한 텍스트를 생성해서 수강생들이 빵 터짐

상식 추론 능력도 매우 부족해서 Two plus two is에 대한 답도 찾지 못하는 수준을 보여줌

-> 지금 GPT4는 최적화 문제까지 풀 정도로 크게 수학적 능력이 향상됐음

-> ChatGPT는 AI 분야 석학들의 예상보다도 '수십년'빠르게 등장했고, 2019년만 해도 챗GPT 수준의 인공지능을 얘기하면 미친 사람으로 취급받았음


4. 2020년 1월까지만 해도 자연어처리 분야에서만 트랜스포머가 이용됐음. 비전과 결합 X

-> GPT4 Vision 다들 봐서 알겠지만 미쳤음.. 고비에서는 더 좋아질거고 GPT-5는 어떨지 그려지지도 않음


5. 당시 Lex Fridman의 2020년 희망 사항 :

언어모델이 상식 수준의 추론을 하기 -> '상식 수준의 추론'임. 그 당시는 이정도만 해도 좋겠다... 라고 생각했던 것. GPT 3부터 상식 수준은 잘해졌고 GPT 4에선 보다 고차원적인 추론에도 발을 내미는 중

컨텍스트 토큰 수천 단어로 늘리기 -> 지금은 수십만 토큰 얘기도 나오는 중

다양한 분야에서 챗봇과 대화하기 -> 챗GPT 선에서 컷

트랜스포머를 비전 분야로 확장하기 -> 추후 ViT 등장하고 최근엔 비전-언어 멀티모달들 눈부신 발전 중. GPT 5에선 비디오까지 확장될 것이 유력


6. 이미지 생성 AI에 대해선 언급도 별로 없음. 그만큼 한참 멀었다고 생각됐던 분야

-> 지금은... 다들 잘 알거라고 생각함. 비단 이미지가 아니라 오디오도 엄청나게 발전했고, 비디오 생성도 GPT 5에서 큰 진보를 기대 중임


이게 불과 3년만의 발전들이고 못 담은 내용이 훨씬 더 많음

단위 자체가 무슨 몇십, 몇백, 몇천 단위로 올라가는 중


영상을 직접 볼 사람들은 느끼겠지만

보다보면 뭔가 엄청난 이질감이 느껴짐

'지금 저게 MIT에서 최첨단 AI 기술이랍시고 강의 중인거여...?' 이런 생각이 저절로 들음


이러니 특이점은 없다던 학자들도 '이러다 진짜 오는거 아니여...?' 싶을 수 밖에 없는거지

지수적 상승의 시작점이 이정도이니...

앞으로는 어떤 일들이 펼쳐질지 너무나 기대가 된다.