2023.10.10에 진행된 AI 엔지니어 서밋 2023

OpenAI 발표 내용 정리


1. 2023년은 챗봇의 시대 -> 2024년은 멀티모달의 시대가 될 것입니다.


2. 아직도 시스템이 얼마나 초보적인지, 얼마나 더 발전의 여지가 있는지 생각하면 아직도 가슴이 뭉클합니다. 2024년은 정말 기대되는 해가 될 것입니다.


3. 현재 텍스트는 다른 모달리티를 연결하는 결합 조직(tissue)의 역할을 할 수 있습니다. 이미지, 오디오, 비디오와 같은 모달리티가 현재는 흩어져있지만 텍스트를 중심으로 연결될 수 있습니다. 우리가 현재 추구하는 것은 이 통일된 시스템입니다.


4. GPT4-Vision과 Dalle3를 통해 할 수 있는 일


1. 아무 사진이나 찍는다.



2. GPT4-Vision에게 사진에 대한 자세한 설명을 요청한다.



3. 생성된 설명을 Dalle3의 프롬프트로 삼아 이미지를 생성한다.



4. GPT4-Vision에게 원본 사진과 생성된 이미지의 차이점을 알려달라고 요청한다.



5. 이 차이점을 다시 Dalle3에게 반영하여 이미지를 다시 생성한다.



6. 결과적으로 원본과 생성된 이미지 간의 차이가 더 적어진다.


여기서 중요한 점은 이제 사람의 개입이 필요없어졌다는 점이다.

사람이 사진간의 차이점을 짚어줄 필요가 없다.

(실제로 사람도 잡아내기 힘든 차이점을 모두 찾아내고 구체적인 프롬프트로 만들기에 가능한 일)

인간이 지침을 반복하는 파이프라인이 한동안 필수적일 것으로 생각했지만, 이제 모델이 스스로 할 수있는 일이 됐다.

이건 완전히 새로운 상자를 연 것과 같다.


+ 위 예시는 아주 basic demo라는 점을 강조함, 실제로는 이보다 훨씬 더 나은 결과를 얻을 수 있을 것. 최소한의 힘만 보여줬음


5. 유튜브 동영상을 바로 블로그 글로 바꾸는 데모를 보여줬음



Whisper : 오디오 모델

GPT-V : 비전-언어 모델

GPT-4-32K : 비디오 모델

DALL-E 3 : 이미지 생성 모델


이 4가지를 결합해서, 유튜브 동영상을 바로 블로그 게시글로 바꿔버림



생성된 블로그 포스팅 예시.

필요한 프레임을 원본 영상에서 짤라서 이미지로 삽입하고,

Dalle3가 알맞는 이미지를 생성해주기도 함


이런 식의 멀티모달 활용 사례가 앞으로 매우 많을 것이라고 함


6. 이제 믿을 수 없을만큼 발전할 것입니다.

멀티모달 작업에 대해서는 아직 탐구되지 않은 패턴이 많이 있습니다.

이미지 입력을 사용하는 에이전트는 치명적일 것입니다.

너무 기대됩니다.

그리고 우리는 가까운 미래에 많은 일이 일어날 것이라고 생각합니다.

그러한 사용 사례 중 일부가 어떤 모습인지 보여드릴 수 있어서 기뻤습니다.