다가오는 AI 전쟁과 MLLM (Multimodal Large Language Model) 뒤에 숨은 과학
현재 GPT-4는 모든 LLM 벤치마크와 리더보드에서 최고의 자리를 차지하고 있지만 곧 대체될 것이라는 소문이 있습니다.
Google은 Gemini 모델이 GPT-4보다 5배 더 강력하다고 주장합니다. 강력한 성능 외에도 Gemini는 다중 모드 기능을 갖추고 있어 텍스트, 코드, 이미지 및 오디오를 처리하고 생성할 수 있습니다.
제미니는 엄청난 모델(매개변수 65T!!)이고 유튜브 데이터로 훈련을 받았다는 소문이 있습니다! 그렇다면 Gemini가 곧 GPT-4를 대체하게 될까요? 그리고 Google이 주장하는 것처럼 마법 같은 성능을 발휘하게 될까요?
먼저 이러한 MLLM의 과학을 분석해 보겠습니다. 몇 가지 다른 방법으로 MLLM을 생성할 수 있습니다.
일반적인 접근 방식 중 하나는 다중 모드 인코더를 사용하여 이미지와 텍스트를 공통 잠재 공간으로 변환하는 것입니다. 이를 통해 LLM은 객체의 시각적 모양 및 텍스트 설명과 같은 다양한 유형의 정보를 연관시키는 방법을 배울 수 있습니다.
이를 분석하기 위해 Google은 이미지 처리를 위해 변환기 아키텍처를 채택하는 방법을 설명하는 논문을 발표했습니다. 이미지는 14x14 픽셀 패치로 분할될 수 있으며, 각 패치는 동일한 학습 가능한 선형 변환을 거쳐 벡터로 변환됩니다. 각 벡터는 학습 가능한 위치 임베딩과 연결됩니다. 이렇게 연결된 벡터는 Transformer 모델인 ViT에 입력됩니다. ViT의 출력은 이미지의 임베딩 표현입니다.
이미지와 단어가 모두 포함된 입력 프롬프트의 경우 단어와 이미지가 모두 벡터로 변환되어 LLM에 입력됩니다. LLM은 멀티미디어 훈련 데이터에 대해 미세 조정되었으며 결과 모델은 MLLM입니다. 상상할 수 있듯이 동일한 기술을 오디오 및 비디오 파일로 확장할 수 있습니다.
또 다른 접근 방식은 다양한 양식 간 변환을 학습할 수 있는 신경망 유형인 교차 모드 변환기를 사용하는 것입니다. 이를 통해 LLM은 별도의 인코더 없이 이미지와 텍스트 입력을 모두 직접 처리할 수 있습니다.
또 다른 일반적인 교차 모드 접근 방식은 다중 모드 대조 학습을 사용하는 것입니다. 다중 모드 대조 학습은 LLM이 데이터 포인트의 양수 쌍과 음수 쌍을 구별하는 방법을 학습하도록 권장하는 일종의 훈련 목표입니다. 양수 쌍은 이미지 및 해당 텍스트 설명과 같이 어떤 방식으로든 서로 관련된 데이터 포인트입니다. 음수 쌍은 서로 관련되지 않은 데이터 포인트입니다. LLM은 양수 쌍 표현 간의 유사성을 최대화하고 음수 쌍 표현 간의 유사성을 최소화하도록 훈련되었습니다. 이를 통해 LLM은 다양한 양식에서 의미 있는 기능을 추출하고 다양한 양식을 서로 연관시키는 방법을 배울 수 있습니다.
Google은 Gemini에 대해 입을 다물고 있으며 그들이 어떤 접근 방식을 사용하고 있는지 실제로 알지 못합니다. Gemini가 강화 학습과 같은 AlphaGo의 기술과 표준 LLM 교육 기술을 결합할 수 있다는 추측이 있습니다.
GPT-4에는 다중 모드 기능이 있지만 OpenAI는 보안 문자 등을 해독하기 위해 악의적인 행위자가 이 기능을 오용할 수 있다는 우려로 인해 이를 널리 제공하지 않았습니다. 그러나 Gemini와의 경쟁을 고려하면 곧 GPT-Vision으로 출시될 가능성이 높습니다. OpenAI는 또한 자체적인 새로운 다중 모드 모델인 Gobi를 개발하고 있습니다. 이는 잠재적으로 GPT-5일 수 있습니다. 예!!
그 동안 Meta는 ChatGPT의 경쟁자를 개발 중입니다. 가장 큰 문제는 GPT-4와 경쟁할 수 있는 새로운 모델을 오픈 소스로 만들 것인지 여부입니다.
모든 일이 순조롭게 진행된다면 Meta는 Llama-3를 대중에게 출시하고 OpenAI는 GPT-Vision과 Gobi를 출시하며 Google은 Gemini를 출시할 것입니다. 그러한 시나리오에서는 경쟁이 활발하게 이루어질 것이며, 꼭 필요한 강력한 모델이 마침내 AI 애플리케이션을 과대 광고 영역에서 진정으로 유용한 영역으로 이동할 것입니다 ?
- dc official App
댓글 0