ㅇㅇ
[일반] 기존 ai랑 gpt 4o랑 가장큰 차이가머임?
익명(223.38)
2024-06-02 23:36
추천 0
댓글 7
다른 게시글
-
디젤 마시는 빈 디젤[일반] Ad_Astra(peraspera83) | 24.06.02추천 0
-
아이폰16에 자율에이전트 없으면 안바꿔야겠다 [2][일반] 익명(113.61) | 24.06.02추천 0
-
도파민 다 떨어져서 탈갤한다 ㅂㅂ [1][일반] 익명(222.102) | 24.06.02추천 0
-
6월6일 공개할 거 같다 [3][일반] 이런내가특..(andud96) | 24.06.02추천 0
-
이대로면 지미애플 말이 맞는거아니냐 [3][일반] 익명(14.53) | 24.06.02추천 0
-
가속 언제 하냐[일반] 익명(121.182) | 24.06.02추천 0
-
얼마전에 공개된 gpt 음성 대화 지금 사용 가능한가요? [3][일반] 익명(211.36) | 24.06.02추천 0
-
e/acc 아르헨티나 머통령 밀레이짱 ㅇㅅㅇ [20][일반] 익명(122.36) | 24.06.02추천 0
-
공중에 아주 작은 입자들을 홀로그램으로 시각화 해주는 기술 언제 가능? [1][일반] 익명(121.159) | 24.06.02추천 0
-
알트만이 아쉬울 게 없는 입장이란 게 꼴받네[일반] 익명(119.202) | 24.06.02추천 0
4o가 이미지 인식쪽에서 훨씬 디테일한 요소를 잘 파악하고 특정 명령을 내렸을때 그걸 체계적으로 정리하고 항목별로 디테일하게 분류하는걸 잘함 개인적으로 체감하기론 그럼
기존 AI라고 말하기는 좀 애매하고, 기존 LLM이랑 비교하면 좀 말하기 쉽긴 함. 근데 그렇게 질문한거겠지. 기존 LLM음 text 모델임. 입력도 text, 출력도 text. 지금 GPT4나 제미나이가 이미지 입출력도 된다고 하긴 하지만, 정확하게는 아님. 다른 이미지 입출력 모델을 가져다가 작업 시키고 그 결과물을 대신 출력하는 거. 지금 GPT4가 달리3 써서 하는 거랑 비슷한거지. ~~~하는 그림 그려줘. 라고 하면, GPT4가 그걸 달리3한테 그림 그리는 프롬프트 작성을 요청하고, 그 결과를 다시 우리한테 보여줌. 그런 점에서, GPT4 앱의 보이스 기능도 마찬가지. 우리가 말을 하면, STT 모델이 text로 바꿈. 이걸 GPT에 입력하고, 나온 text를 다시 TTS 모델을 통해서 읽어줌.
이것도 사실 나쁘지 않음. 지금 GPT4 앱이 이런 구조니까. 다만, openAI에서도 밝혔지만 이 방식은 단점이 있음. 그 중 제일 심각한 게, 정보 손실임. 음성 정보가 너무 많이 사라짐. 예를들어, 말의 빠르기, 크기, 높낮이, 혹은 뭐 사투리, 모든 음성 데이터 특징이 사라지고 text로만 바뀜. 근데 GPT4o는 아예 음성을 바로 입력 받고, 출력함. 그래서 음성 정보를 고스란히 살릴 수 있음. 사용자 입장에서만 보면, 어투라든지, 사투리, 높낮이 등등도 AI가 알아들을 수 있고, 출력도 가능하니까 편하고 더 다양한 음성 작업을 시킬 수 있을거임. 다만, 일반인에겐 기존 GPT4 기능이나, GPT4o의 보이스 기능이나 큰 차이는 없을 수 있음.
openAI가 보이스 기능 공개하면서, 사용자 편의성을 개선했다고 말한 게 이런 측면이겠지. 조금 더 잘 알아듣던데, 뭐 딱 그 수준임. 하지만, 이걸 AI 관점에서만 보면, 그냥 다음 세대 모델이라고 보면 됨. 구글도 지금 음성입력이 바로 안 되고, 이전 GPT4 처럼 할거임. 오직 openAI만 음성,텍스트,이미지를 입력 받아서, 음성,텍스트,이미지로 출력 가능함. 이게 신기한거고, 이걸 어떻게 해냈는지 대단할따름. 이게 중요한 이유는 초반에 말한 내용과 연결됨. 정보손실.
지금 당장은 음성 정보가 조금 덜 손실 되는 정도고, 이미지....도 그런거고. 그리고, 아마도, 대부분의 기업들이 text 학습은 자주 시켜봐서 노하우도 있겠지만, 음성 학습을 LLM처럼 한 건 얘네가 아마 처음일거라. 음성GPT1 혹은 음성GPT2 수준일거임. 아직 개선 될 여지가 많음. 아 그리고, 이게 음성만이 아니라, 이미지, 그리고 더 많고 다양한 데이터도 입출력으로 받아들일 수 있게 된다면. 손실되는 정보가 없이 더 제대로 문제를 파악하고, 주변 환경을 파악할 수 있을테니. 더 위대한 창발성이 생길 수도 있다고 생각함.
예를들어, 한국문화에 대해서 LLM 모델이 학습하지 못 하면, 얘는 이 부분에서 환각을 내뱉거나 대답을 잘 못함. 소리도 마찬가지겠지. 음의 높낮이, 사투리, 속도, 크기 뭐 이런 음성 정보에 대한 text를 아무리 학습을 해도, 얘는 음성을 제대로 이해 못 했을 수 있음. 글로만 배운거지. 하지만, 4o를 시작으로 음성 정보도 AI가 제대로 학습하기 시작했다고 보면 됨. 챗봇 입장에선 이제야 한국 정보를 입력 시키는거지. 음성도 서서히 채워질거고, 이미지도 채워질거고, 더 다양한 데이터들이 채워진다면....LLM의 창발성처럼 없던 능력이 갑툭튀할 수 있지 않을까....는 개인적인 바람이고. text to text. 나 audio to audio나, image to image. 이런 모델들이 아니라
이걸 단일신경망 하나로 구현해낸 점이 가장 큰 차이임. 근데 거기에 어떻게 한 건지 모르겠지만, 속도도 빠르고, 추론비용도 낮춤. 몇% 낮추는 건 그냥 튜닝을 잘 한건데, 몇배로 낮추는 건 아예 다른 방식으로 접근해야 보통 일어나는건데....뭘 한걸까.