https://youtu.be/UIZAiXYceBI?si=m_PyI-xnjlA5507r
Hands-on with Gemini: Interacting with multimodal AIGemini is our natively multimodal AI model capable of reasoning across text, images, audio, video and code. This video highlights some of our favorite intera...youtu.be가장 주목을 받은 위의 동영상은 연출된 화면임.
원래는 GPT-4V처럼, 관련한 스틸 이미지를 차근차근 넣으며 설명하는거고
TTS 니 중간에 갑자기 실시간으로 튀어나오는 대답 같은 것은 다 연출인 것이지
나도 그랬지만, 연출된 화려함에 너무 현혹되었어.
그렇다면 결국, GPT-4와 현저하게 다른 점이 있을까?
ultra 관련 데모들도 화려한 연출을 제외하면,
사실 GPT-4 로도 어느정도 다 가능한거고
벤치마크나 실제 한두개의 사례로 성능을 설명하는 것은 실제성능과는 많이 다르다는 것을
그동안 GPT-4에 무수히 도전했던 경쟁자들의 사례로 잘 알잖아?
반면, 지금 실제로 보여준 것은
멀티모달도 제대로 안되고, 영어밖에 안되는, GPT-3.5와 비비는 수준의 pro 밖에 없어.
결국 Gemini - Ultra 는 실제 나와봐야 알겠지만, 데모로 미루어보자면
GPT4 보다 조금 낫거나 / 비슷하거나 / 실제 써보니 못미치는 정도의 수준이라고 유추됨.
근데 알다시피 GPT-4는 올해 4월에 발표한 모델이야.
이와 경쟁할 모델을 아직 공개도 못하고 있다고?
실 공개는 계속 미루고, 금기시되던 준 사기급의 연출까지 내세우다니
구글이 마음이 많이 급하긴 급한가보다
p.s -
https://youtu.be/aRyuMNwn02w?si=V14e0Ae2_agBuRyk
Testing Gemini: Guess the movieIn this test, let’s see if Gemini can guess the name of a movie based on the play on words hidden in a set of images. Gemini is our natively multimodal AI mo...youtu.be이 영화 연상 퀴즈도
각 퀴즈를 캡쳐해서 GPT-4V 에 넣으니,
너무 어려운 오즈의 마법사 하나 빼고 다 풀더라.
맞음 거품 너무 꼈어
찬물 끼얹는게 아니라 기대컨 하는거임 안경끼고 제대로 보자는거지
근데 이런말 하면 그냥 선형충 취급해버림
ㅇㅇ 연출에 놀아나지 말고 직시하자는 거임. 어쨌든 OpenAI와 Google 개빡세게 경쟁했으면 좋겠어.
벤치마크로 이겼는데 뭔 개소리임
그리고 네이티브로 멀티모달이어서 모델 스스로가 이미지 뽑아내는거랑 달리3 어거지로 chatgpt에 붙여서 외계인 손 증후군마냥 모델끼리 서로 의사소통도 제대로 안되는 chatgpt가 정말 같은 시스템이라고 생각하냐
GPT4도 처음 나올때 성능 과대포장하다가 나중에 반박논문 나와서 걸린건 다들 싹잊은듯. 애초에 이런 자료들은 msg가 들어갈 수밖에 없는거니까 그냥 벤치마크 보면되는건데
언어모델 벤치마크를 믿냐 ㅋㅋ 벤치마크대로라면 GPT4 땃다고 호소하는 새끼들이 수두룩인데ㅋㅋㅋ
매번 그랬듯이 써봐야 알겠지 - dc App
지금 바드 제미니 프로 적용됐다길래 써봤는데 아직도 gpt3.5보다 멍청한듯
나도 써보고 놀람 ㅋㅋㅋㅋ 그래도 최소한 3.5 정도는 되어야 하지 않나?