https://youtu.be/UIZAiXYceBI?si=m_PyI-xnjlA5507r

Hands-on with Gemini: Interacting with multimodal AIGemini is our natively multimodal AI model capable of reasoning across text, images, audio, video and code. This video highlights some of our favorite intera...youtu.be




가장 주목을 받은 위의 동영상은 연출된 화면임.



원래는 GPT-4V처럼, 관련한 스틸 이미지를 차근차근 넣으며 설명하는거고

TTS 니 중간에 갑자기 실시간으로 튀어나오는 대답 같은 것은 다 연출인 것이지



나도 그랬지만, 연출된 화려함에 너무 현혹되었어.










그렇다면 결국, GPT-4와 현저하게 다른 점이 있을까?




ultra 관련 데모들도 화려한 연출을 제외하면,


사실 GPT-4 로도 어느정도 다 가능한거고


벤치마크나 실제 한두개의 사례로 성능을 설명하는 것은 실제성능과는 많이 다르다는 것을


그동안 GPT-4에 무수히 도전했던 경쟁자들의 사례로 잘 알잖아?





반면, 지금 실제로 보여준 것은


멀티모달도 제대로 안되고, 영어밖에 안되는, GPT-3.5와 비비는 수준의 pro 밖에 없어.









결국 Gemini - Ultra 는 실제 나와봐야 알겠지만, 데모로 미루어보자면


GPT4 보다 조금 낫거나 / 비슷하거나 / 실제 써보니 못미치는 정도의 수준이라고 유추됨.




근데 알다시피 GPT-4는 올해 4월에 발표한 모델이야.


이와 경쟁할 모델을 아직 공개도 못하고 있다고?












실 공개는 계속 미루고, 금기시되던 준 사기급의 연출까지 내세우다니


구글이 마음이 많이 급하긴 급한가보다






p.s -


https://youtu.be/aRyuMNwn02w?si=V14e0Ae2_agBuRyk

Testing Gemini: Guess the movieIn this test, let’s see if Gemini can guess the name of a movie based on the play on words hidden in a set of images. Gemini is our natively multimodal AI mo...youtu.be


이 영화 연상 퀴즈도


각 퀴즈를 캡쳐해서 GPT-4V 에 넣으니,


너무 어려운 오즈의 마법사 하나 빼고 다 풀더라.