https://youtu.be/D64QD7Swr3s

Gemini: Processing and understanding raw audioIntroducing Gemini — Google’s newest and most capable AI model. Watch Google DeepMind Research Scientist Adrià Recasens Continente demonstrate Gemini’s abili...youtu.be


gpt3.5나 gpt4나 음성을 음성 인식 모델을 통해 텍스트로 변화해서 멀티 모달을 구현했다면


제미니는 그냥 음성 자체를 멀티 모달로 활용함


뉘앙스 같은 것도 다 반영되는 거임


gpt는 텍스트 기반으로 만들어진 모델이라면


제미니는 음성, 텍스트, 이미지를 걍 통합해서 학습한 모델


인공지능 공부해본 놈들이라면 이게 얼마나 대단한 기술인지 알 수 있을 거임


오픈AI는 이거 따라할 수가 없음


딥마인드니까 가능했던 거지