Gemini: Processing and understanding raw audioIntroducing Gemini — Google’s newest and most capable AI model. Watch Google DeepMind Research Scientist Adrià Recasens Continente demonstrate Gemini’s abili...youtu.be
gpt3.5나 gpt4나 음성을 음성 인식 모델을 통해 텍스트로 변화해서 멀티 모달을 구현했다면
제미니는 그냥 음성 자체를 멀티 모달로 활용함
뉘앙스 같은 것도 다 반영되는 거임
gpt는 텍스트 기반으로 만들어진 모델이라면
제미니는 음성, 텍스트, 이미지를 걍 통합해서 학습한 모델
인공지능 공부해본 놈들이라면 이게 얼마나 대단한 기술인지 알 수 있을 거임
오픈AI는 이거 따라할 수가 없음
딥마인드니까 가능했던 거지
오 이건좀 신박하다
애들 또 무지성 억까하는중
나중에 gemini식 멀티모달 llm모델이 deepmind 전통식 강화학습 에이전트랑 통합되면 행복사할듯.
방심하고 눌렀다가 쿠퍼액 나왔다
내가보기에도 그게 맞는데 왜 하룻밤 사이에 근소우위로 바꼈는지 모르겠네
....비교 자체가 안 되는데 이정도면?ㄷㄷㄷ - dc App
게임끝 구속당했던놈들 다 풀어주고 구속한넘들 묶어!
영어 인도발음 = 신뢰 100배 - dc App
오 oa처럼 말장난이 아니라 진정한 멀티모달이구나 - dc App
오픈AI는 이거 따라할 수가 없음 -> ?? openAI가 처음부터 멀티모달 학습을 기반한 모델을 준비하고 있다고 devday 이전부터 이야기했구만 (니가 찾아봐) 우리 모두의(나도) 바람대로 Gemini가 훨씬 뛰어날 수도 있지. 근데, GPT-4 출시한게 올해 4월이야. 이미 10개월 동안 상업화하고 우려먹고 테스트한 모델을 아직도 일반 공개 못했다? 출시부터하고 말하자.
컨셉임? 이정도는 열화된 사진으로나 보던급인데
이것도 존니 짜깁기네
이게 왜 대단한거야? Pause 단위로 음성 자르고 stft로 시간 구간 별 계수 뽑고, 이거 embedding vector로 바꾸고, 그대로 트랜스포머에 넣어주면 되는거 아님?
와 대단해 특붕이 그런 생각은 인공지능 조금만 공부해도 알 수 있는 걸? 그런데 그걸 구현한 게 제미나이 밖에 없는데 어떡하지??