gpt 가뿐히 즈려밟는데? 애초 gpt 음성은 실제 멀티모달이 아니라 그냥 텍스트 기반인데 멀티모달이라고 말 장난한 거잖아. 제미니는 진짜 진정한 멀티모달 아님? 걍 어나더레벨이네 - dc official App
근데 념글 봐도 그 영상엔 SST, TTS밖에 안 보이는데 GPT랑 뭐가 다르단 거노
다른 영상 보면 악기 소리 내는 거 있어서 사운드 멀티모달 지원은 맞긴 한 거 같은데, OAI는 아직 이미지 멀티모달만 지원하는 거고 사운드 멀티모달은 출시 안 함 ㅇㅇ 그냥 음성인식, TTS만 가능한 거
그 악기소리는 메타에서 오픈소스로 이미 뿌린지 오래된 별거 아닌 기술이고 최근 메타에서 뿌린건 통역을 할때 단순 텍스트가 아니라 그 사람 목소리 패턴 인식해서 그사람 목소리로 통역된 소리가 나가는거 오픈소스로 뿌림
ㅇㅇ 그거 다 봤음