VibeVoice는 전통적인 텍스트-음성 변환 시스템의 오랜 한계를 혁신적인 2단계 구조를 통해 해결합니다. Microsoft Research의 문서에 따르면, 이 모델은 Qwen2.5-1.5B 기반의 대형 언어 모델 백본과 초저 7.5Hz 프레임 속도로 작동하는 전문적인 음향 및 의미 토크나이저를 결합합니다. 이러한 설계는 시스템이 오디오 품질을 유지하면서 긴 시퀀스를 효율적으로 처리할 수 있게 만듭니다.
혁신적인 점은 확산 기반 접근 방식에 있습니다. LLM 컴포넌트는 대화 맥락을 이해하고 화자 간의 발언 전환을 조율하는 역할을 하며, 경량화된 확산 헤드는 세밀한 음향 세부 정보를 생성합니다. 의미 이해와 오디오 합성을 분리함으로써, 이 모델은 긴 대화에서도 화자 일관성을 유지할 수 있습니다
기존 TTS 시스템이 단일 화자나 짧은 상호작용에 한정되었던 것과 달리, VibeVoice는 대화 형식에서 최대 네 명의 서로 다른 화자를 동시에 생성할 수 있습니다. 이 모델은 자연스러운 발화 순서 전환을 보여주며, 긴 세션 내내 화자의 목소리 특징을 유지하여 합성 오디오 기술의 중요한 한계를 해결합니다.
AI 연구자들의 초기 테스트에 따르면, 이 모델의 활용 범위는 표준 음성 합성을 넘어섭니다. 소셜 미디어 플랫폼에 공유된 시연 자료에 따르면, VibeVoice는 영어와 중국어 간의 교차 언어 합성뿐만 아니라 노래 목소리 생성도 가능하며, 이는 오픈소스 TTS 모델에서는 드물게 볼 수 있는 기능입니다.
vall e는 언제나오냐
사만다 나오냐
1년만 기다리십시오..
말하다가 노래하는거 좋다 - dc App
1.5b 사이즈 빼면 최고네