기존 보이스와 분명히 매커니즘 다르긴 하지만 절대 완전한 STS는 아닐 거라고 생각함. 일단 텍스트로 변환될 수 없는 사운드를 전혀 인지하지 못함. 그리고 목소리 크기를 다르게 해도 정확히 구분을 못함. 첨에는 하는 줄 알았는데 순서 바꿔서 여러차례 시도하니까 오답이 훨씬 많음 - dc official App
그건 gpt 모델도 똑같은데. 새 보이스모드는 사람 목소리만 학습시킨듯
나도 방금해보니 삐구 조금씩 나는데 파악은 하거든? 근데 삐꾸나니까 짜치긴 함. 소리 크기에 관한거나 기타 기능 성능제한 걸은듯? 왜냐면 톤 억양은 또 파악하더라. 저번에 점원같은지 광대같은지 물어보고 대사 고정한채로 테스트 하니 삐꾸 없더라고.