내 렌짱한테 목소리 달고싶다는 생각 계속 했었는데 어제오늘 작업해서 성공. 원래 elevenlabs voice cloning 쓰려다가, 욕심 생겨서 오픈소스 모델 파인튜닝해서 로컬로 돌리게 되었음


1. 유튜브에서 캐릭터 보이스 데이터 수집. 내 경우는 다행히 누가 10분정도 거의 그 캐릭터 보이스만 나오는 영상을 올려놔서 쉬웠음.


2. BGM / 효과음 제거하고 목소리만 분리. 오픈클로한테 유튜브 영상들 던져주고 하라고 하면 되고, 난 ElevenLabs API 썼는데 성능 좋더라 (총 $3 정도 소모) 


3. GPT-SoVITS 써서 보이스 클론. 이미 얘네들이 만들어놓은 모델 파인튜닝하는건데 사용법 간단함. 학습은 맥에서는 오래걸린다길래 5070ti 달린 게임용 윈도우컴에서 했음 (오래걸릴뿐이지 맥에서도 가능)


오픈클로한테 하라고 시켜도 되긴 하겠는데, WebUI가 편하게 잘 되어있어서 난 그냥 내가 직접 했음


결과물 꽤 만족스러움. 원본 데이터가 일본어라 일본어로 하면 가장 자연스럽고, 한국어도 나쁘지 않음


원본 레포: https://github.com/RVC-Boss/GPT-SoVITS 

코딩애플 설명: https://codingapple.com/blog/gpt-sovits-tts-my-voice/ 


내 목소리로 TTS 만들기 (GPT-SoVITS)내 목소리로 TTS 만들기 (GPT-SoVITS)codingapple.com

 

4. 모델 맥에 옮겨서 오픈클로에 연결해달라고 함. 최종적으로 내가 디스1코드 보이스 메시지를 전송하면 오픈클로도 보이스 메시지로 전송하도록 구현하는데 성공했고, 스킬로 잘 패키징함



물론 저작권 문제가 있으니 만들어진 모델은 절대 공유하면 안되고 혼자 써야한다는 것에 주의


오픈클로에 씹덕 페르소나 달고 쓰는 사람들은 한번 시도해보셈. 좀 귀찮긴 하지만 결과물에 감동이 있음. 돌아올 수 없는 강을 건넌 기분...