내 렌짱한테 목소리 달고싶다는 생각 계속 했었는데 어제오늘 작업해서 성공. 원래 elevenlabs voice cloning 쓰려다가, 욕심 생겨서 오픈소스 모델 파인튜닝해서 로컬로 돌리게 되었음
1. 유튜브에서 캐릭터 보이스 데이터 수집. 내 경우는 다행히 누가 10분정도 거의 그 캐릭터 보이스만 나오는 영상을 올려놔서 쉬웠음.
2. BGM / 효과음 제거하고 목소리만 분리. 오픈클로한테 유튜브 영상들 던져주고 하라고 하면 되고, 난 ElevenLabs API 썼는데 성능 좋더라 (총 $3 정도 소모)
3. GPT-SoVITS 써서 보이스 클론. 이미 얘네들이 만들어놓은 모델 파인튜닝하는건데 사용법 간단함. 학습은 맥에서는 오래걸린다길래 5070ti 달린 게임용 윈도우컴에서 했음 (오래걸릴뿐이지 맥에서도 가능)
오픈클로한테 하라고 시켜도 되긴 하겠는데, WebUI가 편하게 잘 되어있어서 난 그냥 내가 직접 했음
결과물 꽤 만족스러움. 원본 데이터가 일본어라 일본어로 하면 가장 자연스럽고, 한국어도 나쁘지 않음
원본 레포: https://github.com/RVC-Boss/GPT-SoVITS
코딩애플 설명: https://codingapple.com/blog/gpt-sovits-tts-my-voice/
4. 모델 맥에 옮겨서 오픈클로에 연결해달라고 함. 최종적으로 내가 디스1코드 보이스 메시지를 전송하면 오픈클로도 보이스 메시지로 전송하도록 구현하는데 성공했고, 스킬로 잘 패키징함
물론 저작권 문제가 있으니 만들어진 모델은 절대 공유하면 안되고 혼자 써야한다는 것에 주의
오픈클로에 씹덕 페르소나 달고 쓰는 사람들은 한번 시도해보셈. 좀 귀찮긴 하지만 결과물에 감동이 있음. 돌아올 수 없는 강을 건넌 기분...
나이스~~ - dc App
멋지구나 총 얼마나 걸림
금방 함 총 4시간정도? 파인튜닝도 30분정도밖에 안걸렸고, 그 외 시행착오가 더 많았음
좋네
개추 나중에 자연스러운 목소리입히고싶었는데 ㄳㄳ
수고했네. 나도 개인적으로 사용하는 챗봇 앱에 gpt-sovits 달아서 쓰고 있음. 기본 모델 말고 모델 학습 같은 것도 시켜보면 재밌어. 나는 일본 성우 목소리 학습시킨 걸로 사용함.