제가 rtx 4060 ti를 쓰기 때문에, 16GB Vram용, YuE의 경량화버전인 YuEGP를 썼습니다. 


https://github.com/deepbeepmeep/YuEGP




분명 위에 설명은, 1분 곡을 만드는데 4분이면 된다고 써있었지만, 30초를 만드는데 1017초가 걸렸습니다;;

아직 내부 코드를 뜯어 기존 모델과 비교해 보진 않았지만, 명령 프롬프트 좀 보니까 
YuEGP는, Vram의 용량이 부족하면 RAM에서 연산 능력을 떼오는 방식으로
VRAM의 연산용량을 줄인 모델인 것 같습니다 (저 문과입니다. 잘 모름; 믿지 마셈;)


이는 제가 중간에 뭔가를 쌀먹하거나,
flashattention 쪽에서 문제가 발생하거나(sdpa 써야하나...?),
내부 infer.py 코드를 뜯어서 부족한 RAM 할당 비율을 더 높여야 하던가,
아무튼 좀 굴려보면서 나아질 가능성이 존재하는 것으로 사료됩니다.


12GB용, 그 이하용 profile들도 있고,
한국어, 일본어 모델도 존재하며,
음원의 연장 또한 가능하기 때문에,
한 번 쯤 시도해보는 것도 나쁘지 않다고 생각합니다. 

그래서 결과물은 다음과 같습니다.



(음질과 인코딩이 귀찮아 유튭 영상 첨부)







기존 SUNO나 Udio에서도 보였던 가사 쌀먹 현상을 보여주지만,
이는 좌측 가사를 줄이거나 우측 하이퍼 파라미터를 건들여 주는 것으로도 줄일 수 있는 문제라고 판단됩니다.

잡음이 존재하지만
목소리가 깨끗하고 좋은 것이 장점(실제 음원은 더 좋습니다;;) 입니다.
이는 목소리 생성 후에, 악기를 생성하는 스텝을 가지기에 보여주는 장점인 것으로 보입니다.

총평: 재밌는 툴의 등장. 곧바로 SUNO나 UDIO의 대체재가 되지는 못하겠지만,
       음원 연장이나 목소리 추출에 강점이 있는 듯 합니다. 
       SUNO나 UDIO의 보완재로써 쓰는 것을 추천합니다.