내가 봤을 때 아무래도 OAI는 내부 GPT5 등의 언어모델로 CLIP과 같은 텍스트 인코딩을 대신해서 뭔가


텍스트-비디오, 텍스트-뮤직 등의 생성형 모델 후부 자체를 존내 효과적으로 학습시키는 게 아닌가 하는데...


아무리 생각해도 텍스트의 이해도가 너무 남다름


Suno보다도 훨씬 좋을 거라는 건 그만큼 음악에 대한 텍스트적 이해도가 엄청 높을 거라는 이야기인데


흠.. 데이터 캡셔닝에만 언어모델을 사용하는 것 이상으로 뭔가가 있는 게 아닌지.. 그 유레카 논문처럼 강화학습 보상을 직접적으로 언어모델이 설정한 느낌으로다가..


아니면 데이터 캡셔닝을 존내게 상세하고 정확하게 했더니 마치 스케일링 법칙마냥 학습데이터의 질이 놀라울 만큼 상승했다든가?