입출력 멀티모달 토큰 통합이나 Text & Image to Image는 메타 같은 데서 그래도 좀 따라잡으려 하는 것 같은데


Speech까지 잡은 사례는 진짜 OpenAI 말고 단 하나도 생각이 안 나네