얘는 그냥 음성 - 텍스트 모델이 따로 있는 느낌 
그 텍스트를 다시 LLM에게 넘겨줌 

한국어도 바로바로 인식하는게 아니라 한국어 인식모드로 바뀌어서 인식하는 느낌이네 



그래서 아예 하나의 모델에서 음성까지 처리하는 4o 랑 다르게 어조도 잘 인식하지 못하네