얘는 그냥 음성 - 텍스트 모델이 따로 있는 느낌
그 텍스트를 다시 LLM에게 넘겨줌
한국어도 바로바로 인식하는게 아니라 한국어 인식모드로 바뀌어서 인식하는 느낌이네
그래서 아예 하나의 모델에서 음성까지 처리하는 4o 랑 다르게 어조도 잘 인식하지 못하네
얘는 그냥 음성 - 텍스트 모델이 따로 있는 느낌
그 텍스트를 다시 LLM에게 넘겨줌
한국어도 바로바로 인식하는게 아니라 한국어 인식모드로 바뀌어서 인식하는 느낌이네
그래서 아예 하나의 모델에서 음성까지 처리하는 4o 랑 다르게 어조도 잘 인식하지 못하네
댓글 1