그냥 기존에 음성 인식해서 텍스트로 변환하고

답변 tts로 읽어주는 거랑 다른거임?


뭐 예를 들면 말하다가 버벅이거나 하는 타이밍에

아 잠깐만 기억이 안나네...

하면 실제 인간마냥 좀 더 기다려서 답변해주고 그러나