영상 40분정도 단위로 잘라서 인식+v1 or medium 사용하면 그나마 좀 나은데
존나 번거롭네 이게 그냥 음성이 없거나 말이 아닌 의성어 반복 구간에서 마지막 문장을
반복해서 적히는 것 까지는 그냥 무시하면 되는데
환각 구간에 들어가서 문장 반복이 시작되면 뒷 부분에 정상적인 음성이 나오는 구간에서도
환각에서 빠져 나오 질 못함
영상 40분정도 단위로 잘라서 인식+v1 or medium 사용하면 그나마 좀 나은데
존나 번거롭네 이게 그냥 음성이 없거나 말이 아닌 의성어 반복 구간에서 마지막 문장을
반복해서 적히는 것 까지는 그냥 무시하면 되는데
환각 구간에 들어가서 문장 반복이 시작되면 뒷 부분에 정상적인 음성이 나오는 구간에서도
환각에서 빠져 나오 질 못함
위스퍼는 STT 모델이지 않나? 환각은 LLM 모델한테만 쓰는 말일거고 네 말은 그냥 모델 성능 문제 같은데 그럼 이미 해봤겠지만 하이퍼 파라미터 조절하거나 음성 자체를 전처리해서 문제되는 부분을 지울 방법을 고민해야할 듯. 나는 모름.