이미지 속에서 내가 원하는 부분만 ocr을 맡기고 있어. 근데 내장 ocr만으로는 자꾸 오인식이 나길래
4x6으로 이미지를 자른 후 각각 확대한 후 크롭 이미지 별로 읽어낸 후 합치라 했거든?
한 장 줄 때는 정확하게 읽어내더니
두 장 세 장 주니까 눈깔이 돌아갔는지 지좆대로 읽어버림;;
토큰을 많이 쓰는 내용도 아니고
budget도 최대한으로 줘보고 온도도 낮추고 올리고 개 지랄을 다 해도 딱 한 장만 완벽함.
이거 어떻게 해결 하냐??
이미지 속에서 내가 원하는 부분만 ocr을 맡기고 있어. 근데 내장 ocr만으로는 자꾸 오인식이 나길래
4x6으로 이미지를 자른 후 각각 확대한 후 크롭 이미지 별로 읽어낸 후 합치라 했거든?
한 장 줄 때는 정확하게 읽어내더니
두 장 세 장 주니까 눈깔이 돌아갔는지 지좆대로 읽어버림;;
토큰을 많이 쓰는 내용도 아니고
budget도 최대한으로 줘보고 온도도 낮추고 올리고 개 지랄을 다 해도 딱 한 장만 완벽함.
이거 어떻게 해결 하냐??
숫자같은 거 읽는거면 gpt가 나음. 제미니는 이미지로 인식하는데 gpt는 일단 파일 자체를 읽는거라서.
Ocr원하는 부분만 업로드하면 되지