apache tika쓰면 이미지, 워드, pdf 기타 포맷 다 인식하고 빠름ㅈㄴ 오래된거고 난 처음 썼던게 2012년이고 15년에 기여 좀 했었는데teserreact, 클로버 이딴거 다 신경끄고 걍 tika 써라
쟤는 캡챠 이미지 라던데
엔드유저용 프론트엔드 있나요
캡챠 저거는 자릿수도 고정이고 크기 변환 매우 조금이라 그냥 적당히 세그멘테이션 고정으로 해서 때려맞추면 될텐뎅 - dc App
과분할을 해서 하든 작게 쪼개서 rnn으로 ocr 밀어붙이든하면 됨. 데이터 때려붙는 양이 중요할 것 같은뎅 - dc App
숫자로된 흉님 예제는 보면 왜곡인지 몰라도 숫자 한두개씩 명암이 좀 약한게 있음. 그쪽으로 프로젝션 쏴보면 사실상 노이즈 선의 일부를 잡아낼 수 있어서 전처리로 어느정도 라인도 제거 가능할듯 - dc App
글고 tika는 내가 알기로 ocr은 tesseract 쓰고 나머지는 파싱 아닌가? - dc App