1번 방법:
업스테이지 도큐먼트 파서 -> 디텍션된 영역별로 캔버스로 그려서 번호 매김 -> 세부적인건 gpt5 호출해서 후보군 잡아서 컨피던스 높은 순위별로 파싱(근데 이거 제미나이 썻다가 좆망해서 모델 바꿔서 2차 시도중)
2번 방법:
구글 도큐먼트 ai 커스텀 추출기 머신러닝 시켜서 도메인에 맞게 학습 시켜서 버전 별로 관리 아무 문서 파싱된거 디텍션해서(임마는 텍스트만 ㅇㅇ) orc로 grow 할당해서 순위 높은 주변 빈공간 입력 영역으로 디텍션 하기
1번은 하다가 제미나이 써서 좆망햇고 재시도 할까 하고
2번은 시도중인데 장기적으로 보면 구글 임마들 바운딩박스 잡는거 실험실에 잇길래 기대 걸어봐도 되겟는데
프로토타입 빠르게 뽑아야하는 상황(2주내지)이면 걍 1번이 나을라나
근데 꾸준한 정확도 보장 못하니까 확답을 못하겟노
1번은 멀티 모달로 레이아웃 디텍션댄 이미지랑 json 같이 보내는거심
이거 실현가능성이 매우 낮아보이는데 뭔가
매우 낮은거 맞는데 내가 무슨 발언권이 잇겟소 하라면 해야제..
뭘해도 정확도 이슈는 발생할꺼같긴함
목표치가 85퍼정도
이거 내가 어제 끝낸 프로젝트인데 document가 수학책일 뿐
해결해야할 문제가 정확하게 뭐임? 방법만 나와있어서 잘 이해가 안되누 - dc App
사용자가 입력해야하는 영역만 바운딩 박스로 디텍션하기 어느 문서든 상관 없이
근데 이걸 해내라고 시킨 윗선이 잘못된게 아닐까?
ㅇㅇ 답이 없긴하네;; 차라리 UI이면 후킹이라도 하지;; 애쓴다;;
도메인을 좀 줄이는거 말고는 답 안 나올듯.
음 간단하게 생각해보면 omniparser v2같은 놈 좀 파인튜닝하면 될 것 같은데 gui agent용이지만 일단은 클릭이나 입력을 위한 에이전트를 만드는거라 대충 될 것 같기도?
입력할 영역이 bbox로 검출되기는 하냐가 제일큰문젤듯
@ㅇㅇ(183.102)
https://huggingface.co/spaces/nofl/OmniParser-v2
일단 돌려봐서 대충 각 나오면 파인튜닝 gg
그리고 업스테이지 그거 100번에 1달러인가 유료아니냐 생돈날리지마셈
@troublecoder 일단 이넘으러 시도즁
@ㅇㅇ(183.102) 이게 가장 골치긴함
@troublecoder 이거 햇다가 개같이 망하고 yolo 학습 시키는걸루감
욜로 라이센스 이슈 어쩌고 글고 그럼 대상이 오픈이 아니라 어느정도 정해진거임? - dc App
@troublecoder 정해져잇음
아 정해져있으면 닥 욜로지;; - dc App
인도인고용해서 ai인척하라그래