시발 이미지 보고 추론하는 기능은 없나
[일반] O1이 어떻게 소네트보다 착시 못알아보냐;;
익명(january5714)
2024-12-10 14:01
추천 1
댓글 4
다른 게시글
-
착시 저거 다시 물어보면 맞춤 [1][일반] 익명(1.215) | 24.12.10추천 0
-
치타가 잘달리네[일반] 익명(58.151) | 24.12.10추천 0
-
오늘 공개된 테슬라봇은 카메라를 사용하지 않음 [5][📪정보] 익명(black542) | 24.12.10추천 2
-
라이브벤치 현황 [3][일반] 익명(112.186) | 24.12.10추천 1
-
자율주행 << 사실상 거의 완성 아님? [4][일반] 바다기린(hancomputer) | 24.12.10추천 0
-
지금 에이전트 나와봤자 의미 없을거같노 [2][일반] 익명(peasant1016) | 24.12.10추천 0
-
여기 놈들 쓸데없이 우상화가 심함 [6][일반] 익명(sisibalbal0) | 24.12.10추천 1
-
지피티를 활용한 엑셀 정리법 알려주라[일반] DDODDOBO(babysit3055) | 24.12.10추천 0
-
1206 무료인데 성능 미쳤네 [2][일반] s82q규9(61.76) | 24.12.10추천 0
-
컴퓨팅파워.. TSMC 하나만 있어서 너무 병목이네 [2][일반] 익명(58.151) | 24.12.10추천 0
내생각에 굳이 학습은 따로안시킨거같음 그냥 데이터뭉치넣은듯 아마 학습시키면 금방할거같은데
아니지, 얘네는 이미지를 바로 인식하는 게 아니라, 이미지 인식모델한테 이미지 보내고, 거기서 출력된 텍스트를 보고 답변한다고 봐야지. 그러면, 이미지 인식모델이 도형의 색, 위치 정도는 출력해주는데 크기나 더 디테일한 정보는 안 뽑아준다고 봐야겠지. 하지만 이 정보 만으로도 무슨 실험에 사용된 무슨 그림인지는 인식할 수 있으니 그에 대한 정보를 출력하고 있는거고. 그런데 이걸 이미지 인식모델이 못 하는 걸 아닐거고, 할 순 있는데 데이터 사용량 때문에 제한 걸어둔 거라고 봐야 할 듯. 이건, LLM의 근본적 문제, 지능 문제. 이건 아닌 듯.
하지만, 에이전트 등에 쓸거면 당연히 저런 걸 구별해야 하니까, 이미지 인식 모델 자체를 더 좋은 걸 쓰게 해야 할지(그러면 컴퓨팅 자원이 더 필요함) 혹은, 4o처럼 아예 멀티모달로 만들지. 물론 멀티모달이라고 저거의 크기도 제대로 인식하는 지는 알 수 없는 것 같음. 그래도, 4o 처음 나왔을 때 사진만 넣어도 어느 지역 어디 사진. 착시 사진 전부 찾아냈다가 검열되면서 너프 먹은 거 생각하면, 실성능은 어느정도 가능하지 않을까 싶긴 함.
o1 pro는 잘함 ㅇㅇ