비교군에 제미니 2.0이 없어서 아쉽긴한데
비추론모델군 중에서 컨텍스트 길어질수록
제일 맥락 기억 잘하는게 4o임
8k토큰부터 모든 모델들이 빠르게 무너지고
32k에서는 기억력 50프로 밑으로 곤두박칠치는데
4o만 그럭저럭 잘 유지함
저 테스트는 모래시장에서 바늘찾기가 아니라 맥락 추론 테스트라 보면됨
예를들어서 "특붕이가 못먹는 음식이 뭐였지?" 하고 물어보면
모델들은 컨텍스트에서
1. 특붕이가 우유먹고 배아팠던 장면
2. 이후 화장실가서 설사한 장면
에서 정보를 찾아내고 추론해서 맞출 수 있는지를 봄
여기서 4o가 제일 성능좋았던거보면 코딩쪽이 병신이어도 맥락파악은 goat라고 볼수있음
나도 소설용으로 제미니 쓰지만 4o가 성인모드 있었으면 4o썼을거임 - dc App
ㄹㅇ요
ㅈㄴ 욕쳐먹어도 아직도 저걸 못넘네 ㅋㅋ
4o가 은근쓸만함 ㅋㅋ
메모리없이 측정한건가?
ㅇㅇ
없는데 이정도면 4o+메모리 생각보다 괜찮은데?
4o 확실히 좋긴해
국밥 모델
또 또 벤치딸. 나 API로 3 split window 열어서 세개 모델 동시에 동일 작업 매일 하는데 4o는 그냥 씹퇴물임. 컨텍스트 대비 성능 좋은면 장땡? 어휴 ㅋㅋㅋ
소넷이 단문, 세부적 표현은 지리는데 확실히 전체적인 숲을 보는 능력은 많이 떨어진다고 느껴지긴 함
ㄹㅇ 신기하긴함. 코딩에 있어서 제일 중요한게 맥락파악이나 기억력이라 생각하는데 코딩에선 4o 압살하고, 소설같은 맥락추론테스트에선 많이 밀리고
ㄴ소설도 사실 소넷이 더 좋긴함 귀차니즘이 존나 심해서 그렇지