특정 벤치 잘나오게 튜닝 조져놓고 4o땃다니 소넷 땃다니 의미 없지 않나 범용성과 일반 지능이 중요하니까 벤치 자체가 오염되는 문제도 있고
체감이 역시 확실한 지표 같은데 이건 챗봇 llm 특성상 이전 채팅 내용에 따라 답변 기복이 있어서 또 애매한듯
사용자가 미숙하면 올바른 방향으로 짚어주면서 알잘딱 균일한 답변이 가능한것도 일종의 성능으로 쳐줘야 할듯
특정 벤치 잘나오게 튜닝 조져놓고 4o땃다니 소넷 땃다니 의미 없지 않나 범용성과 일반 지능이 중요하니까 벤치 자체가 오염되는 문제도 있고
체감이 역시 확실한 지표 같은데 이건 챗봇 llm 특성상 이전 채팅 내용에 따라 답변 기복이 있어서 또 애매한듯
사용자가 미숙하면 올바른 방향으로 짚어주면서 알잘딱 균일한 답변이 가능한것도 일종의 성능으로 쳐줘야 할듯
벤치딸 ㄹㅇ 의미없음 실제로 모델들 써보면 체감 완전 다름 - dc App
확실히 그런듯요
ㄹㅇ 써보고도 별로인경우 많은듯