다들 만족하고 쓰고 지표상에서 제미니보다 앞서네?
구글 ai 스튜디오 튜닝해가며 쓰는중인데 코딩이든 추론이든 gpt가 앞서고 있는게 맞음?
둘 다 결제해서 쓰고 클로드는 친구거로 맛만 보다가 한 4월부터 제미니/ai스튜디오 쓰는중인데 역전된 상황임?
다들 만족하고 쓰고 지표상에서 제미니보다 앞서네?
구글 ai 스튜디오 튜닝해가며 쓰는중인데 코딩이든 추론이든 gpt가 앞서고 있는게 맞음?
둘 다 결제해서 쓰고 클로드는 친구거로 맛만 보다가 한 4월부터 제미니/ai스튜디오 쓰는중인데 역전된 상황임?
너는 고봉밥 답변을 중요시하는 타입인듯??
오히려 고봉밥 말고 핵심만 출력하게 튜닝하고 쓰는데
대다수 유저가 쓰는 일상채팅은 gpt가 넘사임
일상 채팅이라 하면 주로 어떤 토픽들로 채팅하는거임? 대부분 작업 용도로 쓰는거 아니야?
사람들이 ai한테 뭐물어보는지 ais한테 물어봐
ai체감 능력은 그걸로 뭘 하느냐에 따라 사람마다 천차만별임
지표는 거짓말을 하지 않아. - dc App
압도적까지는 아닌데 얜 gpt를 아예 잘못쓴듯
왜 압도적이냐면 gpt는 할루시가 일상임. 토큰이 얼마나 쌓이냐와 상관 없이 특정 자료, 코드구조, 숫자등 부분에서 직전과 직후에 하는 답이 다를때가 많음. 정확성에서 신뢰가 불가능함
@글쓴 ㅇㅇ(175.123) o3 쓴거지? 한 대화창 내에서 앞서 말한거랑 뒤에 말한 게 다르다는 거면 컨텍스트 길이 때문이겠네. 이건 나도 불만이긴 함. 좀 짧아. 그래서 코드 좀 길게 요청하면 중간 부분을 수정 요청했는데 앞부분도 수정해버린 다음에 출력해줌.
그때 시점에 o3 맞았던거같아
진짜? 클로드는 작년 말에 워낙 좋다해서 몇번 테스트 해보고 안써봤는데 코딩은 주로 내가 짠 코드 검수하거나 구조만 좀 효율적이게 마지막에 바꾸게 시키는데 ai studio로 하고있긴 해. gpt는 프롬프트로 제한 해도 검토 시키면 문제가 없는데 문제점을 헛소리로 만들고 빙빙 돌거나 구조 바꿀 때 메서드 구문을 마음대로 바꾸거나 삭제하고 뭐 그런 문제가 있어서 열받았었거든
한 1,2주마다 모델 업데이트 좀 진행하면 체감 성능이 많이 달라짐. 그래서 GPT가 더 좋게 느껴질 때도 있고, 제마니이가 더 좋게 느껴질 때도 있는 것 같음. 그리고, 사람마다 사용하는 방법이나 질문, 프롬프트도 달라서...벤치는 참고용이고, 그냥 개인 취향에 맞게 쓰면 될 것 같음. 다만, 앞서 말했듯, 1,2주마다도 달라지기 때문에 'XXX가 제일 좋네.' 라고 해도 한두달에 한번씩이라도 무료버전이라도 써보면서 확인해보는 게 좋을 것 같음. 자신만의 질문을 하나 만들어서 답변 수준을 비교해보든지.
나도 GPT4부터 계속 쓰다가, 컨텍스트 길이랑 답변 성능 때문에 제미나이 한달 갈아탔다가, 다시 제미나이가 빙빙 도는 코드 문제를 o4 미하가 한번에 풀어내길래 다시 GPT로 돌아옴. o3도 틀린 문제라 그냥 그 문제는 내 지식으로 질문했을 때 푸는 건 o4 미하. 그래서 쓰는거지 뭐.
코드 문제 주로 내가 짠 코드 검토시키고 전체적으로 완성 되면 효율적이게 구조 변경 시키는데 쓰는게 대부분인데, 4월 까지는 gpt가 이부분에서 많이 부족했던거 같음. 지금 아직 결제중이고 여친이 가지고 놀던데 한번 테스트 해봐야겠다 그럼
코드싸개로 쓰면 당연히 gpt 가 별론데 그냥 문뜩 궁금한거 물어보거나 하면 인간적으로 답해주는건 gpt 임.
ㅇㅎ..
논리적 사고는 특히 제미니 따라잡을 만한게 아직 없는듯. 난 결제하긴 아까워서 FlakeLLM 이거 gemini 2.5 pro 무료로 쓸 수 있길래 쓰는중