언젠간 구글한테 따라잡힐거란 생각을 꾸준히 해왔고
2.5 pro때 드디어 그 때가 온건가 했는데 어느샌가 또 앞서가있음
기업 구조가 진짜 잘 되있는듯 스타트업의 장점과 대기업의 잠점을 섞어놓은느낌
내부모델 <- 개소리인가 싶다가도 진짜인 것 같은 미친 낭만의 단어
그록한테 밀린거 아냐?
그록 아직 o3보다 딸린다는 평도 많던데
@203847년걸리겠죠 그록에 대한 신뢰도랑 별개로 벤치 점수 자체는 밀리잖아
연구원들 피셜로 강화학습 이후로 벤치딸은 쉬워짐 그냥 비슷한 문제만 rl 시키면 포화됨
그록한테 밀렸다면 지금도 특갤에 그록 사용 후기가 계속 올라왔겠지 싶음. 챗봇에서 벤치는 참고자료일 뿐 진지하게 벤치를 좀 앞섰다고 밀렸다고 생각하는 사람은 없을거야.
@ㅇㅇ2(121.132) 뭐 그렇긴 한데 그렇게 따져서 모든 벤치가 의미없어진다면 비교는 불가능하다는거라..
@ㅇㅇ3(59.29) 실사용 구린건 맞는데 뭐 그렇게 따지면 이슈 많이 되는게 무조건 리드 하는건가? 2.5pro가 핫했을땐 구글이 oai 압살하던거였나? 그런 생각도 들긴 하네
@ㅇㅇ1(210.217) 모든 벤치가 의미 없다는 게 아니라 특정 벤치와 유사한 문제만 타겟해서 과적합시키면 포화시키는 건 껌인데 그럼 그록처럼 새로운 벤치나 실성능에서는 한계 드러내는 쎈황되는 거니까 의미가 없다는 것. 벤치는 이정표여야지 목표가 되어선 안된다는 거지
근데 2.5 pro 나왔을 쯤부턴 openAI 랑 알트만 혐오하는 애들 엄청 늘어났는데... 그게 테슬람이든, 2년간 억눌렸던 구글팬이든, 제발 이상한 라이벌 의식 가지지 말고 특이점 앞에서 화합 하면 좋겠다
테슬람은 이해가되는데 구글팬보이는 왜존재하는거냐 ㅋㅋㅋ
기업 구조가 진짜 잘 되있는듯 스타트업의 장점과 대기업의 잠점을 섞어놓은느낌
내부모델 <- 개소리인가 싶다가도 진짜인 것 같은 미친 낭만의 단어
그록한테 밀린거 아냐?
그록 아직 o3보다 딸린다는 평도 많던데
@203847년걸리겠죠 그록에 대한 신뢰도랑 별개로 벤치 점수 자체는 밀리잖아
연구원들 피셜로 강화학습 이후로 벤치딸은 쉬워짐 그냥 비슷한 문제만 rl 시키면 포화됨
그록한테 밀렸다면 지금도 특갤에 그록 사용 후기가 계속 올라왔겠지 싶음. 챗봇에서 벤치는 참고자료일 뿐 진지하게 벤치를 좀 앞섰다고 밀렸다고 생각하는 사람은 없을거야.
@ㅇㅇ2(121.132) 뭐 그렇긴 한데 그렇게 따져서 모든 벤치가 의미없어진다면 비교는 불가능하다는거라..
@ㅇㅇ3(59.29) 실사용 구린건 맞는데 뭐 그렇게 따지면 이슈 많이 되는게 무조건 리드 하는건가? 2.5pro가 핫했을땐 구글이 oai 압살하던거였나? 그런 생각도 들긴 하네
@ㅇㅇ1(210.217) 모든 벤치가 의미 없다는 게 아니라 특정 벤치와 유사한 문제만 타겟해서 과적합시키면 포화시키는 건 껌인데 그럼 그록처럼 새로운 벤치나 실성능에서는 한계 드러내는 쎈황되는 거니까 의미가 없다는 것. 벤치는 이정표여야지 목표가 되어선 안된다는 거지
근데 2.5 pro 나왔을 쯤부턴 openAI 랑 알트만 혐오하는 애들 엄청 늘어났는데... 그게 테슬람이든, 2년간 억눌렸던 구글팬이든, 제발 이상한 라이벌 의식 가지지 말고 특이점 앞에서 화합 하면 좋겠다
테슬람은 이해가되는데 구글팬보이는 왜존재하는거냐 ㅋㅋㅋ