AIW(Alice in Wonderland) 벤치마크는 초딩도 풀 수 있는 매우 간단한 문제로 구성돼 있음.
예를 들어,
"앨리스는 N명의 형제가 있고, M명의 자매도 있어. 앨리스의 형제는 자매가 몇 명일까?"
여기서 N이랑 M의 숫자만 바꾸는 형식임.
근데 이 벤치마크에서 R1이 박살나고
o1 프리뷰에 비비지도 못한다고 함
추가적으로 R1의 정답률 분포가
뉴소넷이랑 o1 미니랑 매우 흡사하다고 함
R1 훈련에 사용된 데이터는 여전히 비공개
AIW(Alice in Wonderland) 벤치마크는 초딩도 풀 수 있는 매우 간단한 문제로 구성돼 있음.
예를 들어,
"앨리스는 N명의 형제가 있고, M명의 자매도 있어. 앨리스의 형제는 자매가 몇 명일까?"
여기서 N이랑 M의 숫자만 바꾸는 형식임.
근데 이 벤치마크에서 R1이 박살나고
o1 프리뷰에 비비지도 못한다고 함
추가적으로 R1의 정답률 분포가
뉴소넷이랑 o1 미니랑 매우 흡사하다고 함
R1 훈련에 사용된 데이터는 여전히 비공개
저기에서 무너진다라...
공짜거지들의 근들갑이 도를 넘음
인류의 마지막시험 이런건 O1보다 낫더니 이런데서 무너지네 미친거냐
근들갑이 너무 심해서 뭐가 맞는지 모르겠음
해당 댓글은 삭제되었습니다.
고도로 발달된 과적합은 추론과 비교할 수 없다
o1 ㄱㅈㅇ~~ - dc App
저걸 왜 박살났나고 봐야 하나?
다른 벤치마크에서 o1 따-잇하는데 저기서만 무너지니까
실성능은 o1 아래 급으로 체감되기는 해서 전혀 이상하지 않음... 근데 구글이나 메타는 아직 r1 정도 되는 모델도 못 만들어서 충격적인거 아닌가
대르쿤 고양이 지능설 1승
당연히 못이기지 ㅋ 하지만 검색+추론 같이 되는 건 오직 딥시크밖에 없다는 것 ㅋ
이게 크다고 생각함
근데 이런 벤치마크가 의미가있음? 걍 트위터중독자새끼등이 지들 뽕좀채우려고 만든거같은데
o1한텐 엄격근엄진지 r1 엔 관대하신 분들이 많음ㅋㅋ 9.11 9.9 로 불태웠던거 생각하면ㅋㅋ
그건 그렇긴 한데 누군 진짜 오픈소스고 누군 아니잖아
그게 아니라 o1 나올때는 근들갑 존나 떨던 애들이 r1만 삐딱하게 봄 애초에 무지성 은은한 중혐이 먼저 삐딱하고 흠잡으려고 보니까 정상적인 애들이 말을 그렇게 하게 되는거지
그냥 이건 r1이 어떤방식으로 돌아가는지 이해하려고하지도않고 특정조건때 낮으니 넌 허졉임 이러고있네. 눈가리고 아웅하기임? 모든리더보드 랭킹에서 상위권휩쓰는대 혁신을 공유하고 장점을 취할생각을해야지. 특정부분 점수낮아 ㅇㅈㄹ
o1이 특정부분에서 발렸다고 r1 빨 때는 언제고 기초적인 추론 못한다는 내용밖에 없는 정보글에 왜이리 발진함? - dc App
그냥 정보글인데
딥천지
이건 많이 크네
aiw라는 문제 집합에서는 o1미니랑 비슷하고, aiw+라는 문제 집합에서는 클로드3.5랑 비슷하네. o1미니랑 클로드3.5는 aiw보다 aiw+에서 점수가 전체적으로 확 낮아지는데 딥식 r1은 안 그러고... 흠터레스팅...
해당 댓글은 삭제되었습니다.
o1이 학습했으면 r1도 학습했겟지 바보냐 ㅋㅋ
이런 벤치가 의미 없다는건 아니고 r1 관련으로 ai 업계가 불타오르는건 뻥벤치가 아니라 실제 체감 성능이 밴치만큼 높기 때문임... 너무 올려치기하면 안 되지만 내려치기 할 이유도 없다고 봄
글쓰게 시켜도 존나 이상함
딥식에 대해 호들갑은 필요하다고 생각함. 미국에서 규제 같은 소리 못나오게 그리고 발전에 더욱 매진할 수 있어야함
싸잖아 한잔해 - dc App
왜지 - dc App