시험 상수 값 바꿔서 돌렸더니 성능 꼴아박았다는데 ㄷ
[일반] 엥 이거뭐임?
익명(59.28)
2025-01-02 12:37
추천 5
댓글 13
다른 게시글
-
경주마는 달릴뿐이야[일반] ailover(photo7512) | 25.01.02추천 0
-
4o와 아라키스 [3][일반] 익명(spoiler6984) | 25.01.02추천 2
-
애들이 아직도 알트만을 의심한다는게 들통 난거다[일반] 익명(ancestor7224) | 25.01.02추천 0
-
리니지) 무한컨텍스트=리덕션증가, 무한메모리=피통증가 [1][일반] 익명(14.37) | 25.01.02추천 0
-
lol 하면 짱개가 너네 정보 뺴감 [2][일반] 익명(1.216) | 25.01.02추천 2
-
다른 애들 발언 조까고 oai, 알트만 말만 들어라가[일반] 익명(bangonick0138) | 25.01.02추천 0
-
에이전트 안나온다가 구글만이잖아.. [1][일반] 익명(121.88) | 25.01.02추천 0
-
천만토큰 대충 이정도[일반] 익명(175.199) | 25.01.02추천 0
-
근데 무작정 코드포스만 존나높여도 해결가능함 [5][일반] 익명(heisy1111) | 25.01.02추천 0
-
양자컴퓨터+AI=?[일반] 익명(heisy1111) | 25.01.02추천 0
모델들이 지금 너무 과적합되어 있어서, 실제로 생각을 하고 추론을 해서 답을 하는게 아니라 인터넷어디서 봤던걸 그냥 그대로 복붙하고 있다는 다소 암울한 소식임... o1도 꽤나 크게 떡락한거 보면 흠.. 희망은 o3뿐인가..
에이 씨.발 결국 족보충이란 소린아님
아~ 특이점은 글럿다 그냥 존나 열심히 살아야지
근데 이거말고도 그 과적합전용 벤치 따로 있는데 유명한 트롤리 문제 꼬아서 "철로에 5구의 시체와 1명의 살아있는 사람이 묶여있을때" 같이 바꿔서 냈을때도 합리적인 답을 내놓는가 하는 벤치에서 내가 예전에 보기로는 이미 여기서도 그렇게 점수들이 좋지는 않았던거로 기억함.
o1이 아니라 o1 프리뷰 아니냐?
난 o1이든 o1 preview든 족보충이 아니라 진짜 추론을 하는 애들이라면 단순히 변수명을 바꾸거나 표현방식을 바꾼거 가지고 저렇게 차이가 나서는 안된다 생각함...
일단 o1은 어느정도 차이가 나는지 모르니까
아직까진 족보충에서 완전히 벗어나진 못한다는거지
이게 ㄹㅇ
흠.. 씹겨울이네
'표현 방식' 건드린 벤치는 좀 걸러볼 필요는 있음. 그동안 ai 검증하겠답시고 여러 벤치들이 나왔었는데 저 표현방식 건드렸다는 벤치들 하나같이 벤치가 별로였었음
해리포터 를 학습시킨 뒤에 해리포터 등장인물들의 이름만 싹다 바꿔서 스토리만 같게 만든 작품인데도 동일한 작품인지 못알아봤다는거아님
이게 24년 9, 10월에 발표된 벤치인데 지금까지 별 관심 못받은 이유는 너무 명확함. 난이도 세분화가 이뤄지지 않았고 데이터셋이 너무 작아서 데이터 신뢰성을 보장할 수가 없었음.