캐글좀 돌려보면 앙상블로 모델이나 데이터 무지 먹이면
어느 한계까진 accuracy 존나 올라가는데 어느 수준부턴 절대안올라감
데이터가 적으면 전체 set에 대해 test set에만 과적합되는데
데이터셋이 존나크면 그걸 줄일 수 있어서 scale이 문제라고 하는건가 싶은데
솔까 이제 더 뽑아먹을 데이터가 없는듯. 전기 비용도 문제지만
알고리즘 자체에 뭔가 발전이 있어야됨
캐글좀 돌려보면 앙상블로 모델이나 데이터 무지 먹이면
어느 한계까진 accuracy 존나 올라가는데 어느 수준부턴 절대안올라감
데이터가 적으면 전체 set에 대해 test set에만 과적합되는데
데이터셋이 존나크면 그걸 줄일 수 있어서 scale이 문제라고 하는건가 싶은데
솔까 이제 더 뽑아먹을 데이터가 없는듯. 전기 비용도 문제지만
알고리즘 자체에 뭔가 발전이 있어야됨
ㅇㅇ 내년 oai모델부턴 데이터 ㅈ도 안먹을예정임
갠적으로 ㅈㄴ 궁금한거 있는데 방명록으로 물어보는거 ㄱㄴ?
? 어짜피 나 방명록도 다 오픈이라 소용없음 걍 여기서 물어봐 여기서 답변불가면 어떤식으로든 연말까지 가야함
너가 항상 말하는거 신뢰할만한 소스에서 받는거냐? 어떤거맞춘 애한테 소스 받길래 당당하게 말하노? 진짜 궁금해서 그럼
ㅇㅇ 소스있음 출처는 올해말에 공개함
약속한 사항이라 지금은 이것이상 떠벌릴수없음
그전에 어떤거 맞췄는지도 못말해주냐?
헛소리같으면 걍무시해
네가 말하는 스케일이랑, 지금 스케일의 법칙이랑 조금 다를 걸? 네가 말한 스케일은, 그냥 데이터가 너무 적을 때 과적합 되니까, 더 많고 다양한 양질의 데이터를 학습하도록 하는거고. 지금 스케일의 법칙은, 양질의 데이터도 늘리고, 모델도 더욱 키웠을 때. 원래는 얘도 일정 크기나 데이터 양 이상에선 과적합이 되고 성능 향상이 별로 없어야 하는데 데이터양과 모델의 크기에 비례해서 계속 성능이 향상되고 있는 걸 말할거임. 10만원보다 100만원이 좋더라. 정도 이야기가 아니라, 100억보다 1조가 더 좋다 급으로 데이터 크기랑 모델 크기가 차이 날거임. 조금 다른 이야기.
물론, 네 말도 틀린 건 아닐게, 얀르쿤은 그래서 이해와 추론하는 모델 만들어야 한다고 말하는거고. 그러면 예시 두세개로도 이해할 수 있을거다. 이거고. 근데 데이터 양에 대해선 난 생각이 조금 다른 게, 합성데이터 활용하면 될거라고 생각함. 물론 많은 사람들이 AI가 생성한 데이터를 재학습 하면 성능 저하 있다는 얘기도 하지만, 합성데이터가 매우 우수해지면 그 문제가 없어질 것 같음. 또, 일리야 슈츠케버도 문제 없다고 했었고. SORA보면 openAI가 잘 하는 것 같기도 하고. 최근 특갤에 올라온 openAI 연구원 글에서도 데이터는 문제 없다 했었고. 일단 너무 뻔하게 스케일의 법칙 적용되는 트랜스포머 LLM 애들 있으니까. 일단 수천조 써서라도 AGI라도 달성해보면 될 듯.