걍 비용이 감당 안되서 그랬다는걸로 봤던것 같은데
근데 성능차이 없다는건 비용이 없어서 뭔가 방법을 찾은거 아님?? 지금 오픈소스 70B는 되야 저정도 나올텐데 - dc App
걍 원래 파라미터만 늘리는게 아니라 여러가지 노하우와 방법론이 적용되서 성능향상에 기여할수 있는거지만 핵심은 여전히 파라미터 개수라고 생각함. 한 국가의 국력을 결정하는게 땅과 영토만 있는건 아니지만 그게 가장 중요한것 처럼
땅과 영토가 아니라 인구와 영토
지미가 말한 100배의 컴퓨팅 효율이 이런건가?
그렇기에는 지금 이슈된건 생각보다 작은 모델이어서 이슈 - dc App
걍 최적화를 늦게 한 것 같음 최적화된 모델 기준 파라미터 높은 쪽 성능이 좋겠지
같은 방식으로 학습된 거라면
최적화와 스케일업의 무한 반복이지 뭐 - dc App
20b면 로컬에서도 돌릴정도아닌가?
아 m이 아니지 못돌리겠네
이제 quantization해서 압축하면 ㄱㄴ할거임 - dc App
그전부터 스케일이 전부는 아닌것같다는 뉘앙스로 인터뷰좀 했었지
20B면 로컬에서 돌릴 수 있는거잖아
아닐 거 같은데 진짜면 이제야 70B급 오픈소스 모델들이 3.5 근접 이러고 있었는데 open ai는 반년 전부터 20B로 그 이상의 성능을 냈던거네??? - dc App
Chatgpt 3.5니 1년전이고, 마이크로소프트 논문이라 논문 데이터 조작은 아닌거라봄. 그리고 데이터 조작이면 영구로 묻힐텐데 굳이.. - dc App
생각해보면 파인튜닝 gpt 해주던 거 파인튜닝 속도가 엄청 빨랐던가 - dc App
좀 다른 얘기임. Knowledge distillation하면 원래 작은 모델에서도 성능 잘나옴. 근데 이건 애초에 큰 모델이 있을 때 얘기이기도 하거니와 Scale law는 동일한 dataset으로 훈련해도 크기가 더 크면 성능이 잘 나온다는 얘기임.
과학과 공학의 차이
걍 비용이 감당 안되서 그랬다는걸로 봤던것 같은데
근데 성능차이 없다는건 비용이 없어서 뭔가 방법을 찾은거 아님?? 지금 오픈소스 70B는 되야 저정도 나올텐데 - dc App
걍 원래 파라미터만 늘리는게 아니라 여러가지 노하우와 방법론이 적용되서 성능향상에 기여할수 있는거지만 핵심은 여전히 파라미터 개수라고 생각함. 한 국가의 국력을 결정하는게 땅과 영토만 있는건 아니지만 그게 가장 중요한것 처럼
땅과 영토가 아니라 인구와 영토
지미가 말한 100배의 컴퓨팅 효율이 이런건가?
그렇기에는 지금 이슈된건 생각보다 작은 모델이어서 이슈 - dc App
걍 최적화를 늦게 한 것 같음 최적화된 모델 기준 파라미터 높은 쪽 성능이 좋겠지
같은 방식으로 학습된 거라면
최적화와 스케일업의 무한 반복이지 뭐 - dc App
20b면 로컬에서도 돌릴정도아닌가?
아 m이 아니지 못돌리겠네
이제 quantization해서 압축하면 ㄱㄴ할거임 - dc App
그전부터 스케일이 전부는 아닌것같다는 뉘앙스로 인터뷰좀 했었지
20B면 로컬에서 돌릴 수 있는거잖아
아닐 거 같은데 진짜면 이제야 70B급 오픈소스 모델들이 3.5 근접 이러고 있었는데 open ai는 반년 전부터 20B로 그 이상의 성능을 냈던거네??? - dc App
Chatgpt 3.5니 1년전이고, 마이크로소프트 논문이라 논문 데이터 조작은 아닌거라봄. 그리고 데이터 조작이면 영구로 묻힐텐데 굳이.. - dc App
생각해보면 파인튜닝 gpt 해주던 거 파인튜닝 속도가 엄청 빨랐던가 - dc App
좀 다른 얘기임. Knowledge distillation하면 원래 작은 모델에서도 성능 잘나옴. 근데 이건 애초에 큰 모델이 있을 때 얘기이기도 하거니와 Scale law는 동일한 dataset으로 훈련해도 크기가 더 크면 성능이 잘 나온다는 얘기임.
과학과 공학의 차이