1. 딥러닝의 성공은 의심할 여지가 없다. 그것을 의심하거나 부정하는 사람은 딥러닝을 제대로 공부한 적이 없는 사람이다.
2. 문제는 딥러닝 전공자들의 상당수가 딥러닝의 작동원리를 제대로 이해하지 못하는데 있는데 이론과 실전사이의 갭이 아직 메꿔지지 않았기 때문에
어쩌면 당연한 결과이다.
3. 이론적 측면은 수학자나 통계학자들의 몫이 될 가능성이 크다. 가시적 결과 중심, 짧은 리뷰 기간의 한계를 가진 학회 중심의 머신러닝 커뮤니티에서는 이론적
갭을 메꾸기에는 한계가 클 것으로 생각이 된다.
4. 그럼에도 불구하고 딥러닝의 성공이 통계학을 하는 사람들에 주는 Impact 혹은 Implication은 상상 그 이상이다.
딥러닝을 제대로 공부하지 못한 사람(이 갤에서도 많이 언급되는 사람들) 수박 겉핡기로 논문을 읽거나 오픈 소스코드 몇 개 돌려보고 성급하게 편견을 가지고
판단할 그 이상의 결과물을 딥러닝 방법론들이 만들어 냈다.
5. 최근 통계학계의 딥러닝에 대한 태도는 이해와 활용이다.
전통적인 통계방법론적 시각에서는 Model Bias와 Model Variance가 상충관계였다.
그런데 최근 고차원 데이터 분석, 머신러닝 및 딥러닝과 관련된 연구가 진행됨에 이러한 틀 자체를 다르게 보기 시작했다.
예컨데, Training data 와 Testing data 모두에서 fitting이 잘 되는 것이 이론적으로 가능하다는 것이다.
이러한 내용이 궁금한 사람들은 Hastie et al. (2020) Surprises in High-Dimensional Ridgeless Least Squres 논문이나 Belkin(2021)의 Fit without fear: remarkable mathematical phenomena of deep learning through the prism of interpolation 같은 논문을 읽어보길 바란다.
6. 내가 이 글에서 하고 싶은 말은 딥러닝 방법론과 통계적 방법론이 대척점에 있는 것이 아니라는 것이다. 어떠한 접근 방법이 맞고 틀리고 판단을 해야 하는
문제가 아니라 서로가 서로에게 배워야 하는 보완관계라는 점이다.
소위 좆문가라는 사람들이 우리나라 연구수준과 현실에 대하여 걱정과 비난을 많이 하는데 통계학이든 딥러닝이든 뭐 하나 제대로 해본적 없고 성과를 내보지 못한 사람들의 의견에 귀 기울일 필요는 하나도 없다. 어쭙짢은 지식으로 대중을 호도하는 그러한 사람들이 진짜 사짜인 것이다.
개추
추천 - dc App
5번에서 말한 논문 읽어봤는데, Model Bias와 Model Variance 둘다 잡는게 1)엄청 많은 변수로 2) 보간/내삽되는 방식으로 가능한거면, 이건 그냥 케이스 분석이나 진배없지 않나 생각이 듦. 유의한 변수를 선택하는거나 도구변수 찾는걸 주로해서 되게 희한하게 느껴짐
얀르쿤의 논문 "Learning in High Dimension Always Amounts to Extrapolation" by Randall Balestriero, Jerome Pesenti, and Yann LeCun. 에 따르면, 1. given a function on d-dimensional vectors known solely by its value on N training samples, interpolation is defined as estimating the value of the function on a new sample inside the convex hull of the N vectors.
2. under mild assumptions, a new sample has a very low probability of being inside the convex hull of training samples, *unless* N grows exponentially with d. 3. In almost all modern ML problems, N and d are such that new samples have a vanishing probability of being in the convex hull of the training set. 4. This is true *even* when the samples are represented by low-dimensional embedding vecto
5. Hence almost all modern ML problems are in the *extrapolation* regime. 6. Qualitative claims such as "ML works OK for interpolation but doesn't work for extrapolation" are wrong.
최근에 좀 핫했던 논문이어서 요약본인데 도움이 되면 좋겠네요
감사합니다 그런데 요약 해준 내용에서 5번에서 6번으로 전개가 갑자기 되는 것 같아서요. 요약은 "ML이 extrapolation 해결 잘 할 수 있는가?" 에 대해서 "ㅇㅇ 잘할 수 있음" 이런 말뿐인것 같아서 비선형적으로 보간 반복한게 왜 extrapolation 해결 잘하는지 모르겠습니다 해당 논문에 비평/코멘트 한 의견 볼 수 있는데가 있나요?
레딧같은데 보는것도 방법일거같네요 - dc App
잠시 찾아 봤는데, n 개 샘플 데이터로 학습한 모델이
n 개 샘플 데이터 전체 공간/도메인의 데이터 생성 프로세스까지 근사할 수 있는지에 대해, 의문인 사람들이 있는 것 같습니다.
(
https://twitter.com/GaryMarcus/status/1411401507610796032
)
핫했던 논문이라는데, 이게 맞는지는 잘 모르곘네요. 사용된 데이터 외에 non-stationary 데이터 같은 것들에는 적용이 어려울 것 같아요.
정말 "ML works OK for extrapolation" 인지 궁금해요. 이거 되면 대박 아님니까? 근데 그럴리가...- 하는 생각이 들어서
혹시 논의되는데 따로 알거나 알게되면 따로 공유점 부탁드립니다
이런 글에서는 침묵하는 그들
저자 이름만 봐도 설레네