주의: 비전공자는 이해 못할 수도 있음
인간의 뉴런은 실무율을 따름.
즉 자극을 전달하거나, 하지 않거나만 있을뿐 신호에는 강도가 없음.
이거때문에 초창기 AI에서 sigmoid 함수흘 활성함수로 쓰려고 했던거임.
Sigmoid 함수가 실무율을 나타내는 함수와 유사한 면이 많거든.
근데 결국 ReLU를 쓰는게 많은 문제도 해결되고, 훨씬 좋다고 밝혀짐.
그 이유는 단순하다면 단순한데 AI는 universal approximator이기 때문임.
여기에서 미켈란젤로가 한 말을 다시 살펴볼 필요가 있음.
'나는 대리석 속에 갇힌 천사를 보았고, 그가 차가운 돌 속에서 풀려날 때까지 돌을 깎았다'
한 마디로 조각상은 깎지 않고 남아있는 부분이니 조각상의 원래 모습은 대리석 속에 이미 있었다는 미친 얘기임.
Ai도 마찬가지임. AGI, ASI라는 함수는 존재함.
다만 우리는 그걸 아직 찾아내지 못했을뿐임.
지금 대부분의 연구들은 한정적인 훈련 데이터만 가지고 어떻게 접근하면 그 ASI라는 함수를 근사할 수 있을지 찾아가는 과정이라고 보면 됨.
결국 ASI 함수는 구불구불 복잡하게 생겼을텐데 최종적으로는 이걸 AI를 가지고 질 표현해야하는거지.
그리고 AI의 표현력은 파라미터 개수에 따라서 올라간다.
생각해보면 너무 당연한 얘기인데, 복잡한 커브를 직선들로 나타낸다고 하먼 직선 다섯개보다는 직선 천개로 따라그리는게 더 정확한거랑 똑같음.
그래서 결국 AI 모델은 우리가 아직 알지못하는 ASI라는 함수를 interpolation한 근사 함수라고 볼 수 있음.
Interpolation에서 중요한건 정확도 차수임.
불연속 상수함수로 근사하면 0차 정확도라서 아주 많은 파라미터가 필요함.
연속 1차 함수로 근사하면 1차 정확도라서 0차보다 파라미터가 훨씬 덜 필요함.
(차수를 더 높일수록 필요 파라미터가 줄어들지만, 불안정성이 매우 크게 증가함)
다시 돌아가보자. 인간의 활성함수는 step function임. 0차 함수임.
ReLU는? 1차 함수임. 바꿔말하면 인간의 입력-출력을 interpolation하는데에 인간의 뉴런 및 시냅스 개수보다 훨씬 더 적의 수의 파라미터가 필요함.
https://m.dcinside.com/board/thesingularity/369731
여기 이글 너가 보기에는 맞는 말로 보임?
나 개인적으로는 일부 맞고 일부 틀리다고 봄. 더 적은 파라미터로도 동일한 성능을 낼 수 있는 방법이 있을거라고 생각함. 예를 들어 현실적으로 불가능하겠지만 지식 증류해보면 모델 다이어트가 불가능하지 않을걸로 생각함.
leaky ReLU는 요즘 어떠나
다 GeLU로 옮겨가는듯.
이 댓글은 게시물 작성자가 삭제하였습니다.
실수로 댓글 지움.. Q: 그럼 AI 압축은 더 적은 AI 파라미터로 AI를 근사하는거임? A: 그게 지식 증류법의 원리임. 큰 모델을 작은 모델로 근사하는거. 다만 현실적인 한계가 있어서 모든 경우에 적용할 수는 없는걸로 보임. 현실적인 한계라면 모델의 구조, 계산 비용 등이 될 것임.
해당 댓글은 삭제되었습니다.
ㅋㅋㅋㅋㅋ개웃 - dc App
ㅋㅋㅋㅋㅋㅋㅋ - dc App
ㅋㅋㅋ
ㅋㅋㅋㅋㅋㅋㅋㅋㅋㅋ
설명 개지린다 시발 지릴뻔했네
틀린 설명임
틀린 설명 아님
완전히 틀린 설명맞음
아님
미켈란젤로 명언에 빗댄 거는 소름돋네.
주장에는 몇 가지 문제점이 있습니다: 1. "인간의 뉴런은 실무율을 따름": 실제로 인간의 뉴런은 연속적인 신호도 전달할 수 있습니다. 즉, 강도가 있습니다. 2. "Sigmoid 함수가 실무율을 나타내는 함수와 유사한 면이 많거든": Sigmoid 함수가 초창기 AI에서 주로 사용된 것은 참이나, 이것이 실무율을 반영한 것은 아닙니다. 3. "AI는 universal approximator이기 때문임": 이 표현은 모호합니다. 일반적으로 'universal approximator'는 특정한 수학적 조건을 충족할 때 사용됩니다. 4. "AGI, ASI라는 함수는 존재함": 이는 증명되지 않은 주장입니다. 현재로서는 AGI나 ASI가 존재하는 함수로 확정짓기 어렵습니다. - dc App
5. "AI의 표현력은 파라미터 개수에 따라서 올라간다": 파라미터의 개수만으로 표현력을 측정하기는 어렵습니다. 모델의 구조, 학습 알고리즘 등도 중요합니다. 6. "인간의 활성함수는 step function임": 이것은 과학적으로 증명되지 않았으며, 인간의 뉴런은 다양한 활성화 패턴을 보입니다. 7. "ReLU는 1차 함수임": ReLU는 비선형 함수입니다. 0 미만에서는 0이고, 0 이상에서는 선형이지만, 전체적으로 보면 비선형입니다. 8. "차수를 더 높일수록 필요 파라미터가 줄어들지만, 불안정성이 매우 크게 증가함": 이 부분은 일반적으로 참이지만, 모든 경우에 적용되는 것은 아닙니다. - dc App
9. "Interpolation에서 중요한건 정확도 차수임": 이는 일반적인 관점이지만, 다른 요인들도 중요할 수 있습니다. 이러한 문제점들을 고려할 때, 주장이 다소 단순화되거나 잘못된 정보를 포함하고 있다고 할 수 있습니다. - dc App
히스테리시스는?