이 글의 목적은 전문가가 보고 '어 그럴싸' 하게 만드는 거임
더불어 AGI까지 남은 단계가 없다는 결론이 도출되었으면 함
근거있는 반론, 전문가 지적 환영
[개념적인 생각]
신경망으로 어떤 일을 한다고 가정하자. 어떤 구조가 필요할까?
연속된 값을 입력받아 연속된 값을 출력하는게 아닌 이상 무조건 원 핫코딩이 필수적이라고 생각함.
숫자 인식도 구조가 겹치는게 많아서 그렇지 0-9까지 따로 신경망을 만드는 게 더 합리적이라 생각함. '이 그림은 1인가 신경망' 이렇게.
사람도 '0같기도 하고 6같기도 하네' 하잖아. 두 신경망 모두 참인거지
여기에서 생각을 조금 더 해보면 포레스트가 나옴
작은 기능들의 신경망이 쭉 있는거지.
이제 여기서 2차 기능을 만들어.
신경망의 출력을 입력으로 받는 신경망들임
예를 들어 그림에서 선을 인식하는 AI -> 선에서 숫자를 인식하는 AI 하면 학습도 빠르고 더 정확할 수 있겠지.
어떤 일을 하기 위한 신경망은 이런 기능의 조합으로 이루어진다는 전제하에 글을 이어갈게
[최근 연구 동향 적용]
주목할 점이 큰 ANN을 학습시키다보면 개념 뉴런이 생긴다는거임
예를 들어 숫자를 인식하는 ANN을 대규모로 만들면 그 안에서 선을 인식하는 녀석이 생긴다는게 요즘 연구 결과임
신경망을 희소화시키는 기술이 최신 메타잖아?
이걸 합치면 그냥 패스웨이임
패스웨이는 1차 기능 2차 기능 할 것 없이 한 번에 학습할 수 있다.
하지만, 개념의 구현과 패스웨이에서 두 개의 차이가 있는데
작은 차이는 개념 뉴런의 출력이 직방으로 2차 기능에 들어가지 않는다는거(무의미한 레이어가 생긴다.)
이건 마소가 신경망에 자주 하는 것 처럼 레이어 뛰어넘는 엣지 만들면 어느정도 해소가 되고 그렇지 않다 해도 학습 속도만 느릴 뿐임.(시간문제)
큰 차이는 기능간에 위상정렬이 가능하지 않을거라는거임
A->B->C->D 로 처리할 문제랑
E->C->B->F 로 처리할 문제가 있을 수 있다는거임
BERT(트랜스포머가 들어간 양방향 인코더)가 이런 문제를 어느정도 해소했다 생각하는데
이건 하드웨어가 발전하면서 신경망 통째로 고리모양으로 만들어버리면 간선 최적화도 되겠다 없어질 문제라 생각함.
[마무리]
최근 인공지능 뉴스들 보면서 생각에 확신이 생김.
결론은 현존하는 기술에 약간의 스케일업을 통해 신경망으로 할 수 있는 모든 일을 할 수 있다는 것.
- dc official App
우린 망했어. 이 경사면은 이미 너무 미끄러워 - dc App
님 전문가? 님 말 그럴싸해서 앞으로도 믿고 싶은데 메신저가 누군지 좀 알아야 ㅠㅠ
전문가 아님 ㅈㅅ - dc App
그런데 증명하듯 풀어나간거라서... 하나씩 따져봐봐 - dc App
트리바 시즌2
쩝 그래도 난 수용적이잖아 - dc App
이걸 유전 알고리즘 타령하고 똑같이 보네 ㅋㅋㅋㅋ
1.개념뉴런은 그냥 학습다다 생기는 1차,2차 기능 이런 것들 중 하나임 근데 좀 많이 깊은 기능인거지 .실제로 CLIP에서 발견되는 Spider-Man뉴런은 그냥 학습하다 나온것임. 2.1번 설명처럼 이야기 하면 희소화 즉 switch Transformer도 학습시키면 개념뉴런 이라는게 생성됨,근데 그게 패스웨이는 아닌잖음. 내생각에는 패스웨이는 +α가 들어갔음. 왜나하면 지금 파괴적 망각(Catastrophic Forgetting)이라는 문제가 해결이 안됨. 파괴적 망각은 간단하게 이야기해서 인공지능이 글을 쓰는 법을 배움 그다음으로 프로그래밍을 하는 법을 배움 그럼 인공지능은 더이상 글을 못쓰는게됨, 즉 그냥 글을 쓰는 법을 망각하게됨.
작아서 그런 게 아닐까 - dc App
정성스러운 댓글 고맙다 - dc App
아니 작아서 문제가 아님.실제로 그냥 GTP3 가지고 나와도 아마 똑같은 결과가 나올걸 즉 프로그래밍과 글쓰는 법을 동시에 학습시키지 않는 이상 한쪽부분으로 최적화됨.이건 그냥 현재 딥러닝 학습방법을 봤을때 당연한것임.근데 패스웨이를 보니까 여러 테스크에서 자동으로 알반화 되는것 보면 이것도 해결한것 같긴하지만 말이야
동시에 학습 시키는게 아니면 망각되는게 당연한거 아니야? 기억은 계속 동시에 학습시키기 위해 의미가 있다고 생각해 - dc App
정 안된다면 따로 떼어놓으면 되지 않을까 - dc App
일단 현 인공지능한테 기억이 없기 때문에 동시에 학습시키면 두 부분 모두에서 최적화된 결과는 하나에서만 최적화 된 결과보다 성능이 않좋을수 있음. 그리고 따로 뗴어 놓으면 그냥 따로따로 학습된 모델하고 무슨 차이임?
ㅇㅇ 맞음 규모가 커지고, 겹치는 부분이 있으면 스파이더맨 뉴런이 생기겠지만, 그렇지 않으면 오히려 성능이 안 좋겠지 그리고 따로 학습시킨다는 말 맞음. 글 위쪽에 있는 아이디어를 그대로 말 그대로 실행시킨다는 뜻이였음 - dc App
역시 규모의 문제라고 생각함. 개념을 더 작은 신경망에 밀어넣기 위해서는 더 많은 학습이 필요하고, 불가능한 경우도 있으니까. - dc App
내생각에는 결국 agi로 갈려면 a,b 작업을 학습한 후에 c작업을 빠르게 학습하고 a,b작업을 잊어버리지 않아야됨.
ㅇㅇ 동의함 - dc App
개인적으로 생각하는 AGI까지 다음 단계
https://m.dcinside.com/board/thesingularity/54403
- dc App