내 글은 딥러닝이 일반적인 코테 같은 알고리즘 이라는 뜻이 아니고 시간복잡도 다 있는 거 보면 알고리즘의 일종이었음 ㄷㄷ
나트륨찡(natriummi)2023-05-27 16:33
답글
시간복잡도 몰라? 빅O 표기법
익명(118.235)2023-05-27 16:36
답글
마저 Big O Notation
나트륨찡(natriummi)2023-05-27 16:38
답글
저게 bidirectional 연산을 n**2이라고 했나보네 근데 이미 단방향 연산 보다 양방향 연산이 결과과 좋을 수 밖에 없어서 연산 방식이 변화할 순 없을듯? 내가 말한대로 prunning이나 quatization 방법이 연산량 줄이는 가장 좋은 방법임. 언어만 봐도 나는 _ 와 나는 _는 사람이라는 문장에서 _에 들어갈 말이 단 방향일때 명확하지
익명(125.186)2023-05-27 17:06
답글
않는데 양방향일때는 훨씬 명확할 수 있음. 이거 자연어쪽 인공지능 배울때 나옴.
익명(125.186)2023-05-27 17:07
답글
밑에 Why Self-Attention 시간복잡도 설명 긴 거 읽어보면 k=n 일 때도 가정함 Even with k = n, however, the complexity of a separable
convolution is equal to the combination of a self-attention layer and a point-wise feed-forward layer,
the approach we take in our model.
나트륨찡(natriummi)2023-05-27 17:09
답글
O(knd+nd^2)인데 k가 n보다 작을 때는 연결성이 너무 약해서 k=n이라고 가정한다고 하네
나트륨찡(natriummi)2023-05-27 17:10
답글
그래서 O(n^2)이 나옴
나트륨찡(natriummi)2023-05-27 17:11
답글
이걸 단방향으로 최종적으로 선택한 모델이라구 함
나트륨찡(natriummi)2023-05-27 17:11
답글
O(n^2d+nd^2)
나트륨찡(natriummi)2023-05-27 17:32
답글
k가 n보다 작으면 입력과 출력의 대응이 안되어서 연결이 안되어서 입력 출력 똑같이 대응시키려면 k=n으로 놓아야된다네
일단 하드웨어도 바쳐줘야...
2020년이 하드웨어 기점이래 ㅇㅅㅇ
10^22 파라미터를 연산하려면 2020년 기점 ㅇㅅㅇ
바쳐->받쳐
속도는 큰 상관관계가 없지않나?
속도도 그렇지만 n^2이라 현재도 대량으로 프롬프트에 데이터를 한 맥락으로 연결되게 넣을 수가 없대
조각조각 내서 인식한대 밑에 글 참조
https://m.dcinside.com/board/programming/2488576
입력을 10000문장 이렇게 한 책을 챕터로 집어넣고 그 연관성을 긴밀하게 분석하는데 시간이 천문학적으로 걸림
프롬프트가 4000단어 밑이면 5분내로 그나마 돌릴 수 있는 정도
50000단어가 되면 하루가 걸림
뭥소리지 ㅋㅋ; 인공지능 속도 개선은 보통 알고리즘 형태로 이뤄지지ㅣ 않고 예를 들면 prunning이나 quantization같은 방법을 쓰는디..?
n**2 뭐 이런건 나 처음 들어보는데 ㅋㅋㅋㅋㅋㅋ
gpt 논문 읽다가 나왓는디
https://arxiv.org/abs/1706.03762
내 글은 딥러닝이 일반적인 코테 같은 알고리즘 이라는 뜻이 아니고 시간복잡도 다 있는 거 보면 알고리즘의 일종이었음 ㄷㄷ
시간복잡도 몰라? 빅O 표기법
마저 Big O Notation
저게 bidirectional 연산을 n**2이라고 했나보네 근데 이미 단방향 연산 보다 양방향 연산이 결과과 좋을 수 밖에 없어서 연산 방식이 변화할 순 없을듯? 내가 말한대로 prunning이나 quatization 방법이 연산량 줄이는 가장 좋은 방법임. 언어만 봐도 나는 _ 와 나는 _는 사람이라는 문장에서 _에 들어갈 말이 단 방향일때 명확하지
않는데 양방향일때는 훨씬 명확할 수 있음. 이거 자연어쪽 인공지능 배울때 나옴.
밑에 Why Self-Attention 시간복잡도 설명 긴 거 읽어보면 k=n 일 때도 가정함 Even with k = n, however, the complexity of a separable convolution is equal to the combination of a self-attention layer and a point-wise feed-forward layer, the approach we take in our model.
O(knd+nd^2)인데 k가 n보다 작을 때는 연결성이 너무 약해서 k=n이라고 가정한다고 하네
그래서 O(n^2)이 나옴
이걸 단방향으로 최종적으로 선택한 모델이라구 함
O(n^2d+nd^2)
k가 n보다 작으면 입력과 출력의 대응이 안되어서 연결이 안되어서 입력 출력 똑같이 대응시키려면 k=n으로 놓아야된다네
4 Why Self-Attention 다 여기에 적힌 내용 4번 항목
point-wise feed-forward(단방향) 레이어와 셀프 어텐션 레이어를 조합했다고 나옴
그게 최종적으로 구글이 선택한 모델이라고 the approach we take in our model. 이렇게 나옴
저 논문은 저자들이 구글이고 트랜스포머의 개념을 최초로 설명한 유명한 논문임
그리고 d는 차원인데 d는 어차피 모델 학습 후엔 달라지지 않기 때문에 상수 취급되어서 프롬프트에 따라 변화하는 량은 n이고 O(n^2)임 그래서 내가 GPT는 프롬프트량에 따라 n^2이라고 말한 거임
LLaMa도 학습된 모델 가중치는 차원이 이미 학습 전에 정해져서 d는 상수 취급임 그 가중치가 인터넷에 나도는 거고
ㅇㅇ 당연함 트랜스포머 같은것도 시간복잡도 꽤 높다
아 인공지능 무섭다ㅜㅜ