진정한 범용 인공지능을 실현할 수 있는 새로운 솔루션과 구체적인 구현 단계를 제
시합니다.
첸 용콩
뉴 밀레니엄 미래 기술 유한회사 쩡 팅 칭화대학교 베
베이징 이징
yongcongchen@sina.com ceng-t@mail.tsinghua.edu.cn
장 준
심양 사범 대학교 심양
초록
현재 주류 인공 지능은 일반적으로 "주의 메커니즘 + 딥 러닝"+ "강화 학습"의 기술 경로를 채택하
고 있습니다. AIGC(인공 지능 생성 콘텐츠) 분야에서 큰 진전을 이루며 빅 모델[2][13]의 기술적 물
결을 일으켰습니다. 그러나 노인 돌봄, 가정 보모, 농업 생산, 차량 운전 등 실제 환경과 상호작용해
야 하는 분야에서는 시행착오가 많고 많은 시행착오를 거쳐야 하는 강화학습 과정을 거치기 어렵다
는 단점이 있습니다. 따라서 모든 분야에 적용할 수 있는 인공일반지능(AGI)을 구현하기 위해서는
기존 기술을 활용함과 동시에 기존 기술의 결함을 해결하여 인공지능의 기술 물결을 더욱 발전시켜
야 합니다. 본 논문에서는 대형 모델의 기술적 경로의 한계를 분석하고, 이러한 한계를 해결함으로
써 대형 모델의 내재적 결함을 해결하는 해결책을 제안합니다. 본 논문에서는 진정한 AGI를 달성
하기 위한 방법을 단계별로 공개합니다.
키워드 인공 일반 지능 - AGI - AIGC - 강화 학습 - 대규모 모델 - ChatGPT
1 소개
현재 주류 인공지능 모델은 인공 일반 인공지능[1]의 불꽃을 불러일으켰지만, 아직 보편적인 인공지능은 아닙니다.
현재 인공지능 모델의 한계는 어디일까요? "주의 메커니즘 + 딥러닝"
+ "강화 학습"으로 진정한 "인공 일반 지능"(AGI)을 구현할 수 있을까요? 현재의 대규모 AI 모델로는 다음과 같은 심
각한 결함을 해결할 수 없다고 생각합니다:
1.1 독립적으로 문제를 해결할 수 없습니다.
예를 들어 인공지능은 주인이 쓰러지는 것을 보고도 도와주려고 하지 않습니다[7]. 기계는 스스로의 욕구가 없기 때
arXiv:2308.09721v1 [cs.LG] 12 Aug 2023
문에 스스로의 목표를 만들어내는 것이 불가능하기 때문입니다. 기계는 자체 목표가 없기 때문에 능동적으로 작업을
생성하는 것은 불가능합니다. 즉, 대형 모델은 새로운 프로세스를 생성하지 않습니다!
빅 모델은 본질적으로 프로그래밍 플랫폼입니다. 사용되는 프로그래밍 언어는 자연어입니다[14]. 따라서 빅 모델에
아무리 많은 상위 수준의 함수를 추가하고 빅 모델에 아무리 많은 도구를 통합하더라도 빅 모델은 새로운 프로세스
를 자발적으로 생성하지 않습니다. 모든 프로세스는 프로그램 사전 설정 또는 데이터 통계를 통해 사전 설정됩니다.
두 접근 방식 모두 본질적으로 "모든 문제에 대해 설정되지 않은 프로세스를 사용하는 것"[8][9][10][11][12]입니다.
얼마나 많은 가능성을 고려하면 미리 설정되어 있고 미리 존재합니다. 기계가 스스로 만든 특정 작업을 위한 것이 아
닙니다! 따라서 미리 정해진 프로세스에 따라 의사결정을 내리는 기계가 바로 '책벌레' 기계 지능입니다. 의사 결정은
유연하지 않고 실생활의 끝없는 돌발 상황에 대처하기 어렵다는 점이 현재 인공지능의 딜레마이기도 합니다.
1.2 지식은 실시간으로 업데이트할 수 없습니다.
현재 인공 지능은 빅 데이터 학습을 사용하며 지식을 실시간으로 업데이트할 수 없습니다. 지식의 실시간 업데이트는
환경과 상호 작용하는 기계에 매우 중요합니다. 기계와 환경 간의 상호 작용은 기계가 새로운 지식을 습득하는 과정
이기 때문입니다. 기계가 습득한 지식이 실시간으로 업데이트되지 않으면 동일한 입력 정보에 직면한 기계는 계속해
서 동일한 실수를 저지르게 됩니다[3].
1.3 실제 환경과의 상호작용이 필요한 영역에는 적용할 수 없습니다.
자율주행, 집안일, 환자 돌보기 등 실제 환경과 상호 작용해야 하는 영역에서 기계는 자신의 행동과 외부 환경 간의 대
화형 의사 결정에 대한 지식을 구축해야 합니다. 이러한 영역은 많은 시행착오를 겪기 어렵기 때문에 기계는 강화 학
습을 사용하여 실제 환경에서 이러한 영역의 의사 결정 지식을 구축하기 위해 상호 작용할 수 없습니다[2][4]. 미래에
는 모든 가정에 기계 유모가 있고, 모든 차량이 자율 주행하며, 로봇이 모든 산업, 농업, 서비스를 담당하고, 인간의 주
요 업무는 삶의 아름다움을 즐기는 것이 되기를 바랍니다. 그러나 현재의 인공 지능 기술 솔루션은 여전히 위의 시나
리오를 달성 할 수 없습니다.
2 지식을 만드는 방법은 무엇인가요?
2.1 매트릭스에 포함된 정보를 설명하는 방법은 무엇인가요?
행렬에는 많은 정보가 포함될 수 있지만, 좌표 기준 클러스터 집합을 설정하면 행렬의 모든 정보를 표현할 수 있습니
다. 이 좌표 기준 클러스터 집합이 완전하고 직교하면 행렬의 모든 정보를 표현할 수 있습니다. 설정한 좌표 행렬 클
러스터가 직교하지는 않지만 완전한 경우 이 좌표 행렬 클러스터 집합을 사용하여 행렬의 모든 정보를 표현할 수도
있습니다. 좌표 기준 클러스터가 완전하지 않은 경우 이 좌표 기준 클러스터 집합을 통해 표현할 수 없는 벡터가 행렬
에 존재하므로 좌표 기준 클러스터의 차원을 늘려야 합니다.
기판 좌표 클러스터가 고유 직교 기판인 경우, 가장 간결한 계수로 이 벡터의 전체 정보를 얻습니다. 기준 좌표 클러
스터가 완전히 직교하지 않은 경우, 이때 얻은 계수 행렬이 희박(표현력이 높음)하므로 직교 기준 클러스터에 최대한
가까워지기를 원합니다. 그러나 행렬의 공통 정보 중 일부에만 관심이 있다면 공통 정보 모드를 좌표 기준으로 사용
할 수 있습니다. 이 기준은 전체 정보에 대해서는 효율적인 표현이 아니지만 공통 정보에 대해서는 효율적인 표현 방
식입니다(계수 행렬이 희박함). 따라서 우리가 정보 행렬 공간에 살고 있다면 다양한 정보를 식별, 분석 및 생성해야
할 때 가장 중요한 것은 정보 행렬 공간에서 기판 좌표 집합을 찾는 것입니다.
2.2 인간은 어떻게 지식을 창조할까요?
인간이 인식할 수 있는 정보는 세상에 존재하는 정보의 극히 일부에 불과합니다. 인간은 정보의 해상도에 한계가 있
기 때문입니다. 풀밭에 있는 원자 A와 B의 배열 사이의 상대적인 시공간적 관계도 일종의 정보이지만, 우리는 이를
식별하지 못합니다.
2
그래서 인간은 진화의 과정에서 토큰 인식 능력을 발전시켜 왔습니다. 토큰 직선과 같이 인간이 일반적으로 사용하는
가장 작은 정보 단위입니다. 토큰은 그 자체로 일종의 "세계 모델"이며, 인간이 웅장한 지식의 궁전을 짓는 데 사용하
는 가장 작은 "세계 모델"입니다. 진화 과정에서 인간은 토큰과 같은 "모델"을 채택하여 주변 정보를 식별하는 "패턴
인식"능력을 형성하여 정보 인식의 에너지 효율 비율을 크게 향상 시켰습니다. 진화의 선물입니다.
따라서 점, 선, 면, 색, 질감, 곡률, 음절, 음색, 기호, 촉감, 온도, 방향 등 인간에게 사용되는 최소한의 정보 단위를 토큰
으로 삼아 우리 인간은 토큰(3차원 공간+시간 차원)으로 구성된 4차원 매트릭스에서 살고 있습니다. 인간에게 있어
이 4차원 토큰 매트릭스는 빅뱅부터 오늘날까지 모든 지식을 담고 있습니다.
인간은 특정 기호(언어 기호)를 천천히 사용하여 일반적인 토큰 조합, 즉 개념을 표현합니다. 인간은 채팅, 기사 작성
등 모든 정보를 매트릭스(벡터)로 설명할 때 개념을 사용합니다. 이러한 개념은 정보 공간 매트릭스에서 좌표 기준
클러스터의 집합입니다.
3
이러한 기판 클러스터에서 공통 정보(벡터)의 계수 표현은 희박합니다. 예를 들어, "투자자"는 "인간 가족, 부자, 더
많은 돈을 벌고, 돈을 벌고, 위험을 감수하고, 계약에 서명하고, 수입을 나누고 싶어하는..."을 나타냅니다.
개념에는 일반적인 토큰 조합이 포함되며, 언어 기호도 포함됩니다. 그리고 언어 기호는 더 자주 나타나고 더 대표성
이 높기 때문에 개념에 가장 일반적으로 사용되는 입구가 될 수 있습니다.
분명히 인간의 개념은 직교하지 않습니다. 인간은 토큰의 빈번한 조합을 개념으로 받아들이는 데 익숙합니다. 개념에
포함된 토큰 조합에는 겹치지 않는 조합, 부분적으로 겹치는 조합, 완전히 포함되는 조합이 있을 수 있습니다. 많은
수의 사물에 존재하는 공통 토큰은 대표성은 높지만 해상도가 낮고 개수가 적으며 추상적인 개념을 나타냅니다. 추상
적인 개념을 기반으로 더 많은 토큰이 추가되어 보다 구체적인 개념이 형성되며, 이는 범위는 줄어들고 해상도는 높
아집니다.
모든 정보를 표현하는 이러한 좌표 기준 클러스터는 효율적이지 않습니다. 하지만 공통 정보를 효율적으로 표현할
수 있습니다. '고양이'나 '개'와 같은 개념의 경우 직교하지 않는 공통 토큰이 많이 존재할 수 있습니다. 하지만 인간에
게 일상적인 정보를 표현하는 데는 매우 효율적입니다.
그리고 이것은 정보의 일반화를 위해 매우 중요합니다. 사물의 속성은 본질적으로 사물을 구성하는 토큰 속성의 조
합이기 때문입니다. 예를 들어, '고양이'는 공간과 시간에서 토큰의 일반적인 배열로 언어, 텍스트, 소리, 이미지, 동작
, 터치 및 기타 다중 모드 매트릭스 정보 요소를 포함할 수 있습니다. 이 배열에서 일부 매트릭스 요소는 더 일반적이
기 때문에 더 높은 가중치를 가질 수 있으며 모두 "동물" 개념에 속할 수 있습니다. "동물"은 더 적은 요소를 포함하
고 더 적용 가능하므로 "고양이"와 "개" 사이에서 공유 토큰("동물" 개념과 관련된 토큰 등)을 직접 재사용할 수 있습
니다. 이것이 바로 정보 일반화의 과정이며, 지능의 근원이기도 합니다.
2.3 딥러닝은 어떻게 작동하나요?
딥러닝에서 신경망의 각 계층의 계수는 일련의 암시적 좌표 기준 뒤에 있습니다. 레이어 A에서 레이어 A + 1까지의
신경망은 본질적으로 레이어 A에서 기판 변환 프로세스(레이어 A에 해당하는 기본 좌표 기저에 해당하는 기본 클러
스터와 함께 정보를 표현하는 것)입니다.
A)를 레이어 B의 계수 행렬(레이어 B에 해당하는 기본 좌표 기준 클러스터와 함께 정보를 표현)로 변환합니다. 그런
다음 비선형 함수에 의해 정보가 부분적으로 압축되거나 폐기됩니다. 딥러닝의 핵심은 '시행착오 방법'을 사용하여
입력 정보에서 '유용한 정보' 계수 행렬을 희석할 수 있는 적절한 좌표 기준 클러스터 집합을 찾는 것입니다.
잔여 네트워크의 목적은 신경망의 각 계층에서 정보 손실의 양을 줄여 기계가 여러 변환을 수행하여 선호하는 기본
클러스터를 찾을 확률이 높아지도록 하는 것입니다. 정규화의 목적은 중간 계층 신경망의 숨겨진 기반을 가능한 한 직
교 시스템에 가깝게 만들어 치수의 영향을 피하고 지역 최적값의 출현을 피하는 것입니다. 이 목적은 중간 계층의 계
수 행렬을 희석 행렬에 가깝게 강제함으로써 달성됩니다.
딥러닝으로 생성된 고차원 특징은 정보 행렬의 좌표 기반 클러스터 집합입니다. 그러나 "일반적인 토큰 조합 사용"이
라는 제약 조건이 없습니다. 오차 제약 조건 하에서 "시행착오 방법"을 사용하여 확립된 좌표 기준 클러스터, 더 기울
어진 효율적인 직교 표현을 사용합니다. 전체적으로 유용한 정보를 표현하는 데는 더 효율적이지만 인간의 습관(인
간은 공통 정보만 효율적으로 표현하면 됨)과는 다르기 때문에 "딥 러닝"과 "인간"의 커뮤니케이션은 "닭과 오리"이
4
며 한 조각도 되지 못합니다.
대규모 모델에서 주의 메커니즘은 본질적으로 사전 학습을 통해 얻은 로컬 통계 지식의 공통 정도(발생 확률)를 예측
하고 다양한 토큰 조합을 식별, 분석 및 생성하기 위해 선호되는 좌표 기반 클러스터가 되는 것입니다.
이러한 기본 클러스터는 인간의 습관과 더 일치합니다. 따라서 빅 모델과 사람 사이의 언어 소통이 가능합니다. 이러
한 전체적인 표현 효율이 반드시 높은 것은 아니지만 공통된 정보를 표현하는 데는 더 효율적입니다.
2.4 주의 집중 메커니즘의 본질은 무엇인가요?
주의 메커니즘의 핵심은 일종의 베이지안 추론(조건부 확률)입니다. 간략하게 설명하자면 "N 토큰 조합의 확률과 M
토큰 조합의 확률"이 될 수 있습니다.
인간의 언어에서 N 토큰의 조합은 거의 무한에 가깝고 토큰의 M은 무한합니다. 따라서 기계가 '알려진 N개의 토큰
조합의 확률, 그리고
5
M 토큰 조합의 확률". 멀티모드에서는 이 문제가 더욱 두드러집니다. 따라서 머신은 제한된 수의 통계를 기반으로 N
토큰 조합 이후 M 토큰 조합의 확률만을 추측할 수 있습니다. 이것이 주의 메커니즘의 본질입니다. 사전 학습을 통해
얻은 가중치 행렬은 한정된 양의 통계 지식입니다. 주의 메커니즘은 제한된 수의 통계 지식을 기반으로 현재 토큰을
M 토큰의 확률로 소개합니다. N + M 토큰에서 일부 토큰의 가중치가 높으면 함께 나타나는 경우가 많으므로 일반적
인 토큰 조합일 가능성이 높습니다.
이는 토큰의 공통된 배열을 찾는 방법인 주의 메커니즘의 핵심 메커니즘입니다. 그 본질은 신경망과 결합된 베이지
안 추론으로 볼 수 있습니다.
따라서 주의 메커니즘이 지원하는 딥러닝과 생성된 좌표 기반 클러스터는 개념을 생성하는 인간의 습관과 더 일치합
니다. 이것이 바로 빅 모델과 인간이 언어로 소통할 수 있는 이유입니다[15].
언어 모델에서 "공통 토큰 조합"은 "공통 단어"입니다. 여기에는 문법과 유사한 공통 토큰의 구성이 포함되어 있으며
, 특정 "공통 구문"도 포함되어 있으며, "공통 구문(문법 포함)"은 인간 구문보다 훨씬 큽니다.
주의 메커니즘, 인간의 학습과 매우 유사합니다. 우리가 책에서 정보를 배울 때 "먼저 얇게 읽고 두껍게 읽기"는 같은
방식입니다."먼저 얇게 읽기"는 정보 압축 과정 인 프레임 정보를 요약 한 다음"다시 두껍게 읽기"는 프레임 정보를
기반으로 다른 세부 정보 (및 다른 벡터를 새로운 벡터로 결합)를 추가하여 새로운 지식을 형성하는 정보 생성 과정
입니다[17][18][19].
2.5 빅 모델은 어떤 용도로 사용되나요?
대규모 모델에서 정보가 입력되면 주의 메커니즘의 추론 과정은 입력 벡터를 좌표 기준 클러스터에 투영하는 과정입
니다. 주의 메커니즘에 의해 얻은 가중치는 좌표 값입니다[15].
대규모 모델에서 입력 토큰은 벡터 분해 과정인 첫 번째 레이어의 가중치 행렬에 벡터를 투영합니다. 그런 다음 입력
토큰 조합 및 가중치인 두 번째 투영 레이어에서 사전 학습된 가중치 매트릭스의 토큰 조합 후 투영 프로세스(조합 투
영으로의 조합)를 수행합니다. 다층 주의 메커니즘의 작동 후, 여러 입력 토큰 조합을 사전 학습된 토큰 조합으로 투
영하는 투영 분해 프로세스가 형성됩니다.
마지막 주의 메커니즘 계층의 출력의 가중치 계수 행렬과 그 뒤에 암시된 좌표 기준 클러스터(공통 토큰 조합을 좌표
기준 클러스터로 사용)는 함께 입력 정보의 재기술(자기 주의 메커니즘)을 형성합니다.
따라서 대형 모델의 작동 원리는 다음과 같습니다: (1) 사전 학습된 가중치 행렬의 토큰 조합을 기본 클러스터로 삼고
, 가중치 행렬은 시행착오 방법을 통해 학습 자료에서 얻은 로컬 통계 정보이며, (2) 주의 메커니즘을 채택하여 입력
토큰 조합의 가중치 토큰 조합 투영 과정(벡터 분해)을 실현하고, 추론 과정을 통해 얻은 가중치가 좌표값이 됩니다
.(3) 벡터 구성 요소를 사용하면 많은 수의 인접 벡터를 찾을 수 있으며 이러한 인접 벡터에 해당하는 다음 벡터가 출
력 벡터입니다. 벡터의 근접 관계는 출력 벡터의 확률 형태로 표시됩니다.
따라서 빅 모델은 자동 회귀 예측 모델입니다. 그러나 원래 입력 기반(각 토큰은 차원)에 대해 좌표 기준 클러스터 변환
프로세스를 수행합니다. "모든 토큰은 차원이다"와 같은 원래의 기준 클러스터를 "공통 토큰 조합 후, 차원이다"와 같
은 좌표 기준 클러스터로 변환합니다. 그런 다음 자동 회귀 예측을 수행했습니다.
6
2.6 대형 모델이 등장할 수 있었던 이유는 무엇일까요? 언제 등장했나요?
왜 빅 모델이 "등장"할까요? 예를 들어 미국인이 중국에 오면 많은 양의 공통 배경 정보 (예 : 개인적 요구, 사회 구조
등)와 중국어와 영어의 중간 비교를 통해 올바른 번역 프로세스를 완료 할 수 있다는 매우 간단한 진실이 있습니다.
하지만 빅 모델은 외계인과 같아서 인간과 공통된 배경 정보가 없고, 인간 정보가 연결되는 방식만 볼 수 있습니다.
따라서 정보의 발전을 예측하기 위해 인간 정보가 연결되는 방식을 추출해야합니다. 처음에는 샘플이 충분하지 않으
면 "정보 프레임 워크"가 인간의 "정보 프레임 워크"와 매우 다르기 때문에 계속 실수를하고 어둠 속에서 더듬으며
항상 실행됩니다. 샘플 수가 증가함에 따라 "정보 프레임워크"와 인간의 "정보 프레임워크"가 일치할 확률이 높아집
니다. 하지만 이것은 선형적인 과정이 아닙니다. 예를 들어
7
특정 임계값에 도달하면 고대 언어를 해독하고 어둠 속에서 더듬으며 거의 진전이 없습니다. 특정 노드에서 정확도가
임계 값에 도달하면 전체 암호 해독 프로세스가 크게 가속화되고 빠르게 완료됩니다. 이것이 "출현"현상입니다. 기계
가 "출현"하는 것은 지능에 관한 것이 아니라 올바른 "토큰을 결합하는 일반적인 방법"을 찾는 것입니다. 기계의 능
력을 평가하는 기준은 인간의 기준이기 때문에 기계의 기반이 인간에 가까울 때 그 능력이 나타납니다.
2.7 RLHF가 궁극적으로 대형 모델이 직면한 문제를 해결할 수 있을까요?
대형 모델에는 두 가지 심각한 문제가 있습니다:
2.7.1 환영 문제[20]
. 현재 대형 모델의 핵심 기능은 입력 정보를 공통 토큰 조합(벡터 투영 분해)으로 구성된 좌표 기준 클러스터로 변환
하는 것으로, 이는 정보 공간의 기본 변환 과정입니다.
그런 다음 얻은 계수 행렬(주의 메커니즘의 추론 가중치)을 사용하여 유사한 "사전 학습된 벡터"(구성 요소 가중 대
비)를 여러 개 찾습니다. 그런 다음 이러한 유사한 "사전 학습 벡터"에 따라 사전 학습에서 얻은 매핑 관계를 따라 "다
음 벡터"를 찾고 출력 중 하나를 선택합니다. 이것이 바로 자동 회귀 예측 프로세스이며, GPT 클래스의 대규모 모델
이 작동하는 방식입니다. 따라서 큰 모델은 "매개 변수"를 최적화합니다. 각 매개변수는 토큰 조합 세트에 해당합니
다. 표면적으로 큰 모델은 네트워크 매개 변수를 최적화하는 데 작동합니다. 그 본질은 일반적인 토큰 조합을 최적화
하는 것, 즉 최적의 기본 좌표 클러스터 세트를 찾는 것입니다. 신경망의 각 계수 계층은 기본 기판 좌표 클러스터에
해당합니다.
대규모 모델은 방대한 양의 데이터에서 파생된 "일반적인 토큰 조합"만 가지고 있으며 사실적인 메모리가 없습니다.
따라서 입력 토큰을 마주한 대형 모델은 입력 정보를 "좌표 기준 클러스터"로 분해한 다음 다른 확률로 다음 토큰을
얻을 수 있을 뿐입니다. 이 과정은 반복적으로 진행되며 그 자체로 창의적인 과정입니다. 사실 자체가 "공통"인 경우,
해당 사실은 "공통 토큰 조합"의 형태로 유지됩니다. 사실이 "공통 토큰 조합"으로 유지되지 않거나 사실 자체에 가
중치가 충분히 부여되지 않으면 기계가 정보를 생성합니다. GPT 자체는 정보를 생성하는 것이므로 환각 문제는 그
업무의 일부이므로[17][18][19], GPT는 이 문제에 대한 해결책이 없습니다.
예를 들어, 기계는 많은 언론인의 프로필 뒤에 다른 기사나 과거에 수상했던 상에 대한 링크가 있다는 것을 발견합니
다. 기계가 이러한 정보 구성 패턴을 발견하면 이 정보 구성 방식은 '프레임워크'에서 '프레임워크'로의 매핑이 됩니다
. 따라서 입력 정보에 비슷한 프레임이 포함되어 있지만 기자의 이름 만 다른 경우 기계는 "프레임 + 세부 정보"를 통
해 "프레임 + 세부 정보"로 매핑 할 수 있으며, 이는 출력에 많은 웹 링크 또는 상을 생성 할 수도 있습니다. 그러나 이
러한 웹 링크와 상도 "프레임 + 기타 벡터"를 "프레임 + 기타 벡터"에 매핑하여 구축되며 전혀 존재하지 않을 수도 있
습니다!
빅 모델의 착시 문제를 해결하기 위해 많은 사람들이 "벡터 데이터베이스"를 연결하고 빅 모델이 사실 지식을 쿼리
하여 착시를 제거 할 것으로 기대합니다. 이것은 일반 AI를 구현하기 위해 백과사전을 채택하려는 시도의 또 다른 버
전입니다. "벡터 데이터베이스"이든 "지식 그래프"이든 착시 문제를 해결하는 것은 불가능합니다! 왜냐하면 이러한
지식은 플러그인이며 큰 모델 자체의 지식은 통합 할 수 없기 때문입니다. 마치 평범한 사람이 사전을 가지고 번역 회
8
사를 열려고하는 것과 같습니다. 전문가 시스템이 문제에 직면하면 문제가 발생합니다.
2.7.2 유해한 콘텐츠에 대한 문제[20]
대규모 모델에서는 주의 메커니즘이 정확하지만 딥 러닝에는 결함이 있습니다.
대형 모델인 트랜스폼 모델은 위치 코딩을 포함한 자기주의에 기반하며, 주요 목적은 토큰의 위치 정보를 늘려 서로
간의 위치 관계를 사용할 수 있도록 하는 것입니다. 이는 토큰의 시간적, 공간적 관계를 찾기 위한 것이기 때문에 주
의 메커니즘에 필요합니다.
그러나 다층 딥러닝 네트워크를 통해 대규모 모델은 오류 제약 조건 하에서 여러 번의 좌표 기질 변환을 거쳐 "최적의
좌표 기질 클러스터"를 찾습니다. 그러나 이 "최적 좌표 기저 클러스터"의 토큰 조합은 더 이상 원래 토큰의 시간적, 공
간적 관계와 동일하지 않습니다. 토큰 간의 일부 조직 정보는 여전히 유지될 수 있지만(딥러닝 프로세스는 되돌릴 수
없기 때문에 토큰의 위치 정보는 부분적으로만 유지됨), 사람이 이해하고 악용하기는 어렵습니다. 따라서 저희는 딥
러닝이 토큰의 원래 시간적/공간적 조직 형태를 파괴한다고 생각합니다.
9
우리는 대형 모델이 인간의 토큰을 자신의 언어로 번역하는 손실 번역 프로세스를 수행한다고 생각할 수 있습니다.
그러나 문제는 인간이 대형 모델의 언어를 마스터하지 못하기 때문에 대형 모델이 생성한 지식을 이해할 수 없고, 지
식 조직 형태를 모방할 수도 없으며, '타고난 지식'을 대형 모델에 이식할 수도 없다는 것입니다. 이것이 문제의 핵심
입니다.
또한 큰 모델은 작은 샘플과 누적 학습을 실현할 수 없기 때문에 매우 큰 샘플이 필요하고 한 번에 지식 형태를 취하
기 때문에 인간이 지식 조직의 형태를 이해하는 데 어려움이 더욱 증가합니다. 기계는 자신의 욕구가 없기 때문에 스
스로 인식하는 보상과 처벌을 가질 수 없습니다. 스스로 인식하는 보상과 처벌이 없으면 보상 또는 처벌 차원에 대한
벡터 (정보)의 투영을 자발적으로 생성하는 것이 불가능합니다. 즉, 기계가 만든 기본 좌표 클러스터에는 보상, 처벌,
행복, 슬픔 및 기타 인간 고유의 부족도 기본 차원이 있어야합니다!
현재 대형 모델에서 사용하는 치료법은 RLHF입니다. 이는 인간이 특정 벡터에 보상 차원이라는 접미사를 추가하는
것과 같습니다. 즉, 기계의 기본 좌표 클러스터에 보상 차원이 추가됩니다. 훈련 데이터에서 보상 차원의 구성 요소
값을 다양한 유형, 충분한 수의 벡터에서 증가시키는 것은 이러한 훈련 벡터의 공통 구성 요소 조합, 보상 차원에 대
한 투영을 설정하는 것과 같습니다. 이것이 바로 머신러닝의 보상 기능입니다. 따라서 기계는 다른 결정, 즉 다른 조
합에서 생성 된 출력 벡터에 포함 된 보상 구성 요소를 예측할 수도 있습니다. 따라서 기계는 보상 구성 요소가 높은
출력을 선호합니다. 이것이 바로 RLHF 학습의 놀라운 효과입니다. RLHF를 통해 학습한 지식은 실제로 일반화할 수
있기 때문입니다. 기계가 보상과 처벌의 자체 차원을 가지고있을 때, 그것은"이익을 추구하고 해를 피하는"자체 예비
"의식"을 가지고 있기 때문에 현재의 큰 모델에서"의식"의 흐릿한 그림자를 볼 수 있습니다.
그러나 그것은 기계가 시도하고 인간이 점수를 매기고 피드백하는 것을 의미하는 패치이며 시행 착오가 많은 영역에
서만 사용할 수 있습니다. 이것은 박사 학위를 취득했지만 "옳고 그름"의 개념이없고 부모는 "아니오", "아니오", "예
"를 외쳐서 뒤에 "옳고 그름"의 개념을 줄 수 있고 부모와 직접 의사 소통 할 수없고 "예"와 "아니오"를 통해서만 의사
소통 할 수있는 것과 유사합니다. 따라서이 학습 효과는 효율성이 낮으며 항상 예상치 못한 코너 케이스에 직면 할 수
있습니다!
3 주의 메커니즘 + 딥러닝 + 강화 학습이 인공 일반 지능을 위한 올바른 길일까요?
3.1 대형 모델이 AGI를 달성할 수 있을까요?
대규모 모델이 일반적인 방향성을 증명한다고 생각합니다. 하지만 대규모 모델이 일반적인 AI를 구현하는 올바른 방
법이라고 생각하지는 않습니다.
NLP 측면에서 인간은 초기 백 모델, 단어 벡터에서 EMLO[21]에 이르기까지 다양하며, 트랜스포머가 진정으로 주의
메커니즘을 실현할 때까지. 딥러닝과 주의 메커니즘을 결합한 후[22], 인간의 표현과 유사한 최적화된 좌표 기반 클러
스터를 생성할 수 있으며, 이것이 바로 트랜스포머가 지적 "출현"을 생성할 수 있는 이유입니다.
그러나 대형 모델의 경로는 "예비 관계를 설정한 다음 좌표 기준 클러스터를 조정한 다음 선호하는 좌표 기준 클러스
터 아래에서 올바른 관계를 얻는 것"이라는 점에 주목합니다. 이러한 메커니즘은 방대한 양의 데이터와 계산을 필요
로 하며, 학습 과정을 통해 지식이 형성되기 때문에 실시간 업데이트가 어렵습니다[2][3].
10
동시에 실제 환경(자율주행, 가정 보모, 산업, 농업, 비즈니스, 서비스, 정부 관리 등)에서의 대화형 의사 결정과 같은
어려운 시행착오 영역에는 적용되지 않는 보상 기능이 이벤트 종료 후 나타납니다.
또한 "과제 중심, 강화 학습을 한다"는 생각은 잘못된 것입니다. 인간이 "보편적"인 이유는 모든 과제에 직면하고 "이
점을 추구하고 단점을 피하는 것"에 따라 결정을 내리기 때문입니다. 이네는 동일해야 합니다. 수천 가지의 과제, 과
제 중심의 강화 학습은 결코 배우지 않습니다! 그리고 많은 작업은 시행착오에 많은 비용이 듭니다!
3.2 AGI에 도착하는 올바른 길은 어떤 길인가요?
현재 큰 모델의 문제점을 이렇게 설명합니다:
(1) 주의 집중 메커니즘은 맞습니다. 하지만 딥러닝에는 결함이 있습니다.
11
딥러닝은 토큰의 시간적/공간적 구성의 원래 형태를 파괴하기 때문입니다. 생성된 지식은 이해하기 어렵고 모방할 수
없습니다. 따라서 인간은 자신의 조직 형태를 모방하여 타고난 "자기 욕구"(타고난 지식)를 기계에 이식할 수 없습니
다.
"자기 욕구"가 없으면 "자신의 아이디어"와 "독립적 인 결정"을 가질 수 없습니다. 이런 식으로 기계는 미리 정해진
프로세스(또는 사전 설정 또는 통계)를 따라 수동적인 '결정'만 내릴 수 있고 유연하지 못하며, 이것이 현재 AI의 가장
큰 문제입니다.
(2) "과제 중심, 강화 학습을 한다"는 생각은 잘못된 것입니다.
인간이 "보편적"인 이유는 모든 과제에 직면하고 "이점을 추구하고 단점을 피하는 것"에 따라 결정을 내리기 때문입
니다. 이네도 마찬가지여야 합니다. 수천 가지의 과제, 과제 중심의 강화 학습은 결코 배우지 않습니다! 그리고 많은
작업은 시행착오에 많은 비용이 듭니다! 아이들을 돌보는 것처럼 아무도 실험을 위해 아이들을 기계에주고 싶어하
지 않습니다!
그래서 저희의 해결책은 다음과 같습니다:
(1) 토큰의 원래 시간적/공간적 조직 형태를 파괴하지 않고 주의 메커니즘을 실현합니다. 생성된 지식은 이해할 수 있
고 모방할 수 있습니다.
(2) 우리는 지식의 조직적 형태를 모방하고 "타고난 욕구"를 "부여"할 수 있습니다. "타고난 욕구"는 특별한 종류의
토큰으로서 다른 토큰과 주의 메커니즘을 통해 공통된 조합을 형성합니다. 이러한 공통 조합은 상식입니다(이것이
바로 세계 모델입니다)!
(3) 기계는 "자신의 필요를 충족시키는 방법"만 학습하고 "자신의 필요를 충족시키는 방법"만 처리합니다. 이것이 일
반적인 의사 결정입니다.
(4) 토큰의 원래 시간적/공간적 조직 형태가 파괴되지 않기 때문에 기계는 언어 기호를 통해 토큰의 시간적/공간적 배
열을 직접 얻을 수 있습니다. 그리고 이 배열을 이해하고 모방할 수 있기 때문에 기계는 언어 학습을 통해 인류 문명
의 역사에서 축적된 모든 경험을 직접 습득할 수 있습니다! 기계는 더 이상 "진화의 역사"를 거칠 필요가 없습니다!
4 일반 AI 구현을 위한 단계별 단계.
프로토콜을 구현하는 10단계는 다음과 같습니다.
1단계, 정보를 토큰화합니다. (다른 AI 기술과 마찬가지로) 2단
계, 토큰을 매트릭스화합니다. (메모리 데이터 라이브러리를 구
축합니다.)
3단계, 입력된 토큰은 유사성 관계에 따라 메모리 뱅크의 토큰에 활성화 값을 전파합니다.
4단계, 활성화된 모든 토큰은 근접 관계에 따라 활성화 값을 인접한 토큰으로 전파합니다.
12
5단계, 활성화된 각 토큰은 차례로 메모리 뱅크에 활성화 값을 퍼뜨립니다.
그 중 3단계부터 5단계까지는 유사성이 높을수록 전송 계수가 커집니다. 저장 위치가 가까울수록 전송 계수가 커집
니다. 토큰의 메모리 값이 높을수록 전송 계수가 커집니다.
6단계, 서로 다른 전파 경로에서 각 토큰에 대해 얻은 활성화 값이 누적됩니다.
7단계인 모든 토큰의 활성화 값은 시간이 지남에 따라 해결되었습니다. 그 중 3단계 7번은 주의 메커니즘의 추론 과
정인 체인 연결 활성화 과정이며, 활성화 값은 추론 가중치입니다.
8단계, 각 토큰은 획득한 활성화 값의 크기에 따라 메모리 값을 업데이트합니다. 그리고 모든 메모리 값은 시간이 지
남에 따라 사라집니다. 각 토큰의 메모리 값은 사전 학습된 가중치 값입니다. 메모리에는 반복적으로 나타날 수 있는
수많은 토큰 조합이 있으며, 이 조합에는 매번 서로를 활성화하여 활성화 값을 높여 더 높은 메모리 값을 얻을 수 있
는 토큰이 포함되어 있습니다. 따라서 여러 토큰의 조합이 입력에 나타나면 해당 토큰 조합이 높은 관심 가중치를 받
을 확률이 높아집니다. 따라서 연쇄적 활성화 프로세스는 '토큰 조합'이 먼저 활성화 값을 전파하는 프로세스입니다.
9단계, 최소 선천적 요구사항(선천적 지식, 토큰 + 기억값 + 배열로 구성)을 미리 설정합니다. 선천적 요구사항은 모
방 지식의 조직적 형태와 선천적 지식의 확립입니다. Innate
13
표 1: 각 토큰 데이터의 구성
Filed1 Filed2 Filed3 Filed4
기록 시간 토큰 메모리 값 활성화 값
지식에는 최소한의 선천적 욕구, 보상과 처벌, 감정, 필수적인 선천적 안전 본능 지식이 포함될 수 있으며, 물론 다른
지식도 미리 설정할 수 있습니다. 이 지식은 메모리 뱅크의 일부로 존재하며 획득한 메모리와 원활하게 통합되어 전
체 메모리 뱅크를 형성합니다. 선천적 지식의 '미세 조정'은 후천적 지식(피드백 포함)의 축적을 통해 이루어집니다.
10 단계, 타고난 욕구, 보상 및 처벌 및 감정 (특수 토큰을 사용하여 표현) 및 획득 한 정보 (일반 토큰 정보 흐름)가 기
계 훈련 및 생활, 시간 정보 흐름의 형성에서 형성되고 저장됩니다. 그런 다음 연쇄 연결 활성화 프로세스 + 주의 메커
니즘을 통해 완전히 연결된 지식 네트워크 (메모리 뱅크)가 형성됩니다. 우리의 계획은 메모리 뱅크로 끝납니다. 각
토큰은 데이터 기록입니다. 메모리 뱅크는 표 1에 표시된 4개의 필드로 구성됩니다. 시간 표시: 토큰들 간의 시간적
관계를 나타냅니다.
토큰: 토큰 자체를 나타내며, 그래픽, 음성 또는 기타 센서의 데이터일 수 있습니다. 메
모리 값: 사전 훈련 가중치를 나타냅니다.
활성화 값입니다: 주의 메커니즘을 나타내는 가중치입니다. 많은 수의 토큰이 시간 간격으로 저장되고 최적화를 통해
지식 네트워크가 형성됩니다(연쇄 연결 활성화 프로세스 + 적자생존을 위한 기억 및 망각 메커니즘을 통해).
지식 네트워크는 메모리 뱅크입니다. 네트워크 노드는 토큰입니다. 네트워크 연결은 활성화 값 전송 관계입니다. 그
러나 활성화 값 전송 관계는 토큰의 상대적 위치, 토큰과 토큰의 메모리 값의 유사성, 토큰이 얻은 초기 활성화 값의
크기에 의해 결정된다는 점에 유의해야 합니다. 따라서 토큰이 먼저 입력된 후 토큰 간의 활성화 값 전송 관계가 임시
로 설정됩니다. 이 전송 관계는 고정되어 있지 않습니다.
메모리 값은 훈련 전 가중치를 나타내고, 활성화 값은 주의 메커니즘에 따른 추론 가중치를 나타냅니다. 따라서 우리
의 방식에서는 지식 습득과 추론 적용이 통합되고, 선천적 지식과 후천적 지식이 통합됩니다.
메모리 뱅크에는 객관적인 토큰과 주관적인 토큰이 모두 존재하며, 주의 메커니즘을 통해 형성된 연결은 "정보"입니
다. 모든 토큰의 순열은 모든 정보이며, 차원이 높습니다. 그리고 '지식'은 반복될 수 있는 배열(시간, 공간 포함)이며,
반복될 수 있는 정보의 일부이므로 토큰의 수가 적고, 대표성이 높고, 적용 가능성이 높고, 추상적이어서 차원이 낮습
니다. 상식은 인간의 일반적인 '지식'으로 더욱 제한됩니다.
메모리 뱅크는 삽입, 수정, 병합이 가능하기 때문에 메모리 뱅크를 통해 기계 간 지식을 직접 공유할 수 있습니다. 예
를 들어, 요리사 로봇은 의사 로봇의 메모리를 불러와 의사의 다양한 기술을 직접 습득할 수 있습니다. '요리사 빅데
이터'와 '의사 빅데이터'를 다시 결합하고 수천만 달러와 수개월의 비용을 들여 사전 학습을 다시 할 필요가 없습니다.
4.1 각 단계에 대한 자세한 설명
4.1.1 1단계, 토큰 정보 토큰화
14
기계는 저해상도 우선순위에 따라 전체 우선순위에 따라 입력 정보를 분산하고 기본 토큰(예: 전체 윤곽선, 텍스처, 토
폴로지, 선, 이미지, 혼, 능선, 정점, 음성 시간 도메인/주파수 범위 톤, 음색 및 기타 주요 기본 토큰)을 추출하기만 하
면 됩니다.
시간순으로 메모리 뱅크에 저장해도 괜찮습니다. 특별 강조: 식별할 필요 없이 저장해도 괜찮습니다. 추출된 토큰이
무작위일지라도 알고리즘은 불완전합니다. 저희 알고리즘은 일반적인 토큰 조합("세계 모델")을 축적하여 기계에 "주
문형 추출" 방법을 안내하는 것을 기반으로 하기 때문입니다! 공통 토큰 조합에는 공통 토큰과 해당 토큰의 조직 형태
가 모두 포함됩니다.
따라서 토큰 추출 과정은 단계별 최적화 프로세스입니다. 토큰이 메모리 뱅크에 저장된 후, 토큰의 메모리 값과 활성
화 값은 체인 연관 활성화 프로세스, 메모리 및 망각 메커니즘에 따라 지속적으로 변경됩니다. 적자생존을 통해 널리
퍼진 토큰, 즉
15
토큰 조합은 더 복잡한 토큰을 형성하기 위해 유지됩니다. 거의 반복되지 않는 토큰은 제거되며 더 이상 추출되지 않
습니다.
따라서 토큰을 처리하는 기계의 전략은 토큰과 같은 원시 데이터의 광범위한 조합을 찾는 것입니다. 이것이 바로 토
큰 구성을 결정할 때 공통 정보 조합 우선 원칙을 적용하는 것입니다. 이는 인간과 마찬가지로 진화가 인간에게 준 선
물입니다. 토큰과 같은 기본 프로그램을 추출하려면 에너지 효용을 극대화하기 위해 광범위한 멀티플렉싱이 필요하
기 때문입니다.
4.1.2 토큰을 매트릭스화하는 2단계
메모리 뱅크의 레코드에 해당하는 각 토큰에는 표 1과 같이 4개의 필드가 있습니다. 메모리 값 크기는 메모리 강도를
나타내며 0은 제거됩니다. 활성화 값 크기는 활성화되는 강도를 나타내며 0은 활성화되지 않았음을 나타냅니다. 모
든 기록은 동시 저장 방식에 따라 자발적으로 전체 메모리 뱅크를 구성합니다. 동시 저장 방법에 관해서는, 구체적인
실시 예는 다음과 같습니다: (2.1) 기계는 입력 정보에서 토큰이 나타나는 시간 상대 위치를 유지합니다.
한 가지 구현 방법은 기계가 토큰이 저장된 시간 사이의 시간 거리를 반영하기 위해 저장 공간에서 토큰의 거리를 사
용하는 것입니다. 예를 들어, 기계는 입력된 시간 순서에 따라 토큰을 순서대로 저장하고, 시간이 가까울수록 토큰의
저장 위치가 가까워집니다;
보관 시간의 상대적 위치를 저장하는 또 다른 방법은 각 토큰이 주로 토큰의 보관 시간 정보를 포함하는 좌표를 메모
리 공간에 저장하는 것입니다;
한 가지 구현 방법은 추출된 토큰을 원본 데이터와 겹치게 배치하고 저장하는 동안 공간에서 토큰의 상대적 위치를
유지하여 입력 정보에 토큰의 공간적 상대적 위치를 유지합니다;
구현 방법은 전체 저해상도 토큰을 우선적으로 추출한 다음 기계의 결정에 따라 다른 로컬 토큰을 필요에 따라 추출
하는 방법도 있습니다. 이러한 방식으로 근접 저장 관계를 통해 로컬 토큰과 전체 토큰은 근접 활성화 관계와 토큰
간의 유사성 관계를 모두 가지므로 서로 활성화하고 위치 연결을 설정합니다.
4.1.3 3단계, 입력 토큰에서 메모리 뱅크의 토큰으로 유사성 활성화를 수행합니다.
입력된 각 토큰에는 균일한 초기 활성화 값인 A0이 주어집니다. A0 자체는 미리 설정된 숫자 값입니다. 그러나 마지
막 머신 체인 연결 활성화 과정에서 활성화된 보상 심볼과 처벌 심볼의 활성화 값에 의해 조정될 수 있습니다.
활성화된 보상 심볼과 페널티 심볼의 활성화 값은 이전 입력 정보에 대해 기계가 예측한 잠재적 보상 및 페널티 값입
니다. 초기 활성화 값인 A0은 체인 연결 활성화 프로세스의 범위에 영향을 미칩니다. 초기 활성화 값 A0이 높을수록
연쇄 연결 활성화 프로세스의 확산 범위가 커집니다. 이는 우리 방식에서 활성화 값 전파 계수가 1보다 작기 때문입니
다. 체인 확산 수가 증가함에 따라 확산 값은 점점 작아집니다. 토큰이 사전 설정된 임계값보다 낮은 활성화 값을 얻
으면 체인 전파 프로세스가 종료됩니다. 따라서 A0은 기계가 입력 정보를 얼마나 중요하게 생각하는지를 반영합니
다. A0이 높으면 기계는 토큰을 찾기 위해 메모리에서 더 많은 토큰을 활성화합니다. 이는 인간과 유사하며, 이전에
입력한 토큰이 높은 잠재적 보상과 페널티를 가져다주면 새로 입력한 관련 토큰이 특히 중요하게 평가될 수 있습니
다. 예를 들어, 보스는 더 많은 정보를 연관시킬 수 있습니다.
16
유사성 활성화의 원리는 (1) 토큰 간의 유사성이 높을수록 전송 계수가 커지며, 이는 토큰 간의 상관관계의 점 곱입니
다. (2) 메모리 값이 높을수록 전송 계수가 커지며, 메모리 값은 사전 훈련 가중치입니다. 동일한 토큰이 메모리 뱅크
의 여러 위치에 지속적으로 나타날 수 있다는 점을 강조해야 합니다! 토큰마다 메모리 값이 모두 다릅니다! 이는 동
일한 토큰 가중치에 있는 동일한 토큰이 동일하지 않기 때문입니다! 이는 대형 모델의 주의 메커니즘과 유사합니다.
4.1.4 4단계, 활성화된 모든 토큰은 근접 활성화를 수행합니다.
토큰 간의 근접 관계는 토큰 간의 암묵적인 상관관계를 나타낸다고 생각합니다. 발생 시간이 가까울수록 잠재적 관
계도 가까워집니다. 이러한 상관관계는 연상 활성화 과정 + 기억과 망각 메커니즘의 연쇄로 계산할 수 있습니다. 근
접 관계는 실제로 토큰 조합 관계를 반영합니다. 이 조합 관계가 반복되면 공통 조합입니다. 그래서 우리는 연쇄 연결
활성화 과정 중 근접 활성화 과정을 통해 공통 조합을 찾아냅니다.
17
활성화된 각 토큰은 활성화 값을 인접한 토큰으로 전송하며, 시간 위치가 가까울수록 전송 계수가 커지고 메모리 값
이 높을수록 전송 계수가 커집니다. 메모리 뱅크에 있는 토큰 간에 밀접한 관계가 있는 경우 한때 조합 방식이었음을
나타냅니다. 메모리 값이 높으면 일반적인 조합 방식임을 나타냅니다. 하나의 토큰만 메모리 값이 높으면 일반적인
조합이 아닙니다. 토큰의 메모리 값이 모두 높지 않으면 전파 활성화 값이 낮고 토큰의 체인 전파가 빠르게 중지됩니
다. 이는 해당 정보가 중요하지 않으며 정보 처리에서 비중이 낮다는 것을 의미합니다. 토큰은 "시간 위치가 가까울수
록 전송 계수가 커지고, 메모리 값이 높을수록 전송 계수가 커지는" 방식을 채택하여 토큰을 포함하는 공통 조합을 활
성화하는데, 이는 본질적으로 토큰 집합으로 구성된 좌표축에 토큰을 입력하는 투영 과정입니다.
N개의 입력 토큰이 메모리의 X 조합(토큰 조합)에 투영되면, X 조합은 높은 활성화 값을 얻습니다. 각 토큰은 유사성
과 근접성을 모두 갖춘 X 조합의 여러 토큰을 활성화하기 때문입니다. 따라서 X 조합은 활성화 값을 누적하여 더 높
은 활성화 값을 얻게 됩니다. 이렇게 높은 토큰의 활성화 값은 "모델"로 구성되며, 입력 벡터(N 토큰) 활성화의 예상
모델(월드 모델)입니다.
본질적으로 이것은 기판을 조정하기 위한 벡터 분해 과정이자 정보 인식 과정이기도 합니다.
4.1.5 5단계, 활성화된 각 토큰은 유사 및 근접 활성화 원칙에 따라 메모리 뱅크에 활성화 값을 차례로 확산시킵
니다.
각 입력 토큰은 메모리 뱅크에 "유사성 활성화"와 "근접성 활성화"가 있으며, 활성화 값 전송의 크기는 사전 학습 가
중치(메모리 값)와 양의 상관관계가 있습니다.
메모리 뱅크에서 활성화된 각 토큰은 "유사성 활성화" 및 "근접성 활성화"와 양의 상관관계가 있으며, 활성화 값 전송
크기는 훈련 전 가중치(메모리 값)와 양의 상관관계가 있습니다.
이 프로세스는 모든 입력 토큰이 자체 "체인 활성화 프로세스"를 완료할 때까지 순차적으로 진행됩니다. 따라서 입력
벡터와 유사한 메모리 벡터의 활성화 외에도 기계는 입력 벡터와 유사한 메모리 벡터의 "선행"과 "결과", 즉 메모리
뱅크의 앞뒤 정보를 제 시간에 활성화합니다. 그리고 아마도 다른 메모리 세그먼트를 통해 다른 "선행"과 "결과"를 활
성화할 수 있습니다. 이를 통해 우리의 계획은 가능한 이전 벡터를 추측하고 가능한 다음 벡터를 예측할 수 있습니다.
우리가 채택한 전략은 "전체적으로 낮은 점수율 토큰"을 먼저 추출하는 것이기 때문에, 정보의 공간적 위치 관계는
시간적 위치 관계를 통해 실제로 설정됩니다. 정보가 입력되면 기계는 먼저 "전반적으로 낮은 점수 비율 토큰"을 추
출하여 메모리 뱅크에 저장합니다. 이후 연쇄적인 연관 활성화 프로세스가 시작됩니다. 완료 후, 활성화된 보상 및
페널티 기호의 활성화 값을 계산하여 결정이 내려집니다.
기계의 의사 결정 원칙은 이점을 추구하고 단점을 피하는 것입니다. 추가 식별 정보 또는 기타 결정을 통해 결정을 내
릴 수 있습니다. 정보를 추가로 식별하기로 결정한 경우, 기계는 현재 활성화 가치가 높은 토큰 조합 모드(언어 토큰
포함)를 예상 모델로 삼아 입력에 아직 나타나지 않은 활성화 가치가 높은 토큰을 선제적으로 확인합니다. 사용되는
방법은 이러한 토큰을 획득한 과거의 경험을 모방하여 자신의 센서 시스템을 조정하는 것입니다. 따라서 이것은 사
18
람의 인식 과정과 유사한 정보에 대한 "패턴 인식"입니다.
새로 획득한 토큰(예: 지역 세부 정보)은 원래의 "전반적으로 낮은 점수 비율 토큰"과 시간적 근접 관계를 가지지만
부분적 유사성 관계도 있으므로 서로 활성화 값을 전달하여 연결할 수 있습니다. 이러한 방식으로 새로 획득한 토큰
은 원래의 전반적으로 낮은 점수 비율 토큰과 위치 관계를 설정합니다. 이러한 전반적으로 낮은 점수 비율의 토큰과
로컬 토큰은 기억과 망각 메커니즘을 통해 서서히 '세계 모델'을 형성합니다.
월드 모델은 독립적인 모델을 생성하는 것이 아니라 메모리 뱅크 전체에 퍼질 수 있는 토큰을 포함하고 있으며, 이러
한 토큰은 유사성, 근접성 및 높은 메모리 값에 의해 일시적으로 생성된다는 점을 지적해야 합니다. 따라서 정적이 아
닌 분산된 존재이며, 입력 정보에 의해 동기가 부여된 높은 활성화 값을 가진 토큰으로 일시적으로 구성되며 메모리
뱅크에 별도의 모델이 없습니다.
19
4.1.6 6단계, 활성화 값이 누적됩니다.
토큰과 여러 입력 토큰 사이에 활성화 값 전파 경로가 있는 경우(즉, 직접 또는 간접적으로), 입력에서 전달된 활성
화 값은 누적됩니다. 따라서 여러 입력 토큰이 있는 메모리 뱅크인 토큰은 여러 전파 경로에서 더 높은 누적 활성화
값을 얻게 됩니다.
이러한 방식으로 토큰에 입력된 토큰이 서로 연관되어 있으면 메모리 뱅크에서 관련 토큰의 가중치가 올라갑니다. 즉
, 일반적인 조합인 활성화 값은 활성화 값에서 해수면까지 상승합니다. 그리고 해수면에서의 활성화 값은 토큰을 많이
보유한 토큰의 낮은 활성화 값입니다. 활성화된 해수면으로부터 상승하는 토큰은 하나 이상의 "세계 모델"을 구성합
니다. 입력과 가장 관련성이 높은 기억은 흔하지는 않지만, 입력과 직접 관련이 있고 전파 경로가 짧기 때문에 높은
활성화 값을 얻을 수도 있습니다.
따라서 우리의 계획은 공통 토큰 조합을 통해 정보의 "정보 프레임 워크"를 얻을 수있을뿐만 아니라 특정 사실 세부
사항에주의를 기울일 수 있으므로 우리의 계획은 GPT의 현재 "환상"문제를 해결할 수있는 "사실 데이터베이스"입
니다.
4.1.7 7단계, 시간이 지남에 따라 활성화 값 하락
모든 활성화 값은 시간이 지남에 따라 지속적으로 감소합니다. 다음 토큰을 입력하면 메모리 관련 토큰이 활성화됩
니다. 이전 입력에서 활성화된 토큰이 완전히 가라앉지 않은 경우 활성화 값이 누적됩니다.
기계의 결정은 활성화된 모든 토큰을 기반으로 합니다. 따라서 첫 번째 입력과 백 입력이 모두 고려됩니다. 따라서 기
계의 사고는 일정한 시간 일관성을 가지며, 이는 "생략", "참조" 및 "은유"의 문제를 해결할 수 있습니다.
따라서 우리 기계는 앞쪽과 뒤쪽 입력 사이의 암묵적인 관계를 활용합니다! 이것이 바로 주의 메커니즘입니다!
또한, 머신은 마지막 결정에 의해 예측된 "장단점"을 기반으로 입력 토큰에 할당된 초기 활성화 값 A0을 조정합니다.
초기 활성화 값 A0은 활성화 값의 전파 범위와 누적 크기에 영향을 미칩니다! 이것은 "장단점"에 따라 주의의 강도를
조절하는 것입니다! 인간과 매우 유사합니다. 이 시점에서 현재 기술(트랜스포머)을 넘어선 것입니다. 사실 이것은
상사와 같은 인간의 의사 결정 과정과 매우 유사하여 더 많은 연관성을 생성하고 더 많은 보상 또는 처벌 기호를 활성
화하여 보상과 벌칙을 더 깊이 예측할 수 있습니다.
4.1.8 8단계, 연쇄 연결 활성화 프로세스 + 기억 및 망각 메커니즘 + 이점을 추구하고 단점을 피하는 원칙을
통해 사전 훈련 가중치 매트릭스를 업데이트합니다.
저희 프로토콜에서는 반복이 가능한 토큰 조합은 반복으로 인해 더 높은 메모리 값을 얻을 가능성이 높습니다. 그리
고 반복되는 조합이기 때문에 서로가 활성화 값을 밀어주기 때문에 단순 조합보다 훨씬 더 높은 메모리 값을 얻게 됩
니다.
그리고 반복할 수 있기 때문에 매번 조합할 때마다 더 높은 활성화 값을 얻을 수 있으므로 활성화하기가 더 쉬워지고
따라서 메모리 증분도 더 쉽게 얻을 수 있습니다. 따라서 이것은 긍정적인 순환 과정입니다. 여기서 우리는 기계가 스
스로 학습할 수 있다는 것을 알 수 있습니다. 하지만 동시에 기존의 사고방식을 잊어버리는 것도 시간이 많이 걸리는
20
과정입니다.
따라서 우리 프로토콜에서 기계의 사전 훈련 통계 프로세스는 단순히 통계적 반복성을 사용한 다음 기억 및 망각 메
커니즘을 사용하는 것이 아닙니다. 그러나 주의 메커니즘 + 기억 및 망각 메커니즘 + 혜택을 통해 공동 완성의 원칙을
피하고 피하십시오.
기계의 의사 결정 과정은 장점을 추구하고 단점을 피하는 것입니다. 이점을 추구하고 단점을 피하는 의사 결정에서
이점을 추구하고 단점을 피하는 방법에 따라 정보를 식별하는 프로세스입니다. 따라서 우리의 기계는 자신의 필요에
따라 토큰의 일반적인 조합을 구축합니다. 따라서 우리 기계는 외부 세계와 자신의 정보 인식에 대해 선택적 인식을
합니다.
메모리 및 망각 메커니즘: 메모리 뱅크의 모든 토큰은 한 번 활성화되면 활성화 값의 크기에 따라 메모리 값을 긍정
적으로 업데이트합니다. 메모리 값은 미리 학습된 가중치 매트릭스입니다! 토큰 순열은 완전할 수 없으므로, 이는 대
규모 모델의 사전 학습 과정과 유사한 불완전한 통계적 과정입니다.
21
체인 연결 활성화 프로세스는 입력 토큰 조합 인센티브에 따른 관심 메커니즘의 추론 프로세스(로컬 통계 가중치에
서 입력 로컬라이제이션 가중치 계산 프로세스까지)로, 트랜스포머의 관심 메커니즘과 유사합니다.
이 과정은 본질적으로 주의 메커니즘에 의해 설정된 좌표 기준 클러스터에 입력 벡터를 투영하는 것입니다. 입력 벡
터는 입력 차원에 따라 펄스 함수에 의해 형성된 원래의 기본 클러스터로 간주할 수 있습니다. 그러나 주의 메커니즘
에 의해 설정된 좌표 기준 클러스터는 공통 토큰 조합을 기반으로 설정됩니다.
주의 메커니즘의 추론 가중치 행렬은 입력 벡터를 기본 클러스터에 투영하는 계수 행렬입니다. 우리의 방식에서 체
인 연결 활성화 프로세스는 트랜스포머의 다층 주의 메커니즘과 유사하게, 먼저 토큰을 개별적으로 투영한 다음 결
합하여 투영하는 좌표 기반 클러스터를 주의 메커니즘에 투영하는 프로세스이기도 합니다. 최종 체인 활성화 후, 높
은 활성화 값 토큰의 하나 이상의 높은 가중치 구성 요소는 정보의 "프레임워크"입니다. 각 프레임워크에는 많은 토큰
이 포함되어 있어 구체적으로 설명하기 어렵습니다. 그러나 일반적으로 언어 기호는 대표성과 반복성이 높기 때문에
활성화 값도 가장 높을 수 있으므로 이 "프레임워크"의 대표 토큰이 될 수 있습니다. 따라서 저희 체계에서 활성화 값
은 추론 가중치 행렬입
댓글 0