AGI로 가는 길에는 많은 길이 있다. Deepmind's Gato 페이퍼의 발표에 이어 최근 Nando de Freitas는 "스케일만 있으면 된다"고 썼다. 대규모 데이터셋에 대한 지도 학습을 수행하는 언어 인터페이스를 갖춘 대규모 언어모델도 이러한 권장 경로 중 하나입니다.
Gato는 물리적 로봇의 데이터를 훈련하고 평가하지만, 구현이나 로보틱스를 완전히 우회하는 AGI에 도달하는 데는 더 큰 패러다임이 있습니다.이것은 Open AI가 추구하는 경로입니다. AI/Anthropic은 로봇 팀을 해체한 것으로 유명하다. 최근 Open AI에서 '기술 스태프'였던 친구와 함께 차를 타고 있는 자신을 발견했다. AI와 그는 "AGI를 위해 구현된 AI를 해결해야 한다고 생각하는가, 아니면 디지털로 충분하다고 생각하는가?"라고 물었다.나는 그 질문에 대해 많이 생각해 보았다.
언어는 지능의 끝이다
AGI에 관한 대화에 관해서는 언어가 지능의 시작이자 끝인 경우가 많습니다. 그러나 진화적 관점에서 지능은 구현된 에이전트 외부에 존재하지 않으며 언어 자체가 다중 에이전트 통신의 도구로 진화했다. 에이전트의 언어 및 구조적인 조정은 환경에서 보상을 극대화하는 데 도움이 되며, 보상은 충분하다는 가설에 따라 지능의 진화적 부산물로 간주될 수 있습니다. 언어는 확실히 인간의 지식을 풍부하게 암호화하고 지능을 해결할 수 있는 유망하고 확실한 도구이다.
하지만 AGI를 위한 충분한가?
AGI가 뭐죠?
그것은 모두 'AGI를 구성하는 것이 무엇인가' 에 대한 질문에 답하는 데 있다.
Andrej Karpathy는 그것이 느낌이라고 말한다. 몇몇 인류학 연구가들은 이상하게도 '세상을 이상한 곳으로 만드는 곳'이라고 정의한다.
Nick Bostrom은 AGI를 "실제적으로 모든 분야에서 최고의 인간의 두뇌보다 훨씬 더 똑똑한 지능"이라고 정의한다.
위키피디아는 그것을 "인간이 할 수 있는 어떤 지적 작업을 이해하거나 학습할 수 있는 지능형 에이전트의 능력"으로 정의한다.
Open Pilitrophy는 농업이나 산업혁명만큼 많은 차이를 가져와 세계 총생산의 10배에 해당하는 경제적 정의를 가진 "변형 AI"처럼 묘사한다.
Open AI에서 채택된 아이디어도 있습니다. 서클에서는 리모트 워커(재택근무자)로 고용할 수 있고, 인간만큼 잘하면 AGI라고 합니다.
만약 인공지능이 물리학자나 연구원처럼 일할 수 있고, 과학적으로 발전하고, 문자 그대로의 손가락을 움직이지 않고 논문을 쓸 수 있다면, 그것은 AGI일까?
스티브 워즈니악은 AGI를 위한 커피 테스트를 제안했다: 기계가 보이지 않는 인간의 부엌에서 커피를 만드는 방법을 알아낸다면 AGI이다.
궁극적으로 AGI에 구현이 필요한지 여부에 대한 질문에 대한 답변은 채택하는 AGI의 정의에 따라 달라집니다.이 에세이는 모든 면에서 인간보다 우수하거나 나은 것을 기준으로 삼을 것이다.
물리적 세계에는 몇 가지 유용한 일들이 있는데, 그것들을 변화시키기 위해서는 구현된 인공지능이 필요합니다.
빈티지 로봇은 1950년대 비트카페에서 책을 읽어준다. DALLE에 의해 생성되고 @Merzmensch에 의해 프롬프트 표시됨실시 형태와 관련하여 AGI에 도달하기 위한 패러다임은 대략 세 가지가 있다.
- 1. 비전과 언어, 그리고 인터넷에만 존재하는 AI를 훈련시킨다.
- 2. 비전 및 언어 태스크에 대해 훈련받았지만 구현된 태스크를 수행할 수 있는 AI
- 3. 시각, 언어, 제어에 대해 훈련받은 인공지능이 구현되어 인간으로서 꽤 지능적이고 신체적으로도 능력이 있다.
완전히 디지털화된 비주얼 언어 AI는 AGI가 아니다.
1996년 딥 블루는 게리 카스포로프에게 승리하며 세계에서 가장 경쟁력 있는 체스 선수가 되었다.그 당시에는 체스에 뛰어난 것이 인간 지능의 정점으로 여겨졌다.오늘날 AI는 여러 비디오 게임, 언어 및 이미지 생성 작업에서 더 우수합니다.
그러나 비 독점의 AI를 해결하는 것이 AGI에 충분한지 묻는 것은 체스와 바둑만 둘 수 있는 AI가 AGI인지 묻는 것과 같다. 전문화된 인공지능은 이미 어떤 일에서는 인간보다 뛰어나지만, 그것은 충분히 일반적이지 않다. 몇 가지 소프트웨어 엔지니어링 작업을 자동화하고 과학 연구실을 운영하고 논문을 발표하고 획기적인 기술을 발명하고 훌륭한 산문과 시를 쓰는 것과 같은 놀라운 일을 할 수 있습니다. 소프트웨어 엔지니어의 업무가 자동화되어 있어도, 전직 소프트웨어 엔지니어는 여전히 음식, 옷, 노트북을 사용하고, 물건을 배송받습니다. 이 AI는 제조업, 건설업, 운전업, 물류업, 에너지 및 광업, 농업과 같은 여러 산업 - 기본적으로 인터넷보다 앞선 거의 모든 산업에 충분한 서비스를 제공하지 못할 것이다. 이건 AGI가 아닙니다.
마찬가지로, 제가 채택한 정의에 따르면, 3은 분명히 AGI입니다.2에 대해서 얘기해볼까요?
구체성을 제거하는 AGI 패러다임의 strongman 버전은 무엇입니까?
로봇으로부터 데이터를 수집하지 않고 시각 및 언어 데이터셋에 대해 훈련되고 로봇의 작동기 매개변수에 근접한 제로샷을 촬영하여 로봇에 대해 훈련받은 전문가 정책과 비교할 수 없는 경우 로봇을 원격 조작하는 사람뿐만 아니라 최소한 로봇에 대해 훈련할 수 있는 매우 지능적인 인공지능을 훈련할 수 있다는 가설이다.
AI가 요리사를 관리할 수 있지만, 인간의 요리사가 요리하는 신체적인 행동을 한다면, 그게 AGI인가요?
구체화된 작업을 하기 위해서는 구체화된 형태, 즉 반복이 필요하다.그러나 비매체 AI가 내장 작업자의 행동을 안내할 수 있는가? 세계의 모든 요리사가 시각적인 언어 입력을 받아 클래식한 라따뚜이 패션으로 무엇을 해야 하는지 알려주는 초지능 인공지능을 갖추고 있다면, AGI일까? 이 프레임워크에서 더 생각해 보면, AI는 구현 없이는 10배의 물리적 생산성을 발휘할 수 없기 때문에 완전한 경제적 가치에 도달하지 못하고 변화할 수 없다. 이곳의 AI는 순전히 기계적인 측에서 병목현상을 일으킬 것이다. 또한 닫힌 피드백 루프에 인간의 구현이 포함된 AGI는 여전히 AI를 구현하고 있습니까?
이 제안이 제대로 작동하기 위해서는, 즉 비매체 AGI가 로봇을 안내하는 데 몇 가지 경고가 있습니다.
- 구현된 에이전트의 데이터: 내장 에이전트의 데이터, 입력 센서 및 출력 액추에이터에 대한 교육을 받아야 합니다.이것은 오프라인 학습과 약간 비슷합니다.네트워크를 수많은 Youtube 비디오에 노출시켜 인간이나 다른 에이전트가 작업 방법을 시연하고 모델이 형태학적으로 유사한 센서/액튜에이터 구성에 매핑합니다. AGI가 구현된 에이전트에 의해 수집된 데이터에 의존하는 경향이 있는 경우, 구현된 AI가 되는가? 제 생각에는, 만약 요원이 인간이라면, 아니라고 생각합니다. 하지만 학습된 로봇이나 원격 조작된 로봇으로부터 데이터가 필요하다면, 그렇다. 이것은 순전히 주관적인 선입니다. Deepmind의 Gato는 실제 로봇과 시뮬레이션 에이전트의 감독된 학습 데모를 사용하여 로봇공학을 시도하고 실제 로봇으로 평가하기 때문에 주관적인 정의에 의해 구현됩니다.
- 매핑 형태: 두 번째 고려사항은 인간 시연에서 배우지만 로봇에서 실행되는 AI의 효과와 교차 색조 에이전트 시연에서 형태학 일반화를 얼마나 잘 할 수 있는가이다. 이 백서는 감독된 학습 환경 대신 RL로 공식화된 현재 위치에 대한 기준선을 제공한다.또 다른 가까운 예는 매우 유사한 형태를 가진 개에게서 걷는 법을 배우는 네발 로봇이다.
- 오프라인 학습: 세 번째 측면은 다른 에이전트가 실행하는 정책에서만 학습하는 AI의 효과입니다.예를 들어, AI는 여전히 반작용자를 모델링하고 자가 교정 행동을 배울 수 없을 것이다.예를 들어, 서핑을 배울 때 자신의 민첩성과 무능성에 대한 인식은 물리적 매개 변수에 따라 조정되는 학습 경험과 더불어 의사 결정에 반영됩니다.플라밍고는 몇 가지 시각적 학습 과제를 몇 번 촬영하려고 하지만, 이것은 아직 제어를 위해 수행되지 않았습니다.
- Sim2Real: 시뮬레이트된 에이전트를 사용한 도메인 적응은 물리적 측면을 추가하지 않고 실시 형태를 추가하는 한 가지 방법입니다.그러나 시뮬레이션에만 노출된 에이전트가 아직 현실 세계로 잘 전달되지 못하기 때문에 sim2real은 여전히 로봇 연구의 활발한 영역이다.
로봇 공학은 AGI 문제이지만, 더 중요한 것은 AGI가 로봇 공학 문제라는 것이다.
주로 언어에 초점을 맞춘 AI 연구는 지능을 필요로 하는 몇 가지 문제, 특히 3D 공간 영상과 부분적 관찰 가능성 하에서 의사결정을 하는 문제를 무시합니다. 예를 들어, 새로운 도시를 탐험하거나 비디오 게임의 미로를 탐색하거나 드라이브를 구동하기 위해서는 언어 기반의 공식화 영역을 뛰어넘는 기술이 필요합니다.거리를 걸을 때 동적 에이전트의 움직임이나 복잡한 바다에서 파도타기를 배울 필요가 있는 제어 메커니즘을 예측하는 것은 움직임으로부터의 구조나 전신 코디네이션에 대한 이해를 필요로 합니다.이것 역시 언어를 사용하여 문제를 해결하거나 해결할 수 있는 것은 아닙니다.
언어에 비전을 추가한 후에도 여전히 정확한 제어의 측면과 그것이 소외된 구현의 본질적 변수와 어떻게 관련되어 있는지에 대한 측면이 있습니다.
로보틱스를 해결하려면 비전(감각 지각, 3D 추론), 음성(지시 및 상황 추론), 제어(조작 및 내비게이션)가 필요합니다.
에이전트/환경을 인텔리전스에서 추상화할 수 없음
몇 가지 에피소드에 걸친 평생 학습은 우리의 유전자에 데이터를 암호화하고 있습니다. 아기가 언어를 이해하고 이해하기 전에 구조화된 움직임과 주변 세계의 물리학을 이해할 수 있습니다. 지능적인 것은 환경에서의 생존상의 이점을 제공하는 것과 밀접하게 관련되어 있습니다.예를 들어 수생동물은 물속에서도 볼 수 있는 시각 시스템을 가지고 있습니다. 왜냐하면 수생동물은 사람이 볼 수 없는 방식으로 물의 굴절에 적응하도록 진화했기 때문입니다. 우리의 시야 범위를 에뮬레이트하려는 센서와 그 기반으로 수집된 데이터(유튜브 비디오 포함)는 우리의 시야 능력 영역에 지나치게 적합하기 때문에 어려움을 겪고 있습니다. 처음으로 백내장을 제거하여 볼 수 있게 한 환자들에게서, 그들은 평생 3D 세계에서 보냈음에도 불구하고, 그들의 센서에 그러한 입력이 없었기 때문에 공간 이미지에 대한 이해가 부족한 것으로 나타났다.본질적으로 환경과 에이전트는 지능의 정의에서 제외될 수 없습니다.
지난 10년간의 AI 연구는 멀티태스킹 스피치와 비전 벤치마크를 매우 잘하는 대형 언어모델의 증가로 이어졌다. 언어 첫 번째 AI는 시각적인 맥락 너머 시각적인 에이전트의 실패 모드에 영향을 받기 쉬우며, 시각적인 인간으로부터 수집된 훈련 말뭉치로부터 받을 수 있다. 이는 시각 언어 모델이 구현된 에이전트의 정확한 제어를 수행하는 데 고유한 모델의 매개 변수 근사치 무능에 시달릴 수 있다는 것을 논리적으로 확장한다. 현실 세계에 대한 추론은 방법론적 공간과 언어에 대해서만 생각하는 것이 아니라 현실 세계의 맥락에 근거하는 것을 요구한다.
인간에 의해 건설되고 설계된 세계에서는 감각운동역학에 구애받지 않는 지성은 차선책이 될 것이고 초인적인 기술은 물리적 작용과 보편적인 통제를 필요로 합니다.실시형태는 AGI에 절대적으로 필수적이다.
댓글 0