규모에 대한 반직관적 함의: 문제의 보다 일반적인 버전을 해결하려고 시도하는 것이 원래 문제를 직접 해결하는 것보다 더 쉬운 방법입니다.
보다 일반적인 문제를 시도하면 더 일반적이고 간단한 접근 방식을 생각해낼 수 있습니다. 이는 종종 더 확장 가능한 방법으로 이어집니다. 점점 더 저렴해지는 컴퓨팅을 활용하면 보다 일반적인 문제를 해결하는 과정에서 부산물로 특정 문제를 해결할 수 있습니다.
몇 가지 예를 들어보겠습니다:
- NLU 작업(예: 질문 답변)을 직접 해결하는 것과 일반적인 언어 모델을 학습하고 다음 토큰 예측으로 작업을 해결하는 것.
- 기계 번역에 직접 작업하는 대신 모든 언어를 학습하는 일반적인 문제(mT5 대 번역 전용 모델)에 대해 작업합니다.
이 아이디어를 한계까지 확장하면, 인간의 지능을 모방하여 일반 지능을 직접 해결하는 것보다 초지능을 목표로 하는 것이 일반 지능에 도달하는 더 쉬운(그러나 매우 어려운) 방법일 수 있습니다.
단순히 인간의 지능을 모방하면 초인적인 지능으로 이어지지 않을 가능성이 높기 때문에 인간이 생각하는 방식을 기계에 가르치려고 하는 대신 기계 고유의 접근 방식에 대해 생각해야 합니다.
오픈ai 정형원 연구원 9월 서울대 세미나 요약
01:00:00 이 발췌문에서 연사는 특히 대규모 언어 모델과 관련하여 기계 학습 엔지니어링에 관심이 있는 개인의 진로에 대해 논의합니다. 이들은 컴퓨터 시스템, 하드웨어, 소프트웨어 공동 설계 등 해당 분야의 기본 사항을 이해하는 것이 중요함을 강조합니다. 그들은 가장 진보된 개념으로 직접 뛰어들지 말라고 경고하고 대신 이러한 기본 영역에서 강력한 기반을 구축할 것을 권장합니다. 또한 연사는 해당 분야의 기술 요구 사항이 시간이 지남에 따라 변할 수 있으므로 관련성이 있고 지속적인 지식에 집중하는 것이 중요하다고 언급합니다.
01:05:00 이 섹션에서 발표자는 컴퓨터 학습과 인간 학습의 차이점에 대해 논의하며, 특히 초지능을 목표로 하는 경우 인간을 모방하는 AI 모델을 구축할 필요가 없다고 언급합니다. 그들은 AI 모델이 대량의 데이터를 소비하고 컴퓨팅 능력을 발휘하는 능력과 같은 다양한 특성을 가지고 있음을 강조합니다. 발표자는 또한 처음에는 불가능해 보이더라도 시간이 지남에 따라 확장을 통해 특정 능력이 나타날 가능성에 대해서도 언급합니다. AI에 인간의 선호도를 가르치는 측면에서 연사는 AI가 사람들이 집단적으로 정의한 지침과 헌법을 따르므로 개인의 선호도에 비해 다루기 쉬운 문제가 되는 헌법적 AI(Constitutional AI) 아이디어를 제안합니다. 그들은 이것이 아직 초기 작업이지만 적극적으로 작업되고 있는 중요한 문제라고 언급합니다.
01:10:00 이 섹션에서 발표자는 대규모 언어 모델의 잠재적 미래 기능에 대해 논의합니다. 그들은 그들이 예측하는 새로운 능력 중 하나가 자기 성찰이라고 언급합니다. 여기서 모델은 자체 출력을 평가하고 그 평가를 의사 결정에 사용합니다. 이 능력은 아직 초기 단계이지만 실현 가능해 보이며 상당한 발전이 될 가능성이 있습니다. 발표자는 또한 추론이라는 주제를 다루며 확장을 통해 이점을 얻을 수 있지만 서로 다른 모델 간의 격차를 줄이는 것이 어렵다고 언급합니다. 그들은 더 큰 모델의 개발을 기다리는 것이 다른 접근 방식에 시간을 투자하는 것보다 더 효과적일 수 있다고 제안합니다.
01:15:00 이 섹션에서 발표자는 GPT-4 및 현재 LLM(대형 언어 모델)의 다음 단계에 대해 논의합니다. 그들은 LLM이 환각과 같은 문제에 취약하고 이해가 부족하기 때문에 모델 크기를 확장하는 것이 유일한 해결책은 아니라고 언급합니다. 이 문제를 해결하기 위해 발표자는 사실성을 개선하기 위한 엔드투엔드 신호로 RL(강화 학습)을 사용할 것을 제안합니다. 오답에 처벌을 가하고 RL 신호를 제공함으로써 모델은 더욱 사실적이 될 수 있습니다. 어려운 문제이지만 화자는 충분한 RL 신호가 있으면 이 문제가 해결될 수 있다고 믿습니다. OpenAI와 Google Research의 차이점에 대해 발표자는 OpenAI가 AGI(Artificial General Intelligence)에 중점을 두는 매우 미션 중심적인 반면 Google은 더 다양한 연구 주제를 가지고 있다고 언급합니다.
01:20:00 이 섹션에서 발표자는 OpenAI와 다른 조직 간의 문화 차이에 대해 논의하고 OpenAI가 출판보다는 AGI 구축에 중점을 둔 임무 중심적 초점을 강조합니다. 귀납적 편견이 덜한 아키텍처를 개발할 가능성에 대해 질문을 받았을 때 발표자는 아키텍처가 병목 현상이 아닐 수 있으며 학습 목표가 더 중요할 것이라고 제안합니다. 그들은 또한 거의 성공하지 못한 여러 변형된 Transformer 아키텍처에 대한 작업을 수행했으며 모델을 확장하면 차이가 더욱 작거나 부정적이게 되었다고 언급합니다. 그들은 다중 모드 학습에서 Transformer 아키텍처의 잠재적인 과제와 한계에 대해 간략하게 다루지만 다중 모드 학습이 다음 방향으로 간주된다는 점을 인정합니다. 그러나 그들은 해당 분야의 전문가가 아니라고 경고합니다.
01:25:00 이 섹션에서 발표자는 다중 언어 사전 훈련의 개념과 그것이 시간이 지남에 따라 어떻게 발전해 왔는지에 대해 논의합니다. 이전에는 언어가 너무 많으면 모델 내 용량 경쟁이 발생한다고 믿었습니다. 그러나 이제 더 많은 언어를 추가하면 실제로 모델 성능이 향상된다는 것이 이해되었습니다. 이는 모델이 여러 언어를 처리할 수 있는 충분한 용량을 갖고 있고 언어 간에 의미 정보를 전송할 수도 있기 때문입니다. 발표자는 또한 신호를 직접 연결하지 않고도 모델이 이미지와 같은 다양한 양식으로부터 학습할 수 있는 가능성을 언급합니다. 그들은 이것이 달성하기 더 어려울 수 있지만 불가능하지는 않은 새로운 능력이라고 믿습니다. 또 다른 질문에 대한 답변으로, 발표자는 더 작은 에이전트를 사용하는 것이 최선의 접근 방식이 아니며 더 큰 모델이 더 효과적이라는 의견을 표명합니다. 그들은 단 4년 만에 기계 공학에서 LLN 전문 분야로 전환하는 데 성공한 것은 운, 실험, 현장의 새로운 개발에 대한 지속적인 학습 및 적응의 조합 덕분이라고 생각합니다.
- dc official App
Sutton의 The Bitter Lesson이 생각나네
AGI 를 안 거친다고??
그래서 비행기로부터 우주선까지 확장시킬 때 새를 모방했던 게 아니라 역학 자체를 발전시키는 방향을 택해야 했었던 거지