세계에서 인간과 상호 작용하기 위해 에이전트는 사람들이 사용하는 다양한 유형의 언어를 이해하고 이를 시각적 세계와 연관시키고 이를 기반으로 행동해야 합니다. 현재 에이전트가 작업 보상을 통해 간단한 언어 명령을 실행하는 방법을 배우는 동안 우리는 일반적인 지식을 전달하고 세계의 상태를 설명하며 대화형 피드백을 제공하는 등 다양한 언어를 활용하는 에이전트를 구축하는 것을 목표로 합니다. 우리의 핵심 아이디어는 언어가 에이전트가 미래를 예측하는 데 도움이 된다는 것입니다. 무엇이 관찰될지, 세상이 어떻게 행동할지, 어떤 상황이 보상을 받을지 등입니다. 이 관점은 언어 이해와 미래 예측을 강력한 자기 지도 학습 목표로 통합합니다. 미래의 텍스트 및 이미지 표현을 예측하고 상상한 모델 롤아웃에서 행동하는 방법을 배우는 다중 모드 세계 모델을 학습하는 에이전트인 Dynalang을 소개합니다. 언어를 사용하여 동작을 예측하는





기존 에이전트와 달리 Dynalang은 과거 언어를 사용하여 미래의 언어, 비디오 및 보상을 예측함으로써 풍부한 언어 이해를 얻습니다. Dynalang은 환경에서 온라인 상호 작용을 통해 학습하는 것 외에도 행동이나 보상 없이 텍스트, 비디오 또는 둘 다의 데이터 세트에 대해 사전 교육을 받을 수 있습니다. 그리드 세계에서 언어 힌트를 사용하는 것부터 집의 사실적인 스캔 탐색에 이르기까지 Dynalang은 환경 설명, 게임 규칙 및 지침을 포함하여 작업 성능을 향상시키기 위해 다양한 유형의 언어를 사용합니다. Dynalang은 행동이나 보상 없이 텍스트, 비디오 또는 둘 다의 데이터 세트로 사전 훈련될 수 있습니다.

그리드 세계에서 언어 힌트를 사용하는 것부터 집의 사실적인 스캔 탐색에 이르기까지 Dynalang은 환경 설명, 게임 규칙 및 지침을 포함하여 작업 성능을 향상시키기 위해 다양한 유형의 언어를 사용합니다. Dynalang은 행동이나 보상 없이 텍스트, 비디오 또는 둘 다의 데이터 세트로 사전 훈련될 수 있습니다. 그리드 세계에서 언어 힌트를 사용하는 것부터 집의 사실적인 스캔 탐색에 이르기까지 Dynalang은 환경 설명, 게임 규칙 및 지침을 포함하여 작업 성능을 향상시키기 위해 다양한 유형의 언어를 사용합니다.








https://dynalang.github.io/

Dynalang: Learning to Model the World with LanguageDynalang leverages diverse types of language to solve tasks by using language to predict the future in a multimodal world model.dynalang.github.io