최종 사용자가 로봇에게 새로운 작업을 수행하도록 대화형으로 가르칠 수 있도록 지원하는 것은 실제 응용 프로그램에 성공적으로 통합하기 위한 중요한 기능입니다. 예를 들어, 사용자는 로봇 개에게 새로운 묘기를 수행하도록 가르치거나 조작 로봇에게 사용자 선호도에 따라 도시락을 정리하는 방법을 가르치기를 원할 수 있습니다. 광범위한 인터넷 데이터를 기반으로 사전 훈련된 LLM( 대형 언어 모델 ) 의 최근 발전은 이 목표를 달성하기 위한 유망한 경로를 보여주었습니다. 실제로 연구자들은 단계별 계획 및 목표 지향 대화 부터 로봇 코드 작성 에이전트 에 이르기까지 로봇 공학에 LLM을 활용하는 다양한 방법을 탐구했습니다 .
이러한 방법은 구성 일반화의 새로운 모드를 제공하는 반면, 수동으로 엔지니어링되거나 선험적으로 학습된 기존 제어 기본 라이브러리의 새로운 동작을 함께 연결하기 위해 언어를 사용하는 데 중점을 둡니다 . 로봇 동작에 대한 내부 지식이 있음에도 불구하고 LLM은 관련 훈련 데이터의 제한된 가용성으로 인해 낮은 수준의 로봇 명령을 직접 출력하는 데 어려움을 겪습니다. 결과적으로 이러한 방법의 표현은 사용 가능한 기본 요소의 폭으로 인해 병목 현상이 발생하며, 이를 설계하려면 광범위한 전문 지식이나 대규모 데이터 수집이 필요한 경우가 많습니다.
“ 로봇 기술 합성을 위한 보상 언어 ”에서는 자연어 입력을 통해 사용자가 로봇에게 새로운 행동을 가르칠 수 있도록 하는 접근 방식을 제안합니다. 이를 위해 우리는 보상 기능을 언어와 하위 수준 로봇 동작 간의 격차를 해소하는 인터페이스로 활용합니다. 우리는 보상 함수가 의미론, 모듈성 및 해석 가능성이 풍부하기 때문에 이러한 작업에 이상적인 인터페이스를 제공한다고 가정합니다. 또한 블랙박스 최적화 또는 강화 학습(RL)을 통해 하위 수준 정책에 대한 직접적인 연결을 제공합니다. 우리는 LLM을 활용하여 자연어 사용자 지침을 보상 지정 코드로 변환한 다음 MuJoCo MPC를 적용하는 언어 보상 시스템을 개발했습니다.생성된 보상 함수를 최대화하는 최적의 저수준 로봇 동작을 찾습니다. 우리는 4족 로봇과 능숙한 조작 로봇을 사용하여 시뮬레이션에서 다양한 로봇 제어 작업에 대한 언어 보상 시스템을 시연합니다. 우리는 물리적 로봇 조작기에 대한 방법을 추가로 검증합니다
결론
이 연구에서는 낮은 수준의 모델 예측 제어 도구인 MuJoCo MPC를 사용하여 보상 기능을 통해 LLM과 로봇을 인터페이스하는 새로운 패러다임을 설명합니다. 보상 기능을 인터페이스로 사용하면 LLM이 LLM의 강점을 활용하는 의미가 풍부한 공간에서 작업하는 동시에 결과 컨트롤러의 표현력을 보장할 수 있습니다. 시스템 성능을 더욱 향상시키기 위해 구조화된 동작 설명 템플릿을 사용하여 LLM에서 로봇 동작에 대한 내부 지식을 더 잘 추출할 것을 제안합니다. 우리는 두 개의 시뮬레이션된 로봇 플랫폼과 이동 및 조작 작업을 위한 하나의 실제 로봇에서 제안된 시스템을 시연합니다
- dc official App
댓글 0