Multimodal, Multitask, LLM agent, embodied agent, in-context (lifelong) learning, Retrieval-augmented generation (RAG) ๋“ฑ ๋‹ค์–‘ํ•œ ์ตœ์‹  ํŠธ๋ Œ๋“œ๋ฅผ ๋‹ด์€ ๋…ผ๋ฌธ์ด๋ผ ๊ณต์œ ๋“œ๋ฆฝ๋‹ˆ๋‹ค.

GPT4+RAG๋กœ ์ด๋Ÿฐ๊ฒƒ๋„ ๊ฐ€๋Šฅํ•˜๋‹ค ์ •๋„๋กœ ๋ณด์‹œ๋ฉด ๋  ๊ฒƒ ๊ฐ™์Šต๋‹ˆ๋‹ค.


paper title : JARVIS-1: Open-world Multi-task Agents with Memory-Augmented Multimodal Language Models

paper link : https://arxiv.org/abs/2311.05997

project link : https://craftjarvis-jarvis1.github.io/


์š”์•ฝ : ๋งˆ์ธํฌ๋ž˜ํ”„ํŠธ์˜ open-world์—์„œ RL์—†์ดย LLM๋งŒ์œผ๋กœ multimodal ์ƒํ™ฉ ์ธ์ง€, ๋ณต์žกํ•œ ์žฅ๊ธฐ ๊ณ„ํš ์ƒ์„ฑ, ์ฒดํ™”๋œ ์ œ์–ด๋ฅผ ํ†ตํ•ด ๋‹ค์–‘ํ•œ ์ž‘์—…์„ ์ˆ˜ํ–‰ํ•˜๋Š” JARVIS-1 ๋ชจ๋ธ

1. introduction

๊ธฐ์กด AI agent๋“ค์€ ๋ฌดํ•œํ•œ open world ์ž‘์—…์„ ์ฒ˜๋ฆฌํ•˜๊ฑฐ๋‚˜ ์ ์ง„์ ์œผ๋กœ ๊ฐœ์„ ํ•˜๋Š” ๋Šฅ๋ ฅ์ด ๋ถ€์กฑํ•จ

JARVIS-1์€ ์‹œ๊ฐ+์‚ฌ๋žŒ ๋ช…๋ น ์ธ์ง€, ๋ณต์žกํ•œ ๊ณ„ํš, ์ฒดํ™” ์ œ์–ด, multimodal ๋ฉ”๋ชจ๋ฆฌ ๋“ฑ์„ ํ†ตํ•ด Minecraft Universe Benchmark ์ดˆ๊ธฐ-์ค‘๊ธฐ ์ž‘์—…์—์„œ ๋งŒ์ ์— ๊ฐ€๊นŒ์šด ์ ์ˆ˜ ๋‹ฌ์„ฑ

long-horizon ๋‹ค์ด์•„๋ชฌ๋“œ ๊ณก๊ดญ์ด ์ž‘์—…์—์„œ๋„ ์ด์ „ SOTA(VPT)์˜ 5๋ฐฐ์ธ 12.5% ์„ฑ๊ณต๋ฅ  ๋‹ฌ์„ฑ


24b0d121e09c28a8699fe8b115ef04699c3cf0baf0


multimodal ์„ผ์„œ ์ž…๋ ฅ์€ MineCLIP๊ณผ LLM์„ ํ˜ผํ•ฉํ•œ MLM(Multimodal Laungauge Model)์œผ๋กœ ์ฒ˜๋ฆฌ. LLM ๋Œ€๋น„ open world์—์„œ ์ƒํ™ฉ ์ดํ•ด, self-check, self-explain, ๊ณ„ํš ์ˆ˜์ • ๋“ฑ์ด ๊ฐœ์„ ๋จ

Multimodal ๋ฉ”๋ชจ๋ฆฌ์— ์‚ฌ์ „ ์ง€์‹, ๊ฒฝํ—˜ ์ •๋ณด ๋“ฑ ๋‹ด์•„์„œ ๊ณ„ํš ์ˆ˜์ • ๋Šฅ๋ ฅ๊ณผ ์ผ๊ด€์„ฑ ํ–ฅ์ƒ. RL๊ณผ ๋‹ฌ๋ฆฌ ์ถ”๊ฐ€ ํ•™์Šต ์—†์ด in-context๋งŒ์œผ๋กœ exploration๊ณผ ์ €์žฅ, ๊ณ„ํš ์ •๋ฐ€ํ™”, self-instruct ๋ฐ˜๋ณต์œผ๋กœ life-long ๋‚ด self-improve๊ฐ€ ๊ฐ€๋Šฅํ•ด์ง

2. open-world ํ™˜๊ฒฝ์—์„œ AI agent์˜ ๊ณผ์ œ


24b0d121e09c28a8699fe8b115ef046c64f120489d


Challenge I: Situation-Aware Planning
์นจ๋Œ€ ์ œ์ž‘ ๊ฐ™์€ ์ž‘์—…์€ ํ˜„์žฌ ์œ„์น˜, ํ•„์š”ํ•œ ์žฌ๋ฃŒ/๋ชฌ์Šคํ„ฐ๊นŒ์ง€์˜ ์œ„์น˜, ์‹œ๊ฐ„, ๋‚ ์”จ, ์žฅ๋น„ ๋‚ด๊ตฌ๋„ ๋“ฑ ํ˜„์žฌ ์ƒํ™ฉ์— ๋Œ€ํ•œ ์ธ์‹๊ณผ ์‹ค์‹œ๊ฐ„ ์—…๋ฐ์ดํŠธ๊ฐ€ ํ•„์š”ํ•จ

GPT ๊ธฐ๋ฐ˜ planner๊ณผ ๋‹ฌ๋ฆฌ ์‚ฌ๋žŒ ๋˜๋Š” JARVIS-1์€ ์ด๋Ÿฌํ•œ situation-aware planning์„ ๋ณด์ž„ (a)

Challenge II: Task Complexity

๋ฉ”์ธ ๋ชฉํ‘œ(e.g. ObtainEnchantingTable)์„ ์œ„ํ•œ subgoal ๋‹ฌ์„ฑ, ์กฐ๊ฑด ์ถฉ์กฑ ๋ฐ ์žฅ๊ธฐ ๊ณ„ํš์ด ํ•„์š”ํ•จ

LLM์˜ self-debugging๊ณผ ์ƒํ˜ธ์ž‘์šฉ ๊ณ„ํš ๋Šฅ๋ ฅ์„ ์ด์šฉํ•ด ๋†’์€ ๋ณต์žก๋„์˜ ์ž‘์—…์—์„œ GPT๋ณด๋‹ค ๋‚˜์€ ์„ฑ๋Šฅ์„ ๋ณด์ž„ (b)

Challenge III: Life-long Learning
์ถ”๊ฐ€ ํ•™์Šต์—†์ด open world์˜ ๋ฌดํ•œํ•œ ์ž‘์—…์œผ๋กœ ์ผ๋ฐ˜ํ™”ํ•  ์ˆ˜๋Š” ์—†์œผ๋ฏ€๋กœ, ํ˜„์žฌ ์ž‘์—…์„ ์ˆ˜ํ–‰ํ•˜๋ฉด์„œ ์ƒˆ๋กœ์šด ์ž‘์—…์„ ํ•™์Šตํ•˜๋Š” life-long learning์ด ํ•„์š”

JARVIS-1์€ gradient ๊ธฐ๋ฐ˜ ๋ชจ๋ธ ์—…๋ฐ์ดํŠธ ์—†์ด ๋ชจ๋“  ๊ฒฝํ—˜์„ ๋ฉ”๋ชจ๋ฆฌ์— ์ €์žฅํ•˜๊ณ  ๊ฒ€์ƒ‰ํ•จ์œผ๋กœ์จ ๊ณ„ํš ์„ฑ๋Šฅ์„ ์—ฐ์†์ ์œผ๋กœ ๊ฐ•ํ™”ํ•  ์ˆ˜ ์žˆ์Œ

e.g. ObtainDiamondPickaxe๊ณผ ObtainDiamondAxe๋Š” ๊ฐ™์€ ์žฌ๋ฃŒ๋ฅผ ์‚ฌ์šฉํ•˜๋ฏ€๋กœ ๋ฉ”๋ชจ๋ฆฌ์— ์ €์žฅ๋œ ์ •๋ณด๋ฅผ ๋ฐ”ํƒ•์œผ๋กœ ๊ณ„ํš ๋˜๋Š” ์ž‘์—… ๋‹ฌ์„ฑ์— ์„œ๋กœ ๋„์›€์„ ์ค„ ์ˆ˜ ์žˆ์Œ (c)


3. ๋ฉ”๋ชจ๋ฆฌ ์ฆ๊ฐ• MLM์„ ํ†ตํ•œ ๋‹ค์ค‘์ž‘์—… Agent ์•„ํ‚คํ…์ฒ˜



24b0d121e09c28a8699fe8b115ef046f584c9098a0



์ „์ฒด ๊ณผ์ • : ์ˆ˜ํ–‰ํ•  ์ž‘์—…๊ณผ ํ˜„์žฌ ์ƒํ™ฉ(multimodal input โ†’ ํ…์ŠคํŠธ ์„ค๋ช…) ์ธ์‹ โ†’ MLM ์ด์šฉํ•ด multimodal ๋ฉ”๋ชจ๋ฆฌ์—์„œ ๊ด€๋ จ ๊ฒ€์ƒ‰์„ ์œ„ํ•œ query ์ƒ์„ฑ โ†’ ๋ฉ”๋ชจ๋ฆฌ์—์„œ ๊ด€๋ จ ๊ฒฝํ—˜, ์‚ฌ์ „์ง€์‹ ์ถ”์ถœ ๋ฐ planning ๋ช…๋ น์–ด โ†’ MLM์˜ prompt๋กœ ์ž…๋ ฅ โ†’ controller๋ฅผ ์œ„ํ•œ ์งง์€ ๋ชฉํ‘œ g1,...,gK ์ƒ์„ฑ โ†’ ํ‚ค๋ณด๋“œ ๋งˆ์šฐ์Šค ์•ก์…˜ ์ˆ˜ํ–‰ โ†’ ์„ฑ๊ณต ์‹œ ๋‹ค์‹œ ๋ฉ”๋ชจ๋ฆฌ๋กœ ์ €์žฅ


์ด๋•Œ ์Šค์Šค๋กœ ์ž‘์—… ์ œ์•ˆ ๋ฐ exploration์„ ์ˆ˜ํ–‰ํ•˜๋Š” self-instruct, ์—ฌ๋Ÿฌ JARVIS-1 agent๊ฐ€ ๋ณ‘๋ ฌ์ ์œผ๋กœ ๊ฒฝํ—˜์„ ์ˆ˜์ง‘ํ•ด ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ํ‚ค์šฐ๋Š” self-improve๊ฐ€ ์ˆ˜ํ–‰๋จ

planning ์‹œ์—๋Š” ์ž‘์—… ์ˆ˜ํ–‰ ์ „์— ํ˜„์žฌ ์ƒํ™ฉ์ด ๋ชฉํ‘œ์˜ ์กฐ๊ฑด์„ ์ถฉ์กฑํ•˜๋Š”์ง€ ํ™•์ธํ•˜๊ฑฐ๋‚˜ ๊ฒฐ๊ณผ๋ฅผ ์˜ˆ์ธกํ•˜๊ณ  ํ–‰๋™ ํ›„ ํ‰๊ฐ€ํ•˜๋Š” self-check๋ฅผ ์ˆ˜ํ–‰ํ•จ

๋˜ ์ˆ˜ํ–‰ ์‹คํŒจ ์‹œ์—” ํ™˜๊ฒฝ์˜ ํ”ผ๋“œ๋ฐฑ์„ MLM์— ๋„ฃ์–ด ์‹คํŒจ ์›์ธ์„ ์„ค๋ช…ํ•˜๋Š” self-explain์„ ์ˆ˜ํ–‰ํ•จ


์™ธ๋ถ€ ์ง€์‹์„ ํ†ตํ•ด ๋ชจ๋ธ์˜ ๋‚ด๋ถ€ ํ‘œํ˜„์„ ๋ณด์™„ํ•˜๋Š” RAG(Retrieval-augmented generation)๋ฅผ ์‚ฌ์šฉํ•จ. ๋‹จ ์™ธ๋ถ€ ์ง€์‹์ด ์•„๋‹Œ ๋ชจ๋ธ์ด ์ง์ ‘ ์ˆ˜์ง‘ํ•œ multimodal ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ์‚ฌ์šฉํ•จ


RAG ๋ชจ๋ธ :


24b0d121e09c28a8699fe8b115ef0468eaaaeab3


(x๋Š” ๋ช…๋ น์–ด, y๋Š” ๊ณ„ํš, z๋Š” ๊ฐ€์žฅ ์œ ์‚ฌํ•œ ๋ฉ”๋ชจ๋ฆฌ entry, p_ฮท๋Š” ๊ฒ€์ƒ‰ ๋ชจ๋ธ, p_ฮธ๋Š” ๊ณ„ํš๋ชจ๋ธ(MLM))


๊ฒ€์ƒ‰ ๋ชจ๋ธ :

๋จผ์ € ์‹œ๊ฐ&ํ…์ŠคํŠธ query์™€ ๋ฉ”๋ชจ๋ฆฌ์˜ ๊ฐ task key๋“ค์„ CLIP์˜ ํ…์ŠคํŠธ ์ธ์ฝ”๋”๋กœ ์ž„๋ฒ ๋”ฉํ•˜๊ณ  ์œ ์‚ฌ๋„๋ฅผ ๊ณ„์‚ฐํ•ด ์ž„๊ณ„์น˜๋ฅผ ๋„˜๋Š” entry๋งŒ ํ›„๋ณด๋กœ ์„ ์ •


24b0d121e09c28a8699fe8b115ef0468e5abefb2


์‹œ๊ฐ query(s_x)์™€ ๋ฉ”๋ชจ๋ฆฌ ํ›„๋ณด entry์˜ ์‹œ๊ฐ key(s_z)์— ๋Œ€ํ•ด์„œ๋„ CLIP์œผ๋กœ ์ž„๋ฒ ๋”ฉํ•ด ์œ ์‚ฌ๋„๋ฅผ ๊ณ„์‚ฐํ•œ๋’ค ๋†’์€ ์ˆœ์œผ๋กœ top-k ํ›„๋ณด๋ฅผ ์„ ์ •ํ•จ(z)

4. ์‹คํ—˜

24b0d121e09c28a8699fe8b115ef0469933af0b5f1


๋ชจ๋“  ์ž‘์—…์—์„œ ๊ฐ€์žฅ ๋†’์€ ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑํ•จ

ํŠนํžˆ ๋‹ค์ด์•„๋ชฌ๋“œ์™€ ๊ด€๋ จ๋œ ์ž‘์—…์—์„œ DEPS(Wang et al., 2023)๋ณด๋‹ค 3๋ฐฐ ์ •๋„ ๋†’์€ ์„ฑ๊ณต๋ฅ ์„ ๋ณด์ž„


24b0d121e09c28a8699fe8b115ef046f584b9099ae


VPT๋Š” ๋‹ค์–‘ํ•œ ์ž‘์—…์„ ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ์ง€๋งŒ ์‚ฌ๋žŒ์— ์˜ํ•œ ๋ช…๋ น์„ ์ˆ˜ํ–‰ํ•˜๊ธฐ ์–ด๋ ค์›€. ๊ฐ•ํ™”ํ•™์Šต(RL)์œผ๋กœ ํŠน์ • ์ž‘์—…์— ํŒŒ์ธํŠœ๋‹ํ•ด์•ผ ํ•˜์ง€๋งŒ ์งํ›„ ๋‹ค๋ฅธ ์ž‘์—…์˜ ์„ฑ๋Šฅ์ด ๋–จ์–ด์ง€๋Š” ๋ฌธ์ œ๊ฐ€ ์žˆ์Œ

Steve-1(Lifshitz et al., 2023)์—์„œ๋Š” VPT-earlygame์— goal-conditioned ํŒŒ์ธํŠœ๋‹์„ ํ†ตํ•ด ๋‹ค์ค‘์ž‘์—… ์„ฑ๋Šฅ์„ ์œ ์ง€ํ•˜๋Š” ๋ฐฉ๋ฒ•์„ ์ œ์•ˆํ•จ

20๋ถ„ ๋‚ด์— ๋‹ค์ด์•„๋ชฌ๋“œ ๊ณก๊ดญ์ด๋ฅผ ์ œ์ž‘ํ•˜๋Š” long-horizon ์ž‘์—…์—์„œ JARVIS-1์€ VPT-RL๋ณด๋‹ค๋„ 3๋ฐฐ ๋†’์€ ์„ฑ๊ณต๋ฅ ์„ ๋ณด์ž„ (6.22% vs 2.5%)

60๋ถ„์œผ๋กœ ํ™•์žฅํ•  ์‹œ์—” 12.5%๋กœ ์ฆ๊ฐ€ํ•˜๋ฉฐ, ์ด๋Š” ํ•œ lifelong ๋‚ด์—์„œ JARVIS-1์˜ ๊ธฐ์ˆ ์ด ์ง€์†์ ์œผ๋กœ ํ–ฅ์ƒ๋จ์„ ์˜๋ฏธํ•จ

์˜ˆ์‹œ ์˜์ƒ (์ฒ ๊ณก๊ดญ์ด ์ œ์ž‘)