๊ธฐ์‚ฌ:

๋…ผ๋ฌธ:

๊นƒํ—™ ํŽ˜์ด์ง€:
https://ben-eysenbach.github.io/rpc/

์นด๋„ค๊ธฐ ๋ฉœ๋ก  ๋Œ€ํ•™๊ต, ๊ตฌ๊ธ€ ๋ธŒ๋ ˆ์ธ, UC๋ฒ„ํด๋ฆฌ ๋Œ€ํ•™๊ต ์—ฐ๊ตฌ์ง„๋“ค์ด RPC(Robust Predictable Control)๋ผ๋Š” ๋ฐฉ๋ฒ•์„ ๊ณ ์•ˆํ–ˆ๋‹ค.

RPC๋Š” ์Šค์Šค๋กœ์˜ ํ–‰๋™์— ์ผ๊ด€์„ฑ์„ ๊ฐ–๋Š” ๋ฐฉํ–ฅ์œผ๋กœ(self consistency) ์ž์‹ ์˜ ํ–‰๋™์„ ์ ์  ๋” ์ •ํ™•ํ•˜๊ฒŒ ์˜ˆ์ธกํ•˜๋ฉด์„œ ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•ด๋‚˜๊ฐ„๋‹ค๊ณ  ์ „ํ–ˆ๋‹ค.

RPC๋Š” ํ•™์Šต์— ๋” ์ ์€ ๋ฐ์ดํ„ฐ๋ฅผ ์š”๊ตฌํ–ˆ๊ณ , ๋” ์ข‹์€ ์ผ๋ฐ˜ํ™” ์„ฑ๋Šฅ์„ ๊ฐ–์ท„์œผ๋ฉฐ, ์ผ๋ฐ˜์ ์ธ ์ •๋ณด๋Ÿ‰์ด ์ฃผ์–ด์งˆ ๋•Œ ๊ธฐ์กด ๋ชจ๋ธ๋ณด๋‹ค ๋‹ค์„ฏ๋ฐฐ ์„ฑ๋Šฅ์ด ์ข‹์•˜๋‹ค.
(5x higher reward than a standard information bottleneck)

์˜ค๋ฅ˜ ์ง€์  ํ™˜์˜