๋…ผ๋ฌธ ์ฝ๊ณ  ๋น ๋ฅด๊ฒŒ ์ •๋ฆฌํ•ด๋ดค์Šต๋‹ˆ๋‹ค.




1. ์š”์•ฝ


reasoning์€ text๋ฅผ ์“ฐ๋Š”๋ฐ ์žˆ์–ด ๋‚ด๋ถ€์  ๊ณผ์ •.

์–ธ์–ด๋ชจ๋ธ์€ ์ž„์˜์˜ ํ…์ŠคํŠธ๋กœ๋ถ€ํ„ฐ ๋ช…์‹œ๋˜์ง€ ์•Š์€ ๊ทผ๊ฑฐ๋ฅผ ์ถ”๋ก ํ•ด๋‚ผ ์ˆ˜ ์žˆ์–ด์•ผํ•จ.

STaR(Zelikman et al. 2022) (Self-Taught Reasoner)๋Š” fewshot ์˜ˆ์‹œ๋กœ๋ถ€ํ„ฐ ๊ทผ๊ฑฐ๋ฅผ ์ถ”๋ก ํ•ด๋ƒˆ์ง€๋งŒ ์ œํ•œ์ ์ž„.

Quiet-STaR์€ ์ด์˜ ๋ฐœ์ „๋œ ๋ฒ„์ „. ๊ฐ ํ† ํฐ๋งˆ๋‹ค ๋ฏธ๋ž˜ ํ…์ŠคํŠธ๋ฅผ ์„ค๋ช…ํ•  ์ˆ˜ ์žˆ๋Š” ๊ทผ๊ฑฐ๋ฅผ ์ƒ์„ฑํ•จ.

ํ† ํฐ๋ณ„๋กœ ๋ณ‘๋ ฌํ™”ํ•ด์„œ ์ƒ๊ฐ์„ ์ƒ์„ฑํ•˜๊ณ , โ€˜์ƒ๊ฐโ€™์˜ ์‹œ์ž‘๊ณผ ๋์„ ํ‘œํ˜„ํ•˜๋Š” ํ† ํฐ์„ ์‚ฌ์šฉ, ์—ฌ๊ธฐ์— teacher-forcing ํ…Œํฌ๋‹‰ ์”€.


2. ํ”„๋ ˆ์ž„์›Œํฌ



(1) โ€˜์ƒ๊ฐโ€™๋“ค์„ ๋ณ‘๋ ฌ์ ์œผ๋กœ, ๋ชจ๋“  ํ† ํฐ๋ณ„๋กœ ์ƒ์„ฑํ•จ (think)

(2) ์ƒ๊ฐ์„ ์ด์šฉํ•ด์„œ ๋‹ค์Œ ํ† ํฐ์„ ์˜ˆ์ธกํ•œ ๊ฒƒ๊ณผ ์ด์šฉํ•˜์ง€ ์•Š๊ณ  ์˜ˆ์ธกํ•œ ๊ฑธ ํ•ฉ์นจ (talk). ์œ„ ๊ทธ๋ฆผ์—์„  5 ๋‹ค์Œ 4๋ฅผ ์˜ˆ์ธกํ•˜๊ธฐ ์œ„ํ•ด โ€˜Sampled Thoughtโ€™๋ฅผ ์—ฌ๋Ÿฌ๊ฐœ ์ƒ์„ฑํ•˜๊ณ  ์ฐธ์กฐํ•จ.

(3) REINFORCE ์จ์„œ (๋ชฌํ…Œ์นด๋ฅผ๋กœ policy gradient ๊ฐ•ํ™”ํ•™์Šต ์•Œ๊ณ ๋ฆฌ์ฆ˜์ธ๋ฐ ์š”์ฆ˜์—” ์–ธ์–ด๋ชจ๋ธ RLHFํ• ๋•Œ๋„ PPO ๋Œ€์‹ ์— ๋งŽ์ด ์”๋‹ˆ๋‹ค.) 4๋ฅผ ๋งž์ถ”๋Š”๋ฐ ๋„์›€์ด ๋œ ์ƒ๊ฐ์€ ๋ณด์ƒ(reward)๋ฅผ ์ฃผ๊ณ , ์•„๋‹Œ ์ƒ๊ฐ์€ ๋ฒ„๋ฆผ. (learn)


3. ์•Œ๊ณ ๋ฆฌ์ฆ˜


์ดˆ๊ธฐ ์–ธ์–ด๋ชจ๋ธ๊ณผ ์ƒ์„ฑํ•  โ€˜์ƒ๊ฐโ€™์˜ ๊ฐœ์ˆ˜, ์ƒ๊ฐ ์ •๋‹ต ๋น„๊ตํ•  truth ํ† ํฐ ๊ฐœ์ˆ˜ ๋“ฑ์„ ๋ฐ›์œผ๋ฉด, ์œ„๊ฐ™์€ ๊ทผ๊ฑฐ ์ƒ์„ฑํ•˜๋Š” ์–ธ์–ด ๋ชจ๋ธ์„ ์ถœ๋ ฅํ•˜๋Š” ๊ตฌ์กฐ.

num_steps๋งŒํผ ์–ธ์–ด๋ชจ๋ธ์„ ํ•™์Šตํ•˜๋ฉด์„œ i๋ฒˆ์งธ iter์ผ๋•Œ

i๋ฒˆ์งธ ์–ธ์–ด๋ชจ๋ธ๋กœ ํ•™์Šต ํ…์ŠคํŠธ ์‹œํ€€์Šค X๋ฅผ ์ธ์ฝ”๋”ฉํ•œ h^init์— ๋Œ€ํ•ด

์‹œํ€€์Šค ๊ธธ์ด l๊ฐœ ๋งŒํผ ํ† ํฐ ๋ณ„๋กœ ์ƒ๊ฐ ์ƒ์„ฑ์„ ๋ณ‘๋ ฌํ™”ํ•ด์„œ ๊ฐ๊ฐ์„ j๋กœ ๋‘ .

(1) h^init๋กœ๋ถ€ํ„ฐ โ€˜์ƒ๊ฐโ€™ ์—†์ด ๋‹ค์Œ n_true๊ฐœ์˜ ํ† ํฐ ํ™•๋ฅ ์„ ์˜ˆ์ธกํ•˜๊ณ ,

(2) ๊ฐ™์€ ํŒŒ๋ผ๋ฏธํ„ฐ์˜ ์–ธ์–ด๋ชจ๋ธ๋กœ โ€˜์ƒ๊ฐโ€™์„ ์ถœ๋ ฅ. ์ด ์ƒ๊ฐ์„ ์ด์šฉํ•ด (1)๊ณผ๋Š” ๋‹ค๋ฅด๊ฒŒ j๊นŒ์ง€์˜ ์›๋ž˜ ์‹œํ€€์Šค + โ€˜์ƒ๊ฐโ€™ + j๋ถ€ํ„ฐ j+n_true๊นŒ์ง€ ์‹œํ€€์Šค๋กœ ์žฌ๊ตฌ์„ฑํ•œ ๋’ค ๋‹ค์‹œ ๋‹ค์Œ ํ† ํฐ์„ ์˜ˆ์ธกํ•จ.

(1)๊ณผ (2)๋ฅผ ํ•ฉ์ณ์„œ ์–ผ๋งˆ๋‚˜ โ€˜์ƒ๊ฐโ€™์„ ์ฐธ์กฐํ• ์ง€ ๊ฒฐ์ •ํ•˜๋Š” ๊ฐ€์ค‘์น˜ w_{j:j+n_true}๋ฅผ ๋งŒ๋“ฌ. ์ด ๊ฐ€์ค‘์น˜๋Œ€๋กœ talk ํ† ํฐ ํ™•๋ฅ ์„ ์˜ˆ์ธก.

talk ํ† ํฐ ํ™•๋ฅ  ๋ชจ๋ธ๊ณผ ์‹ค์ œ j:j+n_true ํ† ํฐ์œผ๋กœ log likelihood loss๋ฅผ ๊ณ„์‚ฐ.

ํ•ด๋‹น ํ† ํฐ ๋ณ„๋กœ ๋‚˜์˜จ ์ƒ๊ฐ๋“ค์˜ likelihood์˜ ํ‰๊ท ๋ณด๋‹ค ๋†’์€ ์ƒ๊ฐ๋“ค์—๊ฒŒ๋งŒ reward๋ฅผ ์ฃผ๊ณ  ๋‚˜๋จธ์ง€๋Š” ๋ฒ„๋ฆผ.ย REINFORCE policy gradient loss๋ฅผ ์ทจํ•จ.

์ „์ฒด loss function์€ likelihood loss + REINFORCE loss๋กœย ์–ธ์–ด๋ชจ๋ธ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ํ•™์Šตํ•จ.


4. ๊ฒฐ๊ณผ

GSM8K, CommonsenseQA์—์„œ Quiet-STaR ํ•™์Šตํ• ์ˆ˜๋ก baseline๋Œ€๋น„ ์ •ํ™•๋„๊ฐ€ ํ–ฅ์ƒ๋จ. ์ƒ๊ฐ์˜ ๊ฐœ์ˆ˜, ์˜ˆ์ธกํ•  ํ† ํฐ ๊ฐœ์ˆ˜ ๋Š˜๋ฆด์ˆ˜๋ก ์ƒ์Šนํญ์ด ํผ.