---
๋ ผ๋ฌธ ์ ๋ชฉ
Self-Interpretability: LLMs Can Describe Complex Internal Processes that Drive Their Decisions, and Improve with Training
(์๊ธฐ ํด์ ๊ฐ๋ฅ์ฑ: ๋๊ท๋ชจ ์ธ์ด ๋ชจ๋ธ์ ์ค์ค๋ก์ ์์ฌ๊ฒฐ์ ์ ์ด๋๋ ๋ณต์กํ ๋ด๋ถ ๊ณผ์ ์ ์ค๋ช ํ ์ ์์ผ๋ฉฐ, ํ๋ จ์ ํตํด ๋ ํฅ์๋ ์ ์๋ค)
---
์ด๋ก ํด์
์ฐ๋ฆฌ๋ ๋๊ท๋ชจ ์ธ์ด ๋ชจ๋ธ(LLM)์ด ์, ์ด๋ป๊ฒ ํน์ ํ ๋ฐฉ์์ผ๋ก ๋ฐ์ํ๋์ง์ ๋ํด ์์ง ์ ํ์ ์ผ๋ก๋ง ์ดํดํ๊ณ ์๋ค. ์ ๊ฒฝ๋ง์ ํด์ํ๊ธฐ ์ด๋ ค์ฐ๋ฉฐ, ์ง๊ธ๊น์ง๋ ๊ฐ๋ณ ๋ด๋ฐ๊ณผ ํ๋ก๊ฐ ์ด๋ค ๊ธฐ๋ฅ์ ํ๋์ง ๋ฐํ๋ ์ด๊ธฐ ๋จ๊ณ์ ๋ถ๊ณผํ๋ค.
ํ์ง๋ง ๋ ๋ค๋ฅธ ์ ๊ทผ๋ฒ์, LLM์ด ์์ ์ ๋ด๋ถ ์๋์ ์ค์ค๋ก ๋ฐ์ฑ(introspect)ํ๊ณ ์ค๋ช ํ ์ ์๋ ๋ฅ๋ ฅ์ ๊ฐ์ถ๊ฒ ํ๋ ๊ฒ์ด๋ค.
๋ณธ ์ฐ๊ตฌ์์๋ ์ธ ๊ฐ์ง๋ฅผ ๋ณด์ฌ์ค๋ค:
1. ํ์ฌ์ LLM๋ค์ ์์ฌ๊ฒฐ์ ๊ณผ์ ์์ ์๊ธฐ ๋ด๋ถ ๊ณผ์ ์ ์ ๋์ ์ผ๋ก ์ค๋ช ํ ์ ์๋ค.
2. ์ด๋ฌํ ๋ฅ๋ ฅ์ ์ถ๊ฐ ํ๋ จ์ ํตํด ํฅ์๋ ์ ์๋ค.
3. ์ด ํ๋ จ ํจ๊ณผ๋ ์ผ์ ์์ค๊น์ง ๋ค๋ฅธ ์ํฉ์๋ ์ผ๋ฐํ๋๋ค.
์ด๋ฅผ ๊ฒ์ฆํ๊ธฐ ์ํด ์ฐ๊ตฌ์ง์ GPT-4o์ GPT-4o-mini๋ฅผ ๋ฏธ์ธ ์กฐ์ (fine-tuning)ํ์ฌ, ๋์ถยทํด๊ฐยท์ฝ๋ ์ ํ ๋ฑ ๋ค์ํ ๋ณต์กํ ์ํฉ์์ ์์ฌ๊ฒฐ์ ์ ๋ด๋ฆฌ๋๋ก ํ๋ค.
๋ชจ๋ธ์๊ฒ ๋ฌด์์๋ก ์์ฑ๋ ์ ๋์ โ์ ํธ๋โ๋ฅผ ๋ถ์ฌํ๊ณ (์: ์ฝ๋๋ฅผ ๊ณ ๋ฅผ ๋ ์์ฐ๊ด vs ์ฃผ๋ณ ํ๊ฒฝ ์ค ์ด๋ค ๊ฑธ ๋ ์ค์ํ๊ฒ ๋ณผ์ง),
๋ชจ๋ธ์ด ์ค์ ๋ก ์์ฌ๊ฒฐ์ ๊ณผ์ ์์ ์ด๋ฌํ ๊ฐ์ค์น(์ ํธ)๋ฅผ ์ผ๋ง๋ ์ ์ค๋ช ํ ์ ์๋์ง ํ์ธํ๋ค.
์คํ ๊ฒฐ๊ณผ, LLM์ ์์ ์ด ์ด๋ค ์์ฑ์ ๋ ์ค์ํ๊ฒ ์ฌ๊ฒผ๋์ง ์ ํํ๊ฒ ์ค๋ช ํ ์ ์์๋ค. ๊ทธ๋ฆฌ๊ณ ์ถ๊ฐ ํ๋ จ์ ํตํด ๋ค๋ฅธ ์ข ๋ฅ์ ๊ฒฐ์ ์ํฉ์์๋ ์ด๋ฐ ์ค๋ช ๋ฅ๋ ฅ์ด ํฅ์๋์๋ค.
์ฆ, LLM์ ์์ ์ด ๊ฒฐ์ ์ ๋ด๋ฆด ๋ ์ด๋ค ๋ด๋ถ ๊ณผ์ ์ด ์๋ํ๋์ง ๋ณด๊ณ ํ๊ณ ์ค๋ช ํ ์ ์๋๋ก ํ์ต๋ ์ ์๋ค.
์ด ์ฐ๊ตฌ๋ LLM์ด ๋จ์ํ ๋ต์ ๋ด๋๋ ๋ฐ์ ๊ทธ์น์ง ์๊ณ , ์ค์ค๋ก ์ ๊ทธ๋ ๊ฒ ํ๋์ง๋ฅผ ์ค๋ช ํ ์ ์๋ ๊ธธ์ ์ด์๋ค๋ ์ ์์ ์ค์ํ๋ค. ์ด๋ ํฅํ ํด์ ๊ฐ๋ฅ์ฑ, ์ ์ด, ์์ ์ฑ ์ธก๋ฉด์์ ํฐ ์ด์ต์ ๊ฐ์ ธ์ฌ ์ ์๋ค.
๋ฌด์จ ๋ป์ธ์ง ์ ๋ชจ๋ฅด๊ฒ ๋น..
์ํฌ๋ฆด์ด๋ ํฌ๋ช ํด๋ฆฌ์นด๋ณด๋ค์ดํธ ์๋๋ฉด ์ ๋ฆฌ ๊ฐ์๊ฑธ๋ก ๋ง๋ค๋ฉด ํฌ๋ช ํ๊ฒ ์ง
์ ๊ฑฐ ์ํ๋ฉด ๋ฉํ์ธ์ง๋ ํฅ์๋๋ ค๋
๋จ์ํ๊ฒ LLM์ด ์ค์ค๋ก ์๊ธฐ ๋ด๋ถ ์ ๊ฒฝ๋ง์ด ์ด๋ค ๊ฒฝํฅ์ ๋๋๋ ์ค๋ช ํ ์ ์๋ค๋ ๊ฑฐ