The False Promise of Imitating Proprietary LLMs
โ AK (@_akhaliq) May 26, 2023
An emerging method to cheaply improve a weaker language model is to finetune it on outputs from a stronger model, such as a proprietary system like ChatGPT (e.g., Alpaca, Self-Instruct, and others). This approach looks to cheaplyโฆ pic.twitter.com/PjNBeBAWLy
๋
์ LLM ๋ชจ๋ฐฉ์ ์๋ชป๋ ์ฝ์
์ฝํ ์ธ์ด ๋ชจ๋ธ์ ์ ๋ ดํ๊ฒ ๊ฐ์ ํ๋ ์๋ก์ด ๋ฐฉ๋ฒ์ ChatGPT์ ๊ฐ์ ๋
์ ์์คํ
(์: ์ํ์นด, ์
ํ ์ธ์คํธ๋ญํธ ๋ฑ)๊ณผ ๊ฐ์ ๋ ๊ฐ๋ ฅํ ๋ชจ๋ธ์ ์ถ๋ ฅ์ ๊ธฐ๋ฐ์ผ๋ก ๋ชจ๋ธ์ ๋ฏธ์ธ ์กฐ์ ํ๋ ๊ฒ์
๋๋ค. ์ด ์ ๊ทผ ๋ฐฉ์์ ์ฝํ ์คํ ์์ค ๋ชจ๋ธ์ ์ฌ์ฉํ์ฌ ๋
์ ๋ชจ๋ธ์ ๊ธฐ๋ฅ์ ์ ๋ ดํ๊ฒ ๋ชจ๋ฐฉํ๋ ๊ฒ์
๋๋ค. ์ด ์ฐ๊ตฌ์์๋ ์ด๋ฌํ ์ ๊ทผ ๋ฐฉ์์ ๋นํ์ ์ผ๋ก ๋ถ์ํฉ๋๋ค. ๋จผ์ ๋ค์ํ ๊ธฐ๋ณธ ๋ชจ๋ธ ํฌ๊ธฐ(15์ต~13์ต), ๋ฐ์ดํฐ ์์ค, ๋ชจ๋ฐฉ ๋ฐ์ดํฐ ์(0.3์ต~1.5์ต ํ ํฐ)์ ์ฌ์ฉํ์ฌ ChatGPT๋ฅผ ๋ชจ๋ฐฉํ๋ ์ผ๋ จ์ LM์ ๋ฏธ์ธ ์กฐ์ ํฉ๋๋ค. ๊ทธ๋ฐ ๋ค์ ํฌ๋ผ์ฐ๋ ๋ ์ดํฐ์ ํ์ค NLP ๋ฒค์น๋งํฌ๋ฅผ ์ฌ์ฉํ์ฌ ๋ชจ๋ธ์ ํ๊ฐํฉ๋๋ค. ์ฒ์์๋ ๋ชจ๋ฐฉ ๋ชจ๋ธ์ ์ถ๋ ฅ ํ์ง์ ๋๋์ต๋๋ค. ๋ชจ๋ฐฉ ๋ชจ๋ธ์ด ์ง์๋ฅผ ํจ์ฌ ๋ ์ ๋ฐ๋ฅด๋ ๊ฒ์ผ๋ก ๋ํ๋ฌ๊ณ , ํฌ๋ผ์ฐ๋ ์์ปค๋ค์ ๋ชจ๋ฐฉ ๋ชจ๋ธ์ด ChatGPT์ ๊ฒฝ์๋ ฅ์ด ์๋ค๊ณ ํ๊ฐํ์ต๋๋ค. ๊ทธ๋ฌ๋ ๋ณด๋ค ํ๊ฒํ๋ ์๋ ํ๊ฐ๋ฅผ ์ํํ์ ๋, ๋ชจ๋ฐฉ ๋ฐ์ดํฐ์์ ํฌ๊ฒ ์ง์๋์ง ์๋ ์์
์์ ๋ชจ๋ฐฉ ๋ชจ๋ธ์ด ๊ธฐ๋ณธ LM๊ณผ ChatGPT์ ๊ฒฉ์ฐจ๋ฅผ ๊ฑฐ์ ์ขํ์ง ๋ชปํ๋ค๋ ์ฌ์ค์ ๋ฐ๊ฒฌํ์ต๋๋ค. ์ด๋ฌํ ์ฑ๋ฅ ์ฐจ์ด๋ ๋ชจ๋ฐฉ ๋ชจ๋ธ์ด ChatGPT์ ์คํ์ผ์ ๋ชจ๋ฐฉํ๋ ๋ฐ๋ ๋ฅ์ํ์ง๋ง ์ฌ์ค์ฑ์ ๋ชจ๋ฐฉํ๋ ๋ฐ๋ ๋ฅ์ํ์ง ์๊ธฐ ๋๋ฌธ์ ์ธ๊ฐ ํ๊ฐ์๋ฅผ ์ง๋์น ์ ์์์ ๋ณด์ฌ์ค๋๋ค. ๊ฒฐ๋ก ์ ์ผ๋ก ๋ชจ๋ธ ๋ชจ๋ฐฉ์ ์๋ชป๋ ์ฝ์์ด๋ฉฐ, ํ์ฌ ๋ฐฉ๋ฒ์ผ๋ก๋ ๊ฐ๋นํ๊ธฐ ํ๋ ์์ ๋ชจ๋ฐฉ ๋ฐ์ดํฐ๋ฅผ ์ฌ์ฉํ๊ฑฐ๋ ๋ ๋ฐ์ด๋ ์ฑ๋ฅ์ ๊ธฐ๋ณธ LM์ ์ฌ์ฉํด์ผ๋ง ์ขํ ์ ์๋ ๊ฐ๋ฐฉํ LM๊ณผ ํ์ํ LM ์ฌ์ด์๋ ์๋นํ ์ฑ๋ฅ ๊ฒฉ์ฐจ๊ฐ ์กด์ฌํ๋ค๋ ๊ฒฐ๋ก ์ ๋ด๋ฆฝ๋๋ค. ๊ฒฐ๊ตญ, ์คํ ์์ค ๋ชจ๋ธ์ ๊ฐ์ ํ๊ธฐ ์ํ ๊ฐ์ฅ ํจ๊ณผ์ ์ธ ๋ฐฉ๋ฒ์ ๋
์ ์์คํ
์ ๋ชจ๋ฐฉํ๋ ์ง๋ฆ๊ธธ์ ํํ๋ ๊ฒ์ด ์๋๋ผ ๋ ๋์ ๊ธฐ๋ณธ LM์ ๊ฐ๋ฐํ๋ ์ด๋ ค์ด ๊ณผ์ ๋ฅผ ํด๊ฒฐํ๋ ๊ฒ์ด๋ผ๊ณ ์ฃผ์ฅํฉ๋๋ค.
๋๊ธ 0