์๋ณธ ๊ธฐ์ฌ๋ ํ์ด์ ์จ๊ฒ ๊ฑธ๋ ค์ ์๋ฌด๋ ๋ชป ์ฝ๋ ์ํ๋ผ ๋ค๋ฅธ ๊ธฐ์ฌ์์ ๊ฐ๋ตํ๊ฒ ์์ ๋ ๋ด์ฉ ๋ฐ์ทํจ
โ๋ฒ์ฉ ๊ฒ์ฆ๊ธฐ(Universal Verifier)โ
ํ์ง๋ง OpenAI์๋ ์์ง ๋น์ฅ์ ๋ฌด๊ธฐ๊ฐ ์์์ต๋๋ค. ํด๋น ์์
์ ์ ํตํ ํ ๊ด๊ณ์์ ๋ฐ๋ฅด๋ฉด, OpenAI๋ ์ฐ๊ตฌ์๋ค์ด โ๋ฒ์ฉ ๊ฒ์ฆ๊ธฐ(universal verifier)โ๋ผ๊ณ ๋ถ๋ฅด๋ ๊ฒ์ ๊ฐ๋ฐํด ์๋๋ฐ, ์ด๋ ๊ฐํํ์ต(RL) ๊ณผ์ ์์ ๋ชจ๋ธ์ด ๊ณ ํ์ง์ ๋ต๋ณ์ ์์ฑํ๋์ง ํ์ธํ๋ ํ๋ก์ธ์ค๋ฅผ ์๋ํํฉ๋๋ค.
์ด ๊ณผ์ ์ ๊ธฐ๋ณธ์ ์ผ๋ก LLM(๋๊ท๋ชจ ์ธ์ด ๋ชจ๋ธ)์๊ฒ ๋ค์ํ ์ถ์ฒ๋ฅผ ์กฐ์ฌํ์ฌ ๋ค๋ฅธ ๋ชจ๋ธ์ ๋ต๋ณ์ ํ์ธํ๊ณ ์ฑ์ ํ๋ ์ญํ ์ ๋งก๊ธฐ๋ ๊ฒ์ ํฌํจํฉ๋๋ค.ย
์ฌ์ฌ๋ฆ ์ด ํ OpenAI ๋ชจ๋ธ์ด ๊น๋ค๋ก์ด ์ํ ๊ฒฝ์๋ํ์์ ์ฐ์นํ ํ, ์ด ํ์ฌ์ ์์ ์ฐ๊ตฌ์์ธ ์๋ ์ฐ๋ ์จ์ด(Alexander Wei)๋ X(๊ตฌ ํธ์ํฐ)๋ฅผ ํตํด ์์ ๋ค์ด ์ฌ์ฉํด ์จ ๊ฐํํ์ต(RL) ์ ๊ทผ ๋ฐฉ์์ด "๋ฒ์ฉ์ "์ด๋ผ๊ณ ๋งํ์ผ๋ฉฐ, ์ด๋ ๋ ์ฃผ๊ด์ ์ธ ๋ฒ์ฃผ์์๋ ๋ต๋ณ์ ํ์ง์ ๊ฒ์ฆํ ์ ์์์ ์์ฌํฉ๋๋ค.
์ด๋ฌํ ๋ฐ์ ์ OpenAI๊ฐ GPT-5๋ฅผ ๊ฐ๋ฐํ๋ ๋ฐ ๋์์ด ๋ ๊ฒ์ผ๋ก ๋ณด์
๋๋ค. GPT-5๋ ์ ๋ต์ ์ฝ๊ฒ ํ์ธํ ์ ์๋ ์ํํธ์จ์ด ํ๋ก๊ทธ๋๋ฐ๊ณผ ๊ฐ์ด ๋ณด๋ค ์ฝ๊ฒ ๊ฒ์ฆ ๊ฐ๋ฅํ ์์ญ๊ณผ ์ฐฝ์์ ๊ธ์ฐ๊ธฐ์ ๊ฐ์ด ๋ ์ฃผ๊ด์ ์ธ ๋ถ์ผ ๋ชจ๋์์ ๊ฐ์ ๋ ์ฑ๋ฅ์ ๋ณด์์ต๋๋ค.
xAI์ ๊ตฌ๊ธ์ ํฌํจํ ์
๊ณ์ ๋ค๋ฅธ ๊ธฐ์
๋ค๋ AI ๋ชจ๋ธ ๊ฐ์ ์ ์ํ ์ ๋ง ๊ธฐ์ ๋ก์ ๊ฐํํ์ต(RL)์ ์ด๋ ฅ์ ๊ธฐ์ธ์ด๊ณ ์์ผ๋ฉฐ, OpenAI์ ๊ฐํํ์ต(RL)์ ์ด๋๊ณ ์๋ ํธ์๋ (Tworek)์ ์ต๊ทผ OpenAI ๋ชจ๋ธ์ ๊ธฐ๋ฐ์ด ๋๋ ๊ฐํํ์ต ์์คํ
์ด ์ฌ์ค์ AGI(๋ฒ์ฉ ์ธ๊ณต์ง๋ฅ)๋ฅผ ๊ตฌ์ฑํ๋ค๋ ์๊ฐ์ ๋์ํ๋ ๊ณต๊ฐ์ ์ธ ๋ฐ์ธ์ ํ์ต๋๋ค.
OpenAI๊ฐ GPT-5๋ฅผ ์ถ์ํ ๋, ์ด๋ ๋ถ์ํด์ผ ํ ๋์ ๊ธฐ๋๋ฅผ ์๊ณ ์์ ๊ฒ์
๋๋ค. ์ํธ๋จผ์ ์ง๋์ฃผ ์ฝ๋ฏธ๋์ธ ํ
์ค ๋ณธ(Theo Von)๊ณผ์ ํ์บ์คํธ์์ GPT-5์ ์ฑ๋ฅ์ ๋ํ ๊ธฐ๋๊ฐ์ ๋์ฑ ๊ณ ์กฐ์์ผฐ๋๋ฐ, ์ด ์๋ฆฌ์์ ๊ทธ๋ ์์ ์ด ์ดํดํ์ง ๋ชปํ๋ ์ง๋ฌธ์๋ ๋ชจ๋ธ์ด ์ผ๋ง๋ ์ฝ๊ฒ ๋ต๋ณํ๋์ง๋ฅผ ์ค๋ช
ํ์ต๋๋ค.
From various reports OpenAI really did bolt a โUniversal Verifierโ onto the GPT-5 training loop.
โ Rohan Paul (@rohanpaul_ai) August 1, 2025
And here's that paper, that OpenAI published earlier.
"Prover-Verifier Games Improve Legibility of LLM", showing a production-ready pipeline where a verifier model scores eachโฆ https://t.co/ZIwfoaIKmQ pic.twitter.com/0CW7UNEW2W
์ฌ๋ฌ ๋ณด๊ณ ์์ ๋ฐ๋ฅด๋ฉด OpenAI๋ GPT-5 ํ๋ จ ๋ฃจํ์ '๋ฒ์ฉ ๊ฒ์ฆ๊ธฐ(Universal Verifier)'๋ฅผ ์ค์ ๋ก ํ์ฌํ๋ค๊ณ ํฉ๋๋ค.
๊ทธ๋ฆฌ๊ณ ์ฌ๊ธฐ OpenAI๊ฐ ์ด์ ์ ๋ฐํํ๋ ๊ด๋ จ ๋
ผ๋ฌธ์ด ์์ต๋๋ค. "์ฆ๋ช
์-๊ฒ์ฆ์ ๊ฒ์์ LLM์ ๊ฐ๋
์ฑ์ ํฅ์์ํจ๋ค(Prover-Verifier Games Improve Legibility of LLM)"๋ผ๋ ์ ๋ชฉ์ ์ด ๋
ผ๋ฌธ์, ๊ฒ์ฆ ๋ชจ๋ธ์ด ๊ฐ ์ถ๋ก ์ฒด์ธ(reasoning chain)์ ์ ์๋ฅผ ๋งค๊ธฐ๊ณ ๊ทธ ๋ณด์์ ๋ค์ ์ ์ฑ
์
๋ฐ์ดํธ์ ๋ฐ์ํ๋, ์ค์ ์์ฉํ ๊ฐ๋ฅํ ํ์ดํ๋ผ์ธ์ ๋ณด์ฌ์ค๋๋ค.
์ด ๋
ผ๋ฌธ์ ํด๋น ๊ฒ์ฆ๊ธฐ๊ฐ ๋๊ท๋ชจ ๋ฐฐํฌ๊ฐ ๊ฐ๋ฅํ ๋งํผ ํฌ๊ธฐ๊ฐ ์์ผ๋ฉฐ, "๋ฏธ๋ GPT ๋ฐฐํฌ๋ฅผ ์ํด ์ค๊ณ๋์๋ค"๊ณ ๋ช
์ํ๊ณ ์์ต๋๋ค.
์ฆ๋ช
์-๊ฒ์ฆ์ ๊ฒ์์ ์๋ ๋ฐฉ์
ํ๋์ ๋ชจ๋ธ ์์ ๋ ๊ฐ์ ์ธ๊ฒฉ์ด ์ด๊ณ ์๋ค๊ณ ์๊ฐํด๋ณด์ธ์. '๋์์ด ๋๋' ์ธ๊ฒฉ์ ๋ฌธ์ ๋ฅผ ํด๊ฒฐํ๊ณ , ๊ฒฝ๋(lightweight) ๊ฒ์ฆ ๋คํธ์ํฌ์๊ฒ ๊ทธ ๋ต์ด ํ๋นํ๋ค๊ณ ์ค๋ํ๋ ค ํฉ๋๋ค. '๊ตํํ' ์ธ๊ฒฉ์ ์๋์ ์ผ๋ก ์๋ชป๋ ๊ฒฐ๋ก ์ ์ฌ์ฉ ์ง์ด๋ฃ์ผ๋ฉด์๋, ๋์ผํ ๊ฒ์ฆ๊ธฐ๋ฅผ ์์ด๋ ค๊ณ ํฉ๋๋ค. ์ด๋ ๊ฒ ์ญํ ์ ๋ฒ๊ฐ์ ์ํํจ์ผ๋ก์จ, ๊ฑฐ๋ ๋ชจ๋ธ์ ์์กฐํ๊ธฐ ๋ ์ด๋ ค์ด ํด๊ฒฐ์ฑ
์ ์์ฑํ๋ ๋ฒ์ ๋ฐฐ์ฐ๊ณ , ์ํ ๊ฒ์ฆ๊ธฐ๋ ์ค๋ฅ๋ฅผ ์ฐพ์๋ด๋ ๋ฅ๋ ฅ์ ๋์ฑ ๋ ์นด๋กญ๊ฒ ์ฐ๋งํ๊ฒ ๋ฉ๋๋ค.
2024๋
8์ ์์ด์ด๋(Wired) ๊ธฐ์ฌ๋ OpenAI๊ฐ GPT-4 ์ฝ๋ ๋์ฐ๋ฏธ๋ฅผ ๋ฏธ์ธ์กฐ์ ํ ๋ ์ผ๋ถ ์ธ๊ฐ ํผ๋๋ฐฑ์ ๋ชจ๋ธ ๊ธฐ๋ฐ ๋นํ๊ฐ๋ก ๋์ฒดํ์ผ๋ฉฐ, ์ด ์์คํ
์ด "ํฅํ ์ฃผ๋ ฅ ๋ชจ๋ธ์ ์ํ ์ธ๊ฐ ํผ๋๋ฐฑ ๊ธฐ๋ฐ ๊ฐํํ์ต(RLHF)์ ํตํฉ๋ ๊ฒ"์ด๋ผ๊ณ ์ธ๊ธํ ๋ฐ ์์ต๋๋ค.
GPT-5๊ฐ ๋ฐ๋ก ๊ทธ ๋ค์ ์ฃผ๋ ฅ ๋ชจ๋ธ์
๋๋ค.
ใทใฑใ
์ด๊ฑฐ ์์ ๋ ผ๋ฆฌ์ฝ์ด...๊ฐ์ ์ฝ์ด...์ด...? - dc App
์ด๊ฑฐ ์์ GAN์ธ๋ฐ..? - 2025 AGI
์ ๋์ ์์ฑ ์ ๊ฒฝ๋ง ์ด์ฉํ๊ฑฐ๋ค