1. (๋ชจ๋ธ๋“ค์„ ๋” ์ข‹๊ฒŒ ๋งŒ๋“ค๊ธฐ ์œ„ํ•œ ์–ด๋–ค ๋ฏธ๋ž˜ ์—ฐ๊ตฌ ๋ถ„์•ผ์— ๊ฐ€์žฅ ๊ด€์‹ฌ์ด ์žˆ๋Š”์ง€?)


๋ชจ๋ธ์„ ์‚ฌ์šฉํ•˜์—ฌ ๋ชจ๋ธ์„ ๋” ์ข‹๊ฒŒ ๋งŒ๋“œ๋Š” ๊ฒƒ์— ์ •๋ง ๋งŽ์€ ๊ด€์‹ฌ์ด ์žˆ๋‹ค.


AI๊ฐ€ ์–ด๋–ค ํ–‰๋™์„ ํ–ˆ์„ ๋•Œ ๊ทธ ๊ฒฐ๊ณผ๊ฐ€ ์ข‹์€์ง€ ๋‚˜์œ์ง€ ๋ณด์ƒ ์‹ ํ˜ธ๋ฅผ ๋ฐ›๊ณ  ์Šค์Šค๋กœ ํ•™์Šตํ•˜๋Š” ๋ฐฉ์‹

์ด '์‹ ํ˜ธ'๋ฅผ ๋‹ค๋ฅธ AI๊ฐ€ ์ฃผ๊ฑฐ๋‚˜, AI๊ฐ€ ํ•™์Šต ๋ฐ์ดํ„ฐ๋ฅผ ์ง์ ‘ ๋งŒ๋“ค์–ด๋‚ด๋Š” ๋ฐฉ์‹


(์ตœ๊ทผ deepseek์˜ [inference-time scaling for generalist reward modeling]์ด๋‚˜ Absolute Zero๊ฐ™์€ ๋…ผ๋ฌธ์ด ์ƒ๊ฐ๋‚˜๋Š” ๋ถ€๋ถ„)






2. (๋ชจ๋ธ์„ ์‚ฌ์šฉํ•˜์—ฌ ๋ชจ๋ธ์„ ๋” ์ข‹๊ฒŒ ๋งŒ๋“ค๊ณ  ์˜ฌ๋ฐ”๋ฅธ ๋ฐฉํ–ฅ์œผ๋กœ ๊ฐ€๊ณ  ์žˆ๋Š”์ง€ ์‹ ํ˜ธ๋ฅผ ์ฃผ๋Š” ๊ฒƒ๊ณผ ๊ด€๋ จํ•˜์—ฌ, ํ˜„์žฌ ์–ด๋–ค ๋‹จ๊ณ„์— ์žˆ๋‚˜์š”? ์ž‘๋™ํ•˜๋‚˜์š”? ์•„๋‹ˆ๋ฉด ์•„์ง ์ดˆ๊ธฐ ๋‹จ๊ณ„์ธ๊ฐ€์š”?)


"๋„ค, ๋†€๋ผ์šธ ์ •๋„๋กœ ์ž˜ ์ž‘๋™ํ•ฉ๋‹ˆ๋‹ค.

ํ•ฉ์„ฑ ๋ฐ์ดํ„ฐ๋Š” ์ •๋ง ๊ฐ•๋ ฅํ•œ ์ถ”์„ธ์˜€์Šต๋‹ˆ๋‹ค.


์ด๊ฒƒ์„ ๋” ์ถ”์ง„ํ•˜๊ฒŒ ๋˜์–ด ๊ธฐ์ฉ๋‹ˆ๋‹ค.

๋” ๊ฐ•๋ ฅํ•œ ๋ชจ๋ธ์ด ๋‚˜์˜ฌ์ˆ˜๋ก ๋ฏธ๋ž˜์— ์ €ํฌ ๋ชจ๋ธ์„ ๊ฐœ์„ ํ•˜๊ธฐ๊ฐ€ ๋” ์‰ฌ์›Œ์ง‘๋‹ˆ๋‹ค."





3. (๋”ฅ๋ฆฌ์„œ์น˜ ๊ฐ™์€ ์—์ด์ „ํŠธ๊ฐ€ ๋‚˜์™”๋Š”๋ฐ, ์ด๋Ÿฐ ์ ‘๊ทผ ๋ฐฉ์‹์ด ์—์ด์ „ํŠธ ์ „๋ฐ˜์— ๊ฑธ์ณ ์–ด๋–ป๊ฒŒ ํ™•์žฅ๋ ๊นŒ์š”?)


๋”ฅ ๋ฆฌ์„œ์น˜๋‚˜ ์˜คํผ๋ ˆ์ดํ„ฐ๋Š” ๋ชจ๋ธ์„ ํŠน์ • ๋Œ€์ƒ์— ๋Œ€ํ•ด ๋งค์šฐ ๊นŠ์ด ํ›ˆ๋ จ์‹œํ‚ค๊ณ  ์‹ถ์„ ๋•Œ ์‚ฌ์šฉํ•จ


ํ•˜์ง€๋งŒ o3๋ฅผ ํ†ตํ•ด, ๋ชจ๋ธ์ด ๋ชจ๋“  ์ข…๋ฅ˜์˜ ๋„๊ตฌ์— ๋Šฅ์ˆ™ํ•ด์ง€๋„๋ก ํ›ˆ๋ จ์‹œํ‚ฌ ์ˆ˜ ์žˆ๋‹ค๋Š” ๊ฒƒ์„ ํ™•์ธํ•จ

ํ•œ ๋„๊ตฌ๋ฅผ ๋ฐฐ์šฐ๋ฉด ๋‹ค๋ฅธ ๋„๊ตฌ ์‚ฌ์šฉ์—๋„ ๋„์›€์ด ๋˜๋Š” ์ผ๋ฐ˜ํ™” ๋Šฅ๋ ฅ์„ o3๋กœ ํ™•์ธํ–ˆ์Œ


๊ทธ๋ž˜์„œ ์•ž์œผ๋กœ๋Š” ํ•˜๋‚˜์˜ ํŠน์ • ๋„๊ตฌ์— ํŠนํ™”๋œ ํ›ˆ๋ จ์€ ๊ทธ๋‹ค์ง€ ๋งŽ์ง€ ์•Š์„ ๊ฒƒ์œผ๋กœ ์˜ˆ์ƒํ•จ

์ด๋ฏธ ๊ทธ๊ฒƒ์„ ์ž…์ฆํ–ˆ์œผ๋ฉฐ, ์ด์ œ ๊ทธ ๊ธฐ๋Šฅ๋“ค์„ ๊ด‘๋ฒ”์œ„ํ•˜๊ฒŒ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์Œ


์‹ค์ œ๋กœ ์‚ฌ๋žŒ๋“ค์ด o3๋ฅผ ์ •๋ง ์ข‹์•„ํ•˜๋Š” ์ด์œ  ์ค‘ ํ•˜๋‚˜๋Š”

๋”ฅ ๋ฆฌ์„œ์น˜์™€ ๋น„์Šทํ•œ ๋งŽ์€ ๊ธฐ๋Šฅ์„ ๋” ๋น ๋ฅด๊ฒŒ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค๋Š” ์ ์ž„


์ •๋ง ์ตœ๊ณ ์˜ ๋ณด๊ณ ์„œ๋ฅผ ์›ํ•œ๋‹ค๋ฉด ๋”ฅ ๋ฆฌ์„œ์น˜๋ฅผ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ์ง€๋งŒ,

๊ทธ ์ค‘๊ฐ„ ์ •๋„์˜ ๊ฒƒ์„ ์›ํ•œ๋‹ค๋ฉด o3๊ฐ€ ์ ํ•ฉํ•จ


-> ์•ž์œผ๋กœ๋Š” ์ ์  ๋” ์ผ๋ฐ˜ํ™”๋œ(General) ํ•˜๋‚˜์˜ ๋ชจ๋ธ์ด ๋” ๋งŽ์€ ๋„๊ตฌ๋“ค์„ ๋‹ค๋ฃจ๊ฒŒ ํ•˜๋Š” ์ถ”์„ธ๋กœ ์˜ˆ์ƒ๋จ





4. (๊ณต๊ฐœ์ ์œผ๋กœ ์ฝ”๋”ฉ ์—์ด์ „ํŠธ(A-SWE)๊ฐ€ ๋‚˜์˜ฌ ๊ฑฐ๋ผ๊ณ  ๋ง์”€ํ•˜์…จ๋Š”๋ฐ, ์•ž์œผ๋กœ ์ด๋Ÿฐ๊ฒŒ ๋‹ค๋ฅธ ๊ฒƒ๋“ค๋ณด๋‹ค ๋จผ์ € ๋‚˜์˜ฌ ๊ฒƒ ๊ฐ™๋‹ค๊ณ  ์ƒ๊ฐํ•˜์‹œ๋Š” ๊ธฐ์ค€์ด ์žˆ๋Š”์ง€?)


์ด๋ฏธ SWE-bench ์ˆ˜์น˜๊ฐ€ ๋งŽ์€ ์ธ๊ฐ„๋“ค์ด ์–ป๋Š” ์ ์ˆ˜๋ฅผ ์ดˆ๊ณผํ•˜๊ณ  ์žˆ๊ธฐ ๋•Œ๋ฌธ์—

์ฝ”๋”ฉ ์—์ด์ „ํŠธ๋Š” ๋ถ„๋ช…ํžˆ ๊ณง ๋‚˜์˜ฌ ๊ฒƒ์ด๋‹ค.





5. (์ƒ˜ ์•ŒํŠธ๋งŒ์€ ๋ชจ๋ธ ์ œํ’ˆ๊ตฐ์„ GPT-5๋กœ ํ†ตํ•ฉํ•˜๋Š” ๊ฒƒ์— ๋Œ€ํ•ด ์ด์•ผ๊ธฐํ–ˆ๋Š”๋ฐ, ์ด๋ฅผ ์œ„ํ•ด ํ•„์š”ํ•œ ๊ฒƒ์€?)


ํ˜„์žฌ 4o๋Š” ์ฑ„ํŒ…์— ๋งค์šฐ ๋›ฐ์–ด๋‚˜๊ณ , ํ›Œ๋ฅญํ•œ ๋Œ€ํ™” ์ƒ๋Œ€์ด๋‹ค

ํ•˜์ง€๋งŒ o3๋Š” ๋งค์šฐ ๋‹ค๋ฅธ ๊ธฐ์ˆ  ์„ธํŠธ๋ฅผ ๊ฐ€์ง€๊ณ  ์žˆ๋‹ค.


๋ฌธ์ œ๋ฅผ ์ •๋ง ์—ด์‹ฌํžˆ ์ƒ๊ฐํ•  ์ˆ˜ ์žˆ์ง€๋งŒ,

์—ฌ๋Ÿฌ๋ถ„์ด 'hi'๋ผ๊ณ  ๋งํ•  ๋•Œ ๋ชจ๋ธ์ด 5๋ถ„ ๋™์•ˆ ์ƒ๊ฐํ•˜๋Š” ๊ฒƒ์€ ์›ํ•˜์ง€ ์•Š์„ ๊ฒƒ์ด๋‹ค.


๊ทธ๋ž˜์„œ ์ด๋Ÿฌํ•œ ๊ธฐ๋Šฅ๋“ค์„ ๊ฒฐํ•ฉํ•˜๋Š” ๊ฒƒ์ด ์šฐ๋ฆฌ๊ฐ€ ์ง๋ฉดํ•œ ์‹ค์ œ ๊ณผ์ œ๋ผ๊ณ  ์ƒ๊ฐํ•œ๋‹ค.

์ฆ‰, ๋ชจ๋ธ์„ ์ •๋ง ์ฆ๊ฑฐ์šด ์žก๋‹ด ์ƒ๋Œ€์ด๋ฉด์„œ๋„ ์–ธ์ œ ์ถ”๋ก ํ•ด์•ผ ํ• ์ง€๋„ ์•Œ๋„๋ก ํ›ˆ๋ จ์‹œํ‚ค๋Š” ๊ฒƒ์ด๋‹ค.


์ด๊ฒƒ์€ GPT-4.1๊ณผ ์•ฝ๊ฐ„ ๊ด€๋ จ์ด ์žˆ๋Š”๋ฐ,

์ฝ”๋”ฉ์„ ๋” ์ข‹๊ฒŒ ๋งŒ๋“ค๊ธฐ ์œ„ํ•ด ์ฑ„ํŒ… ๋ฐ์ดํ„ฐ๋ฅผ ์ค„์ด๊ณ  ์ฝ”๋”ฉ ๋ฐ์ดํ„ฐ๋ฅผ ๋Š˜๋ ธ๋‹ค๊ณ  ์–ธ๊ธ‰ํ–ˆ์—ˆ๋‹ค.


๊ทธ๋Ÿฐ ์˜๋ฏธ์—์„œ ๋ช‡ ๊ฐ€์ง€ ์ œ๋กœ์„ฌ ๊ฒฐ์ •์ด ์žˆ๊ณ , ๋ชจ๋ธ์„ ์ •ํ™•ํžˆ ๋ฌด์—‡์— ๋งž์ถœ์ง€ ๊ฒฐ์ •ํ•ด์•ผ ํ•œ๋‹ค.

๊ทธ๊ฒƒ์ด GPT-5์˜ ์‹ค์ œ ๊ณผ์ œ์ด๋ฉฐ, ์ด ์ ์ ˆํ•œ ๊ท ํ˜•์„ ์–ด๋–ป๊ฒŒ ๋งž์ถœ ๊ฒƒ์ธ๊ฐ€ ํ•˜๋Š” ๊ฒƒ์ด๋‹ค.




RFT Launch, How OpenAI Improves Its Models & the State of AI Agents TodayIn this episode, I sit down with Michelle Pokrass, who leads post-training at OpenAI and played a key role in the launch of GPT-4.1 and their upcoming RFT of...www.youtube.com


https://www.youtube.com/watch?v=NNGbaiN1L7Y