1. μ›λž˜ μ˜ˆμ „ 고전적인 κ°•ν™”ν•™μŠ΅μ—λŠ” 정닡을 κ²€μ¦ν•˜λŠ” κ°€μΉ˜ ν•¨μˆ˜ μžμ²΄λ„ ν•™μŠ΅μ„ ν–ˆμ§€λ§Œ

Deepseek R1에 μ‚¬μš©λœ GRPO와 같은 μ΅œμ‹  LLM κ°•ν™”ν•™μŠ΅μ— μ μš©λ˜λŠ” κ°€μΉ˜ ν•¨μˆ˜λŠ” νš¨μœ¨μ„± 등을 μœ„ν•΄

λ‹¨μˆœνžˆ 정닡이 λ§žλŠ”μ§€ μ•„λ‹Œμ§€λ§Œ 체크함


μ €μžλ“€μ€ 그둜 인해 AIκ°€Β 

λ‚΄μž¬μ μœΌλ‘œ μžμ‹ μ˜ λ‹΅λ³€ ν’ˆμ§ˆμ„ ν‰κ°€ν•˜κ³  ν™œμš©ν•  수 μžˆλŠ”

μ€‘μš”ν•œ 검증 λŠ₯λ ₯을 μžƒμ–΄λ²„λ Έλ‹€κ³  νŒλ‹¨ν•¨





2. 이λ₯Ό ν•΄κ²°ν•˜κΈ° μœ„ν•΄, μ €μžλ“€μ€ RLVλΌλŠ” 방법을 μ œμ•ˆν•¨


핡심 μ•„μ΄λ””μ–΄λŠ”

μ–΄μ°¨ν”Ό κ°•ν™”ν•™μŠ΅ 쀑에 μƒκΈ°λŠ” 풀이과정 데이터λ₯Ό 버리지 말고

이걸둜 κ²€μ¦κΉŒμ§€ 잘 ν•˜λ„λ‘ LLM을 λ™μ‹œμ— ν•™μŠ΅μ‹œν‚€μž λΌλŠ” 것



즉, 예λ₯Ό λ“€μ–΄ LLM이 νŠΉμ • μˆ˜ν•™ 문제λ₯Ό ν’€κΈ° μœ„ν•΄ κ°•ν™”ν•™μŠ΅ κ³Όμ •μ—μ„œ

μ—¬λŸ¬ 풀이과정 데이터λ₯Ό λ§Œλ“€μ–΄λ‚Όν…λ°,

이 λ•Œ 이 풀이과정 데이터λ₯Ό 보고 'λ§žλ‹€' 'μ•„λ‹ˆλ‹€' κΉŒμ§€ λ§žνžˆλ„λ‘ ν•™μŠ΅μ‹œν‚€λŠ” 것


이λ₯Ό 톡해 단일 LLM은 생성기 & 검증기 역할을 λ™μ‹œμ— μˆ˜ν–‰ν•˜κ²Œ 됨


μ–΄μ°¨ν”Ό μƒκΈ°λŠ” 풀이과정을 μ‚¬μš©ν•˜λŠ” 것이기 λ•Œλ¬Έμ— ν•™μŠ΅ κ³„μ‚°λŸ‰λ„ 크게 μ¦κ°€ν•˜μ§€ μ•ŠμŒ






3. 이둜 인해 μƒκΈ°λŠ” 이득은


병렬 μƒ˜ν”Œλ§ μ „λž΅

즉, Best-of-N, Majority Voting, Weighted Voting같은 λ°©λ²•λ“€λ‘œ

문제의 μ •λ‹΅λ₯ μ„ λ†’μ΄λŠ”λ° μ‚¬μš©λ˜λŠ” TTC μš”κ΅¬λŸ‰μ„ λ‹€λ₯Έ 방식듀에 λΉ„ν•΄ 크게 효율적으둜 λ§Œλ“€ 수 있음


검증을 잘 ν•˜λ„λ‘ λ§Œλ“€μ–΄μ§„ LLM을 TTC에 ν™œμš©ν•˜κΈ° λ•Œλ¬Έμ—

이 λͺ¨λΈλ“€μ΄ μ—¬λŸ¬ 개 μƒμ„±λœ 정닡듀에 λŒ€ν•΄ 신뒰도 점수λ₯Ό λΆ€μ—¬ν•˜κ³ ,

이λ₯Ό λ°”νƒ•μœΌλ‘œ λž­ν‚Ήμ„ 맀겨쀀 λ’€ Best-of-N λ“±μ˜ 방식을 μ‚¬μš©ν•  수 있기 λ•Œλ¬Έ





4. 이둜 μΈν•œ 이득을 ν‘œν˜„ν•˜λ©΄ μ•„λž˜μ™€ κ°™μŒ



κΈ°μ‘΄ 방식듀에 λΉ„ν•΄ 8~32λ°°,Β 

특히 Deepseek R1에 μ‚¬μš©λœ GRPO에 λΉ„ν•΄μ„œλ„ 8λ°° 효율적인 TTC κ³„μ‚°λŸ‰μœΌλ‘œ λ™μΌν•œ 점수λ₯Ό 달성할 수 있음


덕뢄에 같은 κ³„μ‚°λŸ‰ κΈ°μ€€μœΌλ‘œλŠ” λ‹Ήμ—°νžˆ 더 높은 μ„±λŠ₯을 λ³΄μž„




5. TTCμ—λŠ” 크게 보면


λ¬Έμž₯을 더 길게 μƒμ„±ν•˜λŠ” 방식과

μ—¬λŸ¬ 문제λ₯Ό λ³‘λ ¬μ μœΌλ‘œ ν’€κ³  이λ₯Ό ν•©μ³μ„œ 결둠을 λ‚΄λŠ” 방식이 μžˆλŠ”λ°


두 방식 λͺ¨λ‘μ˜ νš¨μœ¨μ„±μ„ 높이기 λ•Œλ¬Έμ—


λ‘˜μ„ κ²°ν•©ν•˜μ—¬ R1 λͺ¨λΈμ— μ‚¬μš©ν•˜λ©΄ 1.2 - 1.6λ°° 더 높은 μ„±λŠ₯ ν–₯상을 λ³΄μž„



6. 큰 λͺ¨λΈλ‘œλ„ ν™•μž₯λ˜λŠ”μ§€ 확인해봄



잘 됨





6. 미래 μž‘μ—…


ν˜„μž¬λŠ” 검증은 λ§Œλ“€μ–΄μ§„ 풀이 과정에 λŒ€ν•΄ SFT (지도 λ―Έμ„Έμ‘°μ •)으둜 ν•™μŠ΅λ˜κ³  μžˆμ§€λ§Œ

μΆ”ν›„μ—λŠ” 생성과 κ²€μ¦κΉŒμ§€ RL을 톡해 μ²˜μŒλΆ€ν„° λκΉŒμ§€ ν•™μŠ΅ν•˜λŠ” 것을 λͺ©ν‘œλ‘œ ν•˜κ³  있음


이λ₯Ό 톡해 κ²€μ¦κΈ°λ‘œμ„œμ˜ LLM의 μ„±λŠ₯을 맀우 높일 수 μžˆμ„ κ²ƒμœΌλ‘œ κΈ°λŒ€ 됨



7. ν•œμ€„ μš”μ•½


'RLVλŠ” LLM을 좔둠기와 생성적 κ²€μ¦κΈ°λ‘œ λ™μ‹œμ— ν•™μŠ΅μ‹œμΌœ

TTC νš¨μœ¨μ„±κ³Ό μΆ”λ‘  정확도λ₯Ό 크게 ν–₯μƒμ‹œν‚€κ³ 

λ‹€μ–‘ν•œ μˆ˜ν•™ 및 물리 λ¬Έμ œμ— λŒ€ν•œ κ°•λ ₯ν•œ μΌλ°˜ν™” λŠ₯λ ₯을 보여쀬닀.'






κ³„μ†ν•΄μ„œ LLM κ°•ν™”ν•™μŠ΅ κ΅΅μ§ν•œ 연ꡬ 결과듀이 ν•˜λ£¨κ°€ λ‹€λ₯΄κ²Œ κ³΅κ°œλ˜λŠ”κ±Έ λ³΄λ‹ˆ

R1 이후 연ꡬ메타가 많이 λ‹¬λΌμ‘ŒμŒμ΄ 싀감됨





https://arxiv.org/pdf/2505.04842


https://x.com/agarwl_/status/1921203670353355160