OpenAI o3 및 o4-mini μ†Œκ°œ

μ§€κΈˆκΉŒμ§€ μΆœμ‹œλœ λͺ¨λΈ 쀑 κ°€μž₯ μŠ€λ§ˆνŠΈν•˜κ³  λ›°μ–΄λ‚œ μ„±λŠ₯κ³Ό μ™„μ „ν•œ 도ꡬ 접근성을 κ°–μΆ˜ λͺ¨λΈ
ChatGPTμ—μ„œ μ‚¬μš©ν•΄ 보기 (μƒˆ μ°½μ—μ„œ μ—΄λ¦Ό)

였늘 μ €ν¬λŠ” μ‘λ‹΅ν•˜κΈ° 전에 더 였래 μƒκ°ν•˜λ„λ‘ ν›ˆλ ¨λœ o-μ‹œλ¦¬μ¦ˆ λͺ¨λΈμ˜ μ΅œμ‹  버전인 OpenAI o3와 o4-miniλ₯Ό μΆœμ‹œν•©λ‹ˆλ‹€. 이 λͺ¨λΈλ“€μ€ ν˜„μž¬κΉŒμ§€ 저희가 μΆœμ‹œν•œ λͺ¨λΈ 쀑 κ°€μž₯ μŠ€λ§ˆνŠΈν•˜λ©°, ν˜ΈκΈ°μ‹¬ λ§Žμ€ μ‚¬μš©μžλΆ€ν„° κ³ κΈ‰ 연ꡬ원에 이λ₯΄κΈ°κΉŒμ§€ λͺ¨λ“  μ‚¬λžŒμ—κ²Œ ChatGPT의 λŠ₯λ ₯을 ν•œ 단계 λŒμ–΄μ˜¬λ¦΄ κ²ƒμž…λ‹ˆλ‹€. 처음으둜 저희 μΆ”λ‘  λͺ¨λΈμ΄ ChatGPT λ‚΄μ˜ λͺ¨λ“  도ꡬ(μ›Ή 검색, Python을 μ‚¬μš©ν•œ μ—…λ‘œλ“œ 파일 및 데이터 뢄석, μ‹œκ°μ  μž…λ ₯에 λŒ€ν•œ 심측 μΆ”λ‘ , 이미지 생성 포함)λ₯Ό μ£Όλ„μ μœΌλ‘œ μ‚¬μš©ν•˜κ³  κ²°ν•©ν•  수 μžˆμŠ΅λ‹ˆλ‹€. κ²°μ •μ μœΌλ‘œ, 이 λͺ¨λΈλ“€μ€ μ–Έμ œ μ–΄λ–»κ²Œ 도ꡬλ₯Ό μ‚¬μš©ν•˜μ—¬ μƒμ„Έν•˜κ³  사렀 κΉŠμ€ 닡변을 μ˜¬λ°”λ₯Έ 좜λ ₯ ν˜•μ‹μœΌλ‘œ (일반적으둜 1λΆ„ 이내에) μƒμ„±ν•˜μ—¬ 더 λ³΅μž‘ν•œ 문제λ₯Ό ν•΄κ²°ν• μ§€ μΆ”λ‘ ν•˜λ„λ‘ ν›ˆλ ¨λ˜μ—ˆμŠ΅λ‹ˆλ‹€. 이λ₯Ό 톡해 닀면적인 μ§ˆλ¬Έμ„ 더 효과적으둜 μ²˜λ¦¬ν•  수 있게 되며, μ‚¬μš©μžλ₯Ό λŒ€μ‹ ν•˜μ—¬ λ…λ¦½μ μœΌλ‘œ μž‘μ—…μ„ μˆ˜ν–‰ν•  수 μžˆλŠ” λ”μš± μ—μ΄μ „νŠΈμ™€ 같은 ChatGPT둜 λ‚˜μ•„κ°€λŠ” ν•œ κ±ΈμŒμž…λ‹ˆλ‹€. μ΅œμ²¨λ‹¨ μΆ”λ‘  λŠ₯λ ₯κ³Ό μ™„μ „ν•œ 도ꡬ μ ‘κ·Όμ„±μ˜ 결합은 ν•™μˆ  λ²€μΉ˜λ§ˆν¬μ™€ μ‹€μ œ 과제 μ „λ°˜μ—μ„œ ν˜„μ €νžˆ ν–₯μƒλœ μ„±λŠ₯으둜 이어져, μ§€λŠ₯κ³Ό μœ μš©μ„± λͺ¨λ‘μ—μ„œ μƒˆλ‘œμš΄ 기쀀을 μ„Έμ›λ‹ˆλ‹€.

λ³€κ²½ 사항

OpenAI o3λŠ” μ½”λ”©, μˆ˜ν•™, κ³Όν•™, μ‹œκ°μ  인식 λ“± μ—¬λŸ¬ λΆ„μ•Όμ—μ„œ ν•œκ³„λ₯Ό λ›°μ–΄λ„˜λŠ” μ €ν¬μ˜ κ°€μž₯ κ°•λ ₯ν•œ μΆ”λ‘  λͺ¨λΈμž…λ‹ˆλ‹€. Codeforces, SWE-bench (λͺ¨λΈλ³„ λ§žμΆ€ν˜• μŠ€μΊν΄λ“œ ꡬ좕 없이), MMMU λ“± λ²€μΉ˜λ§ˆν¬μ—μ„œ μƒˆλ‘œμš΄ 졜고 μ„±λŠ₯(SOTA) 기둝을 μ„Έμ› μŠ΅λ‹ˆλ‹€. 닀면적 뢄석이 ν•„μš”ν•˜κ³  닡이 μ¦‰κ°μ μœΌλ‘œ λͺ…ν™•ν•˜μ§€ μ•Šμ„ 수 μžˆλŠ” λ³΅μž‘ν•œ μ§ˆμ˜μ— μ΄μƒμ μž…λ‹ˆλ‹€. 특히 이미지, 차트, κ·Έλž˜ν”½ 뢄석과 같은 μ‹œκ°μ  κ³Όμ œμ—μ„œ κ°•λ ₯ν•œ μ„±λŠ₯을 λ°œνœ˜ν•©λ‹ˆλ‹€. μ™ΈλΆ€ μ „λ¬Έκ°€ ν‰κ°€μ—μ„œ o3λŠ” μ–΄λ €μš΄ μ‹€μ œ κ³Όμ œμ—μ„œ OpenAI o1보닀 μ£Όμš” 였λ₯˜λ₯Ό 20% 적게 λ°œμƒμ‹œμΌ°μœΌλ©°, 특히 ν”„λ‘œκ·Έλž˜λ°, λΉ„μ¦ˆλ‹ˆμŠ€/μ»¨μ„€νŒ…, 창의적 아이디어 ꡬ상 μ˜μ—­μ—μ„œ λ›°μ–΄λ‚œ μ„±κ³Όλ₯Ό λ³΄μ˜€μŠ΅λ‹ˆλ‹€. 초기 ν…ŒμŠ€ν„°λ“€μ€ 사고 νŒŒνŠΈλ„ˆλ‘œμ„œμ˜ 뢄석적 엄밀성을 κ°•μ‘°ν•˜κ³ , 특히 생물학, μˆ˜ν•™, 곡학 λΆ„μ•Όμ—μ„œ μƒˆλ‘œμš΄ 가섀을 μƒμ„±ν•˜κ³  λΉ„νŒμ μœΌλ‘œ ν‰κ°€ν•˜λŠ” λŠ₯λ ₯을 높이 ν‰κ°€ν–ˆμŠ΅λ‹ˆλ‹€.

OpenAI o4-miniλŠ” λΉ λ₯΄κ³  λΉ„μš© 효율적인 좔둠에 μ΅œμ ν™”λœ μ†Œν˜• λͺ¨λΈμž…λ‹ˆλ‹€. 크기와 λΉ„μš© λŒ€λΉ„ λ†€λΌμš΄ μ„±λŠ₯을 λ‹¬μ„±ν•˜λ©°, 특히 μˆ˜ν•™, μ½”λ”©, μ‹œκ°μ  κ³Όμ œμ—μ„œ λ›°μ–΄λ‚©λ‹ˆλ‹€. AIME 2024 및 2025μ—μ„œ 벀치마크된 λͺ¨λΈ 쀑 졜고 μ„±λŠ₯을 κΈ°λ‘ν–ˆμŠ΅λ‹ˆλ‹€. μ „λ¬Έκ°€ ν‰κ°€μ—μ„œλŠ” λΉ„ STEM 과제 및 데이터 κ³Όν•™κ³Ό 같은 μ˜μ—­μ—μ„œλ„ 이전 λͺ¨λΈμΈ o3-mini보닀 μš°μˆ˜ν•œ μ„±λŠ₯을 λ³΄μ˜€μŠ΅λ‹ˆλ‹€. νš¨μœ¨μ„± 덕뢄에 o4-miniλŠ” o3보닀 훨씬 높은 μ‚¬μš©λŸ‰ ν•œλ„λ₯Ό μ§€μ›ν•˜λ―€λ‘œ, μΆ”λ‘  λŠ₯λ ₯이 ν•„μš”ν•œ μ§ˆλ¬Έμ— λŒ€ν•΄ λŒ€μš©λŸ‰, κ³ μ²˜λ¦¬λŸ‰ μ˜΅μ…˜μœΌλ‘œ κ°•λ ₯ν•©λ‹ˆλ‹€.

μ™ΈλΆ€ μ „λ¬Έκ°€ ν‰κ°€μžλ“€μ€ 두 λͺ¨λΈ λͺ¨λ‘ ν–₯μƒλœ μ§€λŠ₯κ³Ό μ›Ή μ†ŒμŠ€ 포함 덕뢄에 이전 λͺ¨λΈλ“€λ³΄λ‹€ ν–₯μƒλœ μ§€μ‹œ 사항 이행 λŠ₯λ ₯κ³Ό 더 μœ μš©ν•˜κ³  검증 κ°€λŠ₯ν•œ 응닡을 보여쀀닀고 ν‰κ°€ν–ˆμŠ΅λ‹ˆλ‹€. 이전 λ²„μ „μ˜ μΆ”λ‘  λͺ¨λΈκ³Ό λΉ„κ΅ν•˜μ—¬ 이 두 λͺ¨λΈμ€ κΈ°μ–΅ 및 이전 λŒ€ν™”λ₯Ό μ°Έμ‘°ν•˜μ—¬ 응닡을 λ”μš± κ°œμΈν™”λ˜κ³  κ΄€λ ¨μ„± λ†’κ²Œ λ§Œλ“€κΈ° λ•Œλ¬Έμ— 더 μžμ—°μŠ€λŸ½κ³  λŒ€ν™”μ μœΌλ‘œ 느껴질 κ²ƒμž…λ‹ˆλ‹€.

벀치마크 결과:

κ²½μ§„ μˆ˜ν•™ (AIME 2024, 2025)

λͺ¨λΈ (도ꡬ μ—†μŒ) AIME 2024 정확도 (%) AIME 2025 정확도 (%) o1 74.3 79.2 o3-mini 87.3 86.5 o3 91.6 88.9 o4-mini 93.4 92.7

κ²½μ§„ μ½”λ”© (Codeforces)

λͺ¨λΈ (터미널 μ‚¬μš©) ELO o1 1891 o3-mini 2073 o3 2706 o4-mini 2719

박사 μˆ˜μ€€ κ³Όν•™ 질문 (GPQA Diamond)

λͺ¨λΈ (도ꡬ μ—†μŒ) 정확도 (%) o1 78.0 o3-mini 77.0 o3 83.3 o4-mini 81.4

심측 연ꡬ (Humanity’s Last Exam - μ—¬λŸ¬ λΆ„μ•Ό μ „λ¬Έκ°€ μˆ˜μ€€ 질문)

λͺ¨λΈ 정확도 (%) o1-pro 8.12 o3-mini (도ꡬ μ—†μŒ) 13.40 o3 (도ꡬ μ—†μŒ) 20.32 o3 (Python + μ›Ή 검색 도ꡬ) 24.90 o4-mini (도ꡬ μ—†μŒ) 14.28 o4-mini (Python + μ›Ή 검색 도ꡬ) 17.70

λ©€ν‹°λͺ¨λ‹¬

벀치마크 / λͺ¨λΈ o1 정확도 (%) o3 정확도 (%) o4-mini 정확도 (%) MMMU (λŒ€ν•™ μˆ˜μ€€ μ‹œκ°μ  문제 ν•΄κ²°) 77.6 82.9 81.6 MathVista (μ‹œκ°μ  μˆ˜ν•™ μΆ”λ‘ ) 71.8 86.8 84.3 CharXiv-Reasoning (κ³Όν•™ κ·Έλ¦Ό μΆ”λ‘ ) 55.1 78.6 72.0

μ½”λ”©

벀치마크 / λͺ¨λΈ o1-high o3-mini-high o3-high o4-mini-high SWE-Lancer ($) (ν”„λ¦¬λžœμ„œ μ½”λ”© 과제) $28,500 $17,375 $65,250 $56,375 SWE-Bench Verified (%) (μ†Œν”„νŠΈμ›¨μ–΄ 곡학) 48.9 49.3 69.1 68.1 Aider Polyglot (%) (μ½”λ“œ νŽΈμ§‘) 64.4 66.7 81.3 68.9

μ§€μ‹œ 사항 이행 및 μ—μ΄μ „νŠΈ 도ꡬ μ‚¬μš©

벀치마크 / λͺ¨λΈ o1 정확도 (%) o3-mini 정확도 (%) o3 정확도 (%) o4-mini 정확도 (%) Scale MultiChallenge (닀쀑 ν„΄ μ§€μ‹œ 이행) 44.93 39.89 56.51 42.99 Tau-bench (ν•¨μˆ˜ 호좜 - 항곡/μ†Œλ§€) 50.0 / 70.8 32.4 / 57.6 52.0 / 70.4 49.2 / 65.6 벀치마크 / λͺ¨λΈ 정확도 (%) BrowseComp (μ—μ΄μ „νŠΈ μ›Ή 검색 - 4o + μ›Ή 검색*) 1.94 BrowseComp (μ—μ΄μ „νŠΈ μ›Ή 검색 - o3 + python + μ›Ή 검색*) 9.72 BrowseComp (μ—μ΄μ „νŠΈ μ›Ή 검색 - o4-mini + python + μ›Ή 검색**) 1.5

*λͺ¨λ“  λͺ¨λΈμ€ '높은 μΆ”λ‘  λ…Έλ ₯(high reasoning effort)' μ„€μ •(ChatGPT의 'o4-mini-high'와 μœ μ‚¬)μ—μ„œ ν‰κ°€λ˜μ—ˆμŠ΅λ‹ˆλ‹€.

κ°•ν™” ν•™μŠ΅μ˜ 지속적인 ν™•μž₯

OpenAI o3 개발 μ „λ°˜μ— 걸쳐, μ €ν¬λŠ” λŒ€κ·œλͺ¨ κ°•ν™” ν•™μŠ΅μ΄ GPT μ‹œλ¦¬μ¦ˆ 사전 ν›ˆλ ¨μ—μ„œ κ΄€μ°°λœ "더 λ§Žμ€ μ»΄ν“¨νŒ… = 더 λ‚˜μ€ μ„±λŠ₯" κ²½ν–₯을 λ™μΌν•˜κ²Œ λ‚˜νƒ€λ‚Έλ‹€λŠ” 것을 κ΄€μ°°ν–ˆμŠ΅λ‹ˆλ‹€. μŠ€μΌ€μΌλ§ 경둜(μ΄λ²ˆμ—λŠ” RLμ—μ„œ)λ₯Ό λ‹€μ‹œ λ”°λΌκ°€λ©΄μ„œ ν›ˆλ ¨ μ»΄ν“¨νŒ…κ³Ό μΆ”λ‘  μ‹œ μΆ”λ‘  λͺ¨λ‘μ—μ„œ 좔가적인 자릿수만큼 μ„±λŠ₯을 λ°€μ–΄λΆ™μ˜€μŒμ—λ„ λΆˆκ΅¬ν•˜κ³  μ—¬μ „νžˆ λͺ…ν™•ν•œ μ„±λŠ₯ ν–₯상을 ν™•μΈν–ˆμœΌλ©°, μ΄λŠ” λͺ¨λΈμ΄ 더 였래 μƒκ°ν•˜λ„λ‘ ν—ˆμš©ν• μˆ˜λ‘ μ„±λŠ₯이 계속 ν–₯μƒλœλ‹€λŠ” 것을 μž…μ¦ν•©λ‹ˆλ‹€. OpenAI o1κ³Ό λ™μΌν•œ μ§€μ—° μ‹œκ°„ 및 λΉ„μš©μ—μ„œ o3λŠ” ChatGPTμ—μ„œ 더 높은 μ„±λŠ₯을 μ œκ³΅ν•˜λ©°, 더 였래 μƒκ°ν•˜κ²Œ ν•˜λ©΄ μ„±λŠ₯이 계속 ν–₯μƒλœλ‹€λŠ” 것을 κ²€μ¦ν–ˆμŠ΅λ‹ˆλ‹€.

λ˜ν•œ μ €ν¬λŠ” κ°•ν™” ν•™μŠ΅μ„ 톡해 두 λͺ¨λΈμ΄ 도ꡬλ₯Ό μ‚¬μš©ν•˜λ„λ‘ ν›ˆλ ¨ν–ˆμŠ΅λ‹ˆλ‹€. λ‹¨μˆœνžˆ 도ꡬλ₯Ό μ‚¬μš©ν•˜λŠ” λ°©λ²•λΏλ§Œ μ•„λ‹ˆλΌ μ–Έμ œ μ‚¬μš©ν•΄μ•Ό ν•˜λŠ”μ§€ μΆ”λ‘ ν•˜λŠ” 방법을 κ°€λ₯΄μ³€μŠ΅λ‹ˆλ‹€. μ›ν•˜λŠ” 결과에 따라 도ꡬλ₯Ό λ°°ν¬ν•˜λŠ” λŠ₯λ ₯은 κ°œλ°©ν˜• 상황, 특히 μ‹œκ°μ  μΆ”λ‘  및 닀단계 μ›Œν¬ν”Œλ‘œμš°μ™€ κ΄€λ ¨λœ μƒν™©μ—μ„œ λͺ¨λΈμ˜ λŠ₯λ ₯을 ν–₯μƒμ‹œν‚΅λ‹ˆλ‹€. μ΄λŸ¬ν•œ κ°œμ„ μ€ 초기 ν…ŒμŠ€ν„°λ“€μ΄ λ³΄κ³ ν•œ 바와 같이 ν•™μˆ  λ²€μΉ˜λ§ˆν¬μ™€ μ‹€μ œ 과제 λͺ¨λ‘μ— λ°˜μ˜λ©λ‹ˆλ‹€.

μ΄λ―Έμ§€λ‘œ μƒκ°ν•˜κΈ°

처음으둜 이 λͺ¨λΈλ“€μ€ 이미지λ₯Ό 사고 과정에 직접 톡합할 수 μžˆμŠ΅λ‹ˆλ‹€. λ‹¨μˆœνžˆ 이미지λ₯Ό λ³΄λŠ” 것이 μ•„λ‹ˆλΌ, 이미지λ₯Ό ν™œμš©ν•˜μ—¬ μƒκ°ν•©λ‹ˆλ‹€. μ΄λŠ” μ‹œκ°μ  μΆ”λ‘ κ³Ό ν…μŠ€νŠΈ 좔둠을 κ²°ν•©ν•˜λŠ” μƒˆλ‘œμš΄ μ’…λ₯˜μ˜ 문제 해결을 κ°€λŠ₯ν•˜κ²Œ ν•˜λ©°, λ©€ν‹°λͺ¨λ‹¬ 벀치마크 μ „λ°˜μ—μ„œ μ΅œμ²¨λ‹¨ μ„±λŠ₯으둜 λ‚˜νƒ€λ‚©λ‹ˆλ‹€.

μ‚¬μš©μžλŠ” ν™”μ΄νŠΈλ³΄λ“œ 사진, κ΅κ³Όμ„œ λ‹€μ΄μ–΄κ·Έλž¨ λ˜λŠ” μ†μœΌλ‘œ κ·Έλ¦° μŠ€μΌ€μΉ˜λ₯Ό μ—…λ‘œλ“œν•  수 있으며, 이미지가 νλ¦Ών•˜κ±°λ‚˜, λ°˜μ „λ˜μ—ˆκ±°λ‚˜, μ €ν™”μ§ˆμΈ κ²½μš°μ—λ„ λͺ¨λΈμ€ 이λ₯Ό 해석할 수 μžˆμŠ΅λ‹ˆλ‹€. 도ꡬ μ‚¬μš©μ„ 톡해 λͺ¨λΈμ€ μΆ”λ‘  κ³Όμ •μ˜ μΌλΆ€λ‘œ 이미지λ₯Ό μ‹€μ‹œκ°„μœΌλ‘œ νšŒμ „, ν™•λŒ€/μΆ•μ†Œ λ˜λŠ” λ³€ν˜•ν•˜λŠ” λ“± μ‘°μž‘ν•  수 μžˆμŠ΅λ‹ˆλ‹€.

이 λͺ¨λΈλ“€μ€ μ‹œκ° 인식 κ³Όμ œμ—μ„œ 동급 졜고 μˆ˜μ€€μ˜ 정확도λ₯Ό μ œκ³΅ν•˜μ—¬ μ΄μ „μ—λŠ” ν•΄κ²°ν•  수 μ—†μ—ˆλ˜ μ§ˆλ¬Έμ„ ν•΄κ²°ν•  수 있게 ν•©λ‹ˆλ‹€. μžμ„Έν•œ λ‚΄μš©μ€ μ‹œκ°μ  μΆ”λ‘  연ꡬ λΈ”λ‘œκ·Έλ₯Ό ν™•μΈν•˜μ‹­μ‹œμ˜€.

μ—μ΄μ „νŠΈ 도ꡬ μ‚¬μš©μ„ ν–₯ν•˜μ—¬

OpenAI o3와 o4-miniλŠ” ChatGPT λ‚΄μ˜ λͺ¨λ“  도ꡬ와 API의 ν•¨μˆ˜ ν˜ΈμΆœμ„ ν†΅ν•œ μ‚¬μš©μž μ§€μ • 도ꡬ에 μ™„μ „νžˆ μ ‘κ·Όν•  수 μžˆμŠ΅λ‹ˆλ‹€. 이 λͺ¨λΈλ“€μ€ 문제λ₯Ό ν•΄κ²°ν•˜λŠ” 방법을 μΆ”λ‘ ν•˜λ„λ‘ ν›ˆλ ¨λ˜μ—ˆμœΌλ©°, μ–Έμ œ μ–΄λ–»κ²Œ 도ꡬλ₯Ό μ‚¬μš©ν•˜μ—¬ μƒμ„Έν•˜κ³  사렀 κΉŠμ€ 닡변을 μ˜¬λ°”λ₯Έ 좜λ ₯ ν˜•μ‹μœΌλ‘œ μ‹ μ†ν•˜κ²Œ(일반적으둜 1λΆ„ 이내) 생성할지 μ„ νƒν•©λ‹ˆλ‹€.

예λ₯Ό λ“€μ–΄, μ‚¬μš©μžλŠ” "μΊ˜λ¦¬ν¬λ‹ˆμ•„μ˜ 여름 μ—λ„ˆμ§€ μ‚¬μš©λŸ‰μ€ μž‘λ…„κ³Ό λΉ„κ΅ν•˜μ—¬ μ–΄λ–¨κΉŒμš”?"라고 μ§ˆλ¬Έν•  수 μžˆμŠ΅λ‹ˆλ‹€. λͺ¨λΈμ€ 곡곡 μœ ν‹Έλ¦¬ν‹° 데이터λ₯Ό μ›Ήμ—μ„œ κ²€μƒ‰ν•˜κ³ , 예츑 λͺ¨λΈμ„ κ΅¬μΆ•ν•˜κΈ° μœ„ν•΄ Python μ½”λ“œλ₯Ό μž‘μ„±ν•˜κ³ , κ·Έλž˜ν”„λ‚˜ 이미지λ₯Ό μƒμ„±ν•˜κ³ , 예츑의 핡심 μš”μΈμ„ μ„€λͺ…ν•˜λŠ” λ“± μ—¬λŸ¬ 도ꡬ ν˜ΈμΆœμ„ μ—°κ²°ν•  수 μžˆμŠ΅λ‹ˆλ‹€. 좔둠을 톡해 λͺ¨λΈμ€ μ ‘ν•˜λŠ” 정보에 따라 ν•„μš”μ— 맞게 λ°˜μ‘ν•˜κ³  λ°©ν–₯을 μ „ν™˜ν•  수 μžˆμŠ΅λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄, 검색 μ œκ³΅μ—…μ²΄μ˜ 도움을 λ°›μ•„ 웹을 μ—¬λŸ¬ 번 κ²€μƒ‰ν•˜κ³ , κ²°κ³Όλ₯Ό 보고, 더 λ§Žμ€ 정보가 ν•„μš”ν•˜λ©΄ μƒˆλ‘œμš΄ 검색을 μ‹œλ„ν•  수 μžˆμŠ΅λ‹ˆλ‹€.

μ΄λŸ¬ν•œ μœ μ—°ν•˜κ³  μ „λž΅μ μΈ μ ‘κ·Ό 방식을 톡해 λͺ¨λΈμ€ λͺ¨λΈμ˜ λ‚΄μž₯된 지식을 λ„˜μ–΄μ„œλŠ” μ΅œμ‹  정보 μ ‘κ·Ό, ν™•μž₯된 μΆ”λ‘ , μ’…ν•©, 그리고 μ—¬λŸ¬ 양식에 걸친 좜λ ₯ 생성이 ν•„μš”ν•œ 과제λ₯Ό μ²˜λ¦¬ν•  수 μžˆμŠ΅λ‹ˆλ‹€.

(λͺ¨λ“  μ˜ˆμ‹œλŠ” OpenAI o3둜 μ™„λ£Œλ˜μ—ˆμŠ΅λ‹ˆλ‹€.)

(μ˜ˆμ‹œ 1: OpenAI o3 - μ–΄λ €μš΄ μˆ˜ν•™ 문제 ν•΄κ²° μƒλž΅)

(비ꡐ: OpenAI o1 - λ™μΌν•œ μˆ˜ν•™ 문제 μƒλž΅)

κ²°λ‘ : OpenAI o3λŠ” 검색 없이 μ •ν™•ν•œ 닡변을 μ–»μ—ˆμ§€λ§Œ, o1은 μ˜¬λ°”λ₯Έ 닡변을 μ œκ³΅ν•˜μ§€ λͺ»ν–ˆμŠ΅λ‹ˆλ‹€.

(μ˜ˆμ‹œ 2: OpenAI o3 - ν˜Έν…” ν™•μž₯ μ „λž΅ μƒλž΅)

(비ꡐ: OpenAI o1 - λ™μΌν•œ ν˜Έν…” ν™•μž₯ μ „λž΅ μƒλž΅)

κ²°λ‘ : OpenAI o3λŠ” κ΄€λ ¨μ„± 높은 μ‚°μ—… μ†ŒμŠ€λ₯Ό 더 많이 μΈμš©ν•˜κ³ , 데이터 기반의 포괄적이며 μ „λž΅μ μœΌλ‘œ 톡찰λ ₯ μžˆλŠ” κ³„νšμ„ μ œκ³΅ν•˜λ©°, μ‹€μ œ 과제λ₯Ό μ˜ˆμΈ‘ν•˜κ³  μ„ μ œμ μΈ 완화책을 μ œμ‹œν•©λ‹ˆλ‹€. o1은 μ‹ λ’°ν•  수 있고 μ£Όμ œμ— λΆ€ν•©ν•˜μ§€λ§Œ, 덜 μƒμ„Έν•˜κ³  미래 μ§€ν–₯적이며 κ°€μƒμ˜ 데이터에 μ˜μ‘΄ν•©λ‹ˆλ‹€.

(μ˜ˆμ‹œ 3: OpenAI o3 - EV 배터리 기술 영ν–₯ 뢄석 μƒλž΅)

(비ꡐ: OpenAI o1 - λ™μΌν•œ EV 배터리 기술 영ν–₯ 뢄석 μƒλž΅)

κ²°λ‘ : OpenAI o3λŠ” κ³Όν•™ 연ꡬ 및 μ‚°μ—… 데이터λ₯Ό λ°”νƒ•μœΌλ‘œ 졜근 배터리 기술 ν˜μ‹ μ΄ EV μ£Όν–‰ 거리, μΆ©μ „ 속도, 보급λ₯ μ— λ―ΈμΉ˜λŠ” 영ν–₯에 λŒ€ν•΄ 포괄적이고 μ •ν™•ν•˜λ©° 톡찰λ ₯ μžˆλŠ” 뢄석을 μ œκ³΅ν•©λ‹ˆλ‹€. o1은 μ‹ λ’°ν•  수 있고 μ£Όμ œμ— λΆ€ν•©ν•˜μ§€λ§Œ, 덜 μƒμ„Έν•˜κ³  미래 μ§€ν–₯적이며, μ‚¬μ†Œν•œ λΆ€μ •ν™•μ„±μ΄λ‚˜ κ³Όλ„ν•œ λ‹¨μˆœν™”κ°€ μžˆμŠ΅λ‹ˆλ‹€.

(μ˜ˆμ‹œ 4: OpenAI o3 - MLB ν”ΌμΉ˜ 클락 영ν–₯ 뢄석 μƒλž΅)

(비ꡐ: OpenAI o1 - λ™μΌν•œ MLB ν”ΌμΉ˜ 클락 영ν–₯ 뢄석 μƒλž΅)

κ²°λ‘ : OpenAI o3λŠ” μ›Ή 접근을 톡해 μ΅œμ‹  μ‹œμ¦Œ 데이터와 ERA의 λ―Έλ¬˜ν•œ λ³€ν™”(22-23λ…„ μ•½κ°„μ˜ μƒμŠΉ ν›„ 정상화)κΉŒμ§€ λ°˜μ˜ν•©λ‹ˆλ‹€. o1은 μ œκ³΅ν•˜λŠ” μˆ˜μΉ˜κ°€ μ‹€μ œμ™€ μ•½κ°„ λ‹€λ₯΄κ³ , 도루 증가λ₯Ό ν”ΌμΉ˜ 클락 μ™Έ λ‹€λ₯Έ μš”μΈ(베이슀 크기 ν™•λŒ€, 견제 μ œν•œ) μ–ΈκΈ‰ 없이 잘λͺ» κ·€μΈν•©λ‹ˆλ‹€.

(μ˜ˆμ‹œ 5: OpenAI o3 - 놀이곡원 일정 κ³„νš μƒλž΅)

(비ꡐ: OpenAI o1 - λ™μΌν•œ 놀이곡원 일정 κ³„νš μƒλž΅)

κ²°λ‘ : OpenAI o3λŠ” μ‹œκ°„ν‘œλ₯Ό μ •ν™•ν•˜κ²Œ λΆ„μ„ν•˜κ³  μ‚¬μš© κ°€λŠ₯ν•œ κ³„νšμ„ 좜λ ₯ν•˜λŠ” 반면, o1은 λΆ€μ •ν™•ν•œ 정보λ₯Ό λ°”νƒ•μœΌλ‘œ νŠΉμ • 곡연 μ‹œκ°„μ„ 잘λͺ» νŒŒμ•…ν•˜μ—¬ μ‹€μ œ ν™œμš©ν•˜κΈ° μ–΄λ €μš΄ κ³„νšμ„ μƒμ„±ν•©λ‹ˆλ‹€.

λΉ„μš© 효율적인 μΆ”λ‘  λ°œμ „

OpenAI o3와 o4-miniλŠ” 저희가 μΆœμ‹œν•œ κ°€μž₯ μ§€λŠ₯적인 λͺ¨λΈμΌ 뿐만 μ•„λ‹ˆλΌ, μ’…μ’… 이전 λͺ¨λΈμΈ OpenAI o1κ³Ό o3-mini보닀 더 νš¨μœ¨μ μž…λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄, 2025 AIME μˆ˜ν•™ κ²½μ§„λŒ€νšŒμ—μ„œ o3의 λΉ„μš© λŒ€λΉ„ μ„±λŠ₯ νš¨μœ¨μ„±μ€ o1을 λͺ…ν™•ν•˜κ²Œ κ°œμ„ ν•˜λ©°, λ§ˆμ°¬κ°€μ§€λ‘œ o4-mini의 νš¨μœ¨μ„±μ€ o3-miniλ₯Ό λͺ…ν™•ν•˜κ²Œ κ°œμ„ ν•©λ‹ˆλ‹€. 보닀 일반적으둜, μ €ν¬λŠ” λŒ€λΆ€λΆ„μ˜ μ‹€μ œ μ‚¬μš© μ‚¬λ‘€μ—μ„œ o3와 o4-miniκ°€ 각각 o1κ³Ό o3-mini보닀 더 μŠ€λ§ˆνŠΈν•˜κ³  μ €λ ΄ν•  κ²ƒμœΌλ‘œ μ˜ˆμƒν•©λ‹ˆλ‹€.

μ•ˆμ „μ„±

λͺ¨λΈ λŠ₯λ ₯의 λͺ¨λ“  κ°œμ„ μ—λŠ” 그에 μƒμ‘ν•˜λŠ” μ•ˆμ „μ„± κ°œμ„ μ΄ ν•„μš”ν•©λ‹ˆλ‹€. OpenAI o3와 o4-miniλ₯Ό μœ„ν•΄ μ €ν¬λŠ” μ•ˆμ „ ν•™μŠ΅ 데이터λ₯Ό μ™„μ „νžˆ μž¬κ΅¬μΆ•ν•˜μ—¬ 생물학적 μœ„ν˜‘(λ°”μ΄μ˜€λ¦¬μŠ€ν¬), μ•…μ„±μ½”λ“œ 생성, νƒˆμ˜₯κ³Ό 같은 μ˜μ—­μ—μ„œ μƒˆλ‘œμš΄ 거절 ν”„λ‘¬ν”„νŠΈλ₯Ό μΆ”κ°€ν–ˆμŠ΅λ‹ˆλ‹€. 이 μƒˆλ‘œμ›Œμ§„ λ°μ΄ν„°λŠ” o3와 o4-miniκ°€ 저희 λ‚΄λΆ€ 거절 벀치마크(예: μ§€μ‹œ 계측 ꡬ쑰, νƒˆμ˜₯)μ—μ„œ κ°•λ ₯ν•œ μ„±λŠ₯을 λ‹¬μ„±ν•˜λ„λ‘ μ΄λŒμ—ˆμŠ΅λ‹ˆλ‹€. λͺ¨λΈ κ±°μ ˆμ— λŒ€ν•œ κ°•λ ₯ν•œ μ„±λŠ₯ 외에도, μ €ν¬λŠ” ν”„λ‘ ν‹°μ–΄ μœ„ν—˜ μ˜μ—­μ—μ„œ μœ„ν—˜ν•œ ν”„λ‘¬ν”„νŠΈλ₯Ό νƒμ§€ν•˜κΈ° μœ„ν•œ μ‹œμŠ€ν…œ μˆ˜μ€€ μ™„ν™” μ‘°μΉ˜λ„ κ°œλ°œν–ˆμŠ΅λ‹ˆλ‹€. 이미지 μƒμ„±μ—μ„œμ˜ 이전 μž‘μ—…κ³Ό μœ μ‚¬ν•˜κ²Œ, μ €ν¬λŠ” μ‚¬λžŒμ΄ μž‘μ„±ν•˜κ³  해석 κ°€λŠ₯ν•œ μ•ˆμ „ 사양에 따라 μž‘λ™ν•˜λŠ” μΆ”λ‘  LLM λͺ¨λ‹ˆν„°λ₯Ό ν›ˆλ ¨ν–ˆμŠ΅λ‹ˆλ‹€. λ°”μ΄μ˜€λ¦¬μŠ€ν¬μ— μ μš©ν–ˆμ„ λ•Œ, 이 λͺ¨λ‹ˆν„°λŠ” μ €ν¬μ˜ 인간 λ ˆλ“œνŒ€ μΊ νŽ˜μΈμ—μ„œ λŒ€ν™”μ˜ μ•½ 99%λ₯Ό μ„±κ³΅μ μœΌλ‘œ νƒμ§€ν–ˆμŠ΅λ‹ˆλ‹€.

μ €ν¬λŠ” ν˜„μž¬κΉŒμ§€ κ°€μž₯ μ—„κ²©ν•œ μ•ˆμ „ ν”„λ‘œκ·Έλž¨μ„ 톡해 두 λͺ¨λΈ λͺ¨λ‘ 슀트레슀 ν…ŒμŠ€νŠΈλ₯Ό κ±°μ³€μŠ΅λ‹ˆλ‹€. μ—…λ°μ΄νŠΈλœ μ€€λΉ„μ„± ν”„λ ˆμž„μ›Œν¬μ— 따라, μ €ν¬λŠ” ν”„λ ˆμž„μ›Œν¬μ—μ„œ λ‹€λ£¨λŠ” μ„Έ κ°€μ§€ 좔적 κ΄€λ¦¬λ˜λŠ” μ—­λŸ‰ μ˜μ—­μΈ 생물학 및 ν™”ν•™, 사이버 λ³΄μ•ˆ, AI μžκ°€ κ°œμ„  μ „λ°˜μ— 걸쳐 o3와 o4-miniλ₯Ό ν‰κ°€ν–ˆμŠ΅λ‹ˆλ‹€. μ΄λŸ¬ν•œ 평가 결과에 κΈ°μ΄ˆν•˜μ—¬, μ €ν¬λŠ” o3와 o4-mini λͺ¨λ‘ μ„Έ λ²”μ£Ό λͺ¨λ‘μ—μ„œ ν”„λ ˆμž„μ›Œν¬μ˜ "λ†’μŒ" μž„κ³„κ°’ λ―Έλ§Œμ„ μœ μ§€ν•œλ‹€κ³  νŒλ‹¨ν–ˆμŠ΅λ‹ˆλ‹€. μ €ν¬λŠ” μ΄λŸ¬ν•œ ν‰κ°€μ˜ 상세 κ²°κ³Όλ₯Ό μ²¨λΆ€λœ μ‹œμŠ€ν…œ μΉ΄λ“œμ— κ²Œμ‹œν–ˆμŠ΅λ‹ˆλ‹€.

Codex CLI: ν„°λ―Έλ„μ—μ„œμ˜ ν”„λ‘ ν‹°μ–΄ μΆ”λ‘ 

μ €ν¬λŠ” λ˜ν•œ μƒˆλ‘œμš΄ μ‹€ν—˜μΈ Codex CLIλ₯Ό κ³΅μœ ν•©λ‹ˆλ‹€. μ΄λŠ” ν„°λ―Έλ„μ—μ„œ μ‹€ν–‰ν•  수 μžˆλŠ” κ²½λŸ‰ μ½”λ”© μ—μ΄μ „νŠΈμž…λ‹ˆλ‹€. μ‚¬μš©μžμ˜ μ»΄ν“¨ν„°μ—μ„œ 직접 μž‘λ™ν•˜λ©° o3 및 o4-mini와 같은 λͺ¨λΈμ˜ μΆ”λ‘  λŠ₯λ ₯을 κ·ΉλŒ€ν™”ν•˜λ„λ‘ μ„€κ³„λ˜μ—ˆμœΌλ©°, GPT-4.1κ³Ό 같은 μΆ”κ°€ API λͺ¨λΈμ— λŒ€ν•œ 지원이 κ³§ 제곡될 μ˜ˆμ •μž…λ‹ˆλ‹€.

μŠ€ν¬λ¦°μƒ·μ΄λ‚˜ 저해상도 μŠ€μΌ€μΉ˜λ₯Ό λͺ¨λΈμ— μ „λ‹¬ν•˜κ³  둜컬 μ½”λ“œμ— μ ‘κ·Όν•˜λŠ” 것과 κ²°ν•©ν•˜μ—¬ λͺ…λ Ήμ€„μ—μ„œ λ©€ν‹°λͺ¨λ‹¬ μΆ”λ‘ μ˜ 이점을 얻을 수 μžˆμŠ΅λ‹ˆλ‹€. μ €ν¬λŠ” 이λ₯Ό λͺ¨λΈκ³Ό μ‚¬μš©μž 및 컴퓨터λ₯Ό μ—°κ²°ν•˜λŠ” μ΅œμ†Œν•œμ˜ μΈν„°νŽ˜μ΄μŠ€λ‘œ μƒκ°ν•©λ‹ˆλ‹€. Codex CLIλŠ” 였늘 github.com/openai/codex(μƒˆ μ°½μ—μ„œ μ—΄λ¦Ό)μ—μ„œ μ™„μ „νžˆ μ˜€ν”ˆμ†ŒμŠ€λ‘œ μ œκ³΅λ©λ‹ˆλ‹€.

이와 ν•¨κ»˜ μ €ν¬λŠ” Codex CLI와 OpenAI λͺ¨λΈμ„ μ‚¬μš©ν•˜λŠ” ν”„λ‘œμ νŠΈλ₯Ό μ§€μ›ν•˜κΈ° μœ„ν•΄ 1백만 λ‹¬λŸ¬ 규λͺ¨μ˜ μ΄λ‹ˆμ…”ν‹°λΈŒλ₯Ό μ‹œμž‘ν•©λ‹ˆλ‹€. μ €ν¬λŠ” API ν¬λ ˆλ”§ ν˜•νƒœλ‘œ 25,000λ‹¬λŸ¬ λ‹¨μœ„μ˜ 보쑰금 μ‹ μ²­μ„œλ₯Ό ν‰κ°€ν•˜κ³  μˆ˜λ½ν•  κ²ƒμž…λ‹ˆλ‹€. μ œμ•ˆμ„œλŠ” μ—¬κΈ°μ—μ„œ μ œμΆœν•  수 μžˆμŠ΅λ‹ˆλ‹€.

μ ‘κ·Όμ„±

ChatGPT Plus, Pro, Team μ‚¬μš©μžλŠ” μ˜€λŠ˜λΆ€ν„° λͺ¨λΈ μ„ νƒκΈ°μ—μ„œ o1, o3-mini, o3-mini-highλ₯Ό λŒ€μ²΄ν•˜λŠ” o3, o4-mini, o4-mini-highλ₯Ό λ³Ό 수 μžˆμŠ΅λ‹ˆλ‹€. ChatGPT Enterprise 및 Edu μ‚¬μš©μžλŠ” 일주일 후에 μ ‘κ·Ό κΆŒν•œμ„ μ–»κ²Œ λ©λ‹ˆλ‹€. 무료 μ‚¬μš©μžλŠ” 질의λ₯Ό μ œμΆœν•˜κΈ° 전에 μž‘μ„±κΈ°μ—μ„œ 'Think'λ₯Ό μ„ νƒν•˜μ—¬ o4-miniλ₯Ό μ‚¬μš©ν•΄ λ³Ό 수 μžˆμŠ΅λ‹ˆλ‹€. λͺ¨λ“  μš”κΈˆμ œμ˜ μ‚¬μš©λŸ‰ μ œν•œμ€ 이전 λͺ¨λΈ μ„ΈνŠΈμ™€ λ™μΌν•˜κ²Œ μœ μ§€λ©λ‹ˆλ‹€.

μ €ν¬λŠ” λͺ‡ μ£Ό μ•ˆμ— μ™„μ „ν•œ 도ꡬ 지원을 κ°–μΆ˜ OpenAI o3-proλ₯Ό μΆœμ‹œν•  κ²ƒμœΌλ‘œ μ˜ˆμƒν•©λ‹ˆλ‹€. ν˜„μž¬ Pro μ‚¬μš©μžλŠ” μ—¬μ „νžˆ o1-pro에 μ ‘κ·Όν•  수 μžˆμŠ΅λ‹ˆλ‹€.

o3와 o4-mini λͺ¨λ‘ μ˜€λŠ˜λΆ€ν„° μ±„νŒ… μ™„μ„± API(Chat Completions API) 및 응닡 API(Responses API)λ₯Ό 톡해 κ°œλ°œμžμ—κ²Œ μ œκ³΅λ©λ‹ˆλ‹€ (일뢀 κ°œλ°œμžλŠ” μ΄λŸ¬ν•œ λͺ¨λΈμ— μ ‘κ·Όν•˜κΈ° μœ„ν•΄ 쑰직 인증(μƒˆ μ°½μ—μ„œ μ—΄λ¦Ό)이 ν•„μš”ν•  수 μžˆμŠ΅λ‹ˆλ‹€). 응닡 APIλŠ” μΆ”λ‘  μš”μ•½, 더 λ‚˜μ€ μ„±λŠ₯을 μœ„ν•΄ ν•¨μˆ˜ 호좜 μ£Όλ³€μ˜ μΆ”λ‘  토큰을 λ³΄μ‘΄ν•˜λŠ” κΈ°λŠ₯을 μ§€μ›ν•˜λ©°, κ³§ λͺ¨λΈμ˜ μΆ”λ‘  λ‚΄μ—μ„œ μ›Ή 검색, 파일 검색, μ½”λ“œ 인터프리터와 같은 λ‚΄μž₯ 도ꡬλ₯Ό 지원할 μ˜ˆμ •μž…λ‹ˆλ‹€. μ‹œμž‘ν•˜λ €λ©΄ 저희 λ¬Έμ„œ(μƒˆ μ°½μ—μ„œ μ—΄λ¦Ό)λ₯Ό νƒμƒ‰ν•˜κ³  더 λ§Žμ€ μ—…λ°μ΄νŠΈλ₯Ό κΈ°λ‹€λ € μ£Όμ‹­μ‹œμ˜€.

λ‹€μŒ 단계

였늘의 μ—…λ°μ΄νŠΈλŠ” 저희 λͺ¨λΈμ΄ λ‚˜μ•„κ°ˆ λ°©ν–₯을 λ°˜μ˜ν•©λ‹ˆλ‹€: μ €ν¬λŠ” o-μ‹œλ¦¬μ¦ˆμ˜ 전문적인 μΆ”λ‘  λŠ₯λ ₯κ³Ό GPT-μ‹œλ¦¬μ¦ˆμ˜ 보닀 μžμ—°μŠ€λŸ¬μš΄ λŒ€ν™” λŠ₯λ ₯ 및 도ꡬ μ‚¬μš©μ„ μœ΅ν•©ν•˜κ³  μžˆμŠ΅λ‹ˆλ‹€. μ΄λŸ¬ν•œ 강점을 ν†΅ν•©ν•¨μœΌλ‘œμ¨ μ €ν¬μ˜ 미래 λͺ¨λΈμ€ λŠ₯동적인 도ꡬ μ‚¬μš© 및 κ³ κΈ‰ 문제 ν•΄κ²°κ³Ό ν•¨κ»˜ μ›ν™œν•˜κ³  μžμ—°μŠ€λŸ¬μš΄ λŒ€ν™”λ₯Ό 지원할 κ²ƒμž…λ‹ˆλ‹€.

4μ›” 16일 μ—…λ°μ΄νŠΈ: Charxiv-r 및 Mathvista에 λŒ€ν•œ o3 κ²°κ³ΌλŠ” μ›λž˜ 평가에 μ—†μ—ˆλ˜ μ‹œμŠ€ν…œ ν”„λ‘¬ν”„νŠΈ 변경을 λ°˜μ˜ν•˜μ—¬ μ—…λ°μ΄νŠΈλ˜μ—ˆμŠ΅λ‹ˆλ‹€.


o3-pro λͺ‡ μ£Όλ‚΄λ‘œ μΆœμ‹œμ˜ˆμ • γ…γ…Šγ„·γ…γ…Šγ…‡1. OpenAI μƒˆ λͺ¨λΈ o3, o4-mini λ°œν‘œ! 이전보닀 λ‡Œ 더 κ΅΄λ €μ„œ λ˜‘λ˜‘ν•΄μ§ γ„Ήγ…‡γ…‹γ…‹ 2. μˆ˜ν•™/μ½”λ”©/이미지 인식 μ„±λŠ₯ κ°œμ©ŒλŠ”λ° 였λ₯˜ 쀄고 더 λΉ λ₯΄κ³  싸짐; μ§€ 보고 μƒκ°ν•˜κ³  도ꡬ μ•Œμ•„μ„œ μ“°λŠ” κΈ°λŠ₯κΉŒμ§€ γ„·γ„· 3. ν„°λ―Έλ„μš© μ½”λ”© λ„μš°λ―Έ(Codex CLI)도 ν’€μ—ˆκ³  μœ λ£ŒλŠ” λ°”λ‘œ γ„±γ„±, λ¬΄λ£ŒλŠ” o4-mini 맛보기 κ°€λŠ₯.