https://www.aitimes.com/news/articleView.html?idxno=163221

'4λŒ€ ν”„λ‘ ν‹°μ–΄ λͺ¨λΈ' μˆœμœ„λ₯Ό λ½‘μ•˜λ”λ‹ˆ...메타, μ˜€ν”ˆAIΒ·μ•€νŠΈλ‘œν”½ μ„±λŠ₯에 κ·Όμ ‘4λŒ€ 인곡지λŠ₯(AI) 기업인 μ˜€ν”ˆAI와 μ•€νŠΈλ‘œν”½, ꡬ글, λ©”νƒ€μ˜ 첨단 λŒ€ν˜•μ–Έμ–΄λͺ¨λΈ(LLM)에 λŒ€ν•œ 뢀문별 벀치마크 ν…ŒμŠ€νŠΈ 점수λ₯Ό μ’…ν•©ν•œ μˆœμœ„κ°€ λ‚˜μ™”λ‹€. μƒˆλ‘œμš΄ 벀치마크λ₯Ό μ‹€μ‹œν•œ 것이 μ•„λ‹ˆλΌ 각 사가 λ³„λ„λ‘œ κ³΅κ°œν•œ 수치λ₯Ό ν•œκ΅°λ° λͺ¨μ•„ λΉ„κ΅ν•œ κ²ƒμœΌλ‘œ, 이런 μ‹œλ„λŠ” μ²˜μŒμ΄λ‹€.λ§ˆν¬ν…Œν¬ν¬μŠ€νŠΈλŠ” 8일(ν˜„μ§€μ‹œκ°„) 2024년에 μˆ˜ν–‰λœ 각쒅 벀치마크 κ²°κ³Όλ₯Ό ν† λŒ€λ‘œ λ©€ν‹°νƒœμŠ€ν¬ μΆ”λ‘ (MMLU), μ½”λ”© 정확도(HumanEval), μˆ˜ν•™μ  λŠ₯μˆ™λ„(MATH), μ§€μ—° μ‹œκ°„ λ“± 13개 μ§€ν‘œμ— λŒ€ν•œ μ˜€ν”ˆAI, μ•€νŠΈλ‘œν”½, ꡬ글, λ©”νƒ€μ˜ LLM μˆœμœ„λ₯Ό κ³΅κ°œν–ˆλ‹€.κ·Έwww.aitimes.com





4λŒ€ 인곡지λŠ₯(AI) 기업인 μ˜€ν”ˆAI와 μ•€νŠΈλ‘œν”½, ꡬ글, λ©”νƒ€μ˜ 첨단 λŒ€ν˜•μ–Έμ–΄λͺ¨λΈ(LLM)에 λŒ€ν•œ 뢀문별 벀치마크 ν…ŒμŠ€νŠΈ 점수λ₯Ό μ’…ν•©ν•œ μˆœμœ„κ°€ λ‚˜μ™”λ‹€. μƒˆλ‘œμš΄ 벀치마크λ₯Ό μ‹€μ‹œν•œ 것이 μ•„λ‹ˆλΌ 각 사가 λ³„λ„λ‘œ κ³΅κ°œν•œ 수치λ₯Ό ν•œκ΅°λ° λͺ¨μ•„ λΉ„κ΅ν•œ κ²ƒμœΌλ‘œ, 이런 μ‹œλ„λŠ” μ²˜μŒμ΄λ‹€.


λ§ˆν¬ν…Œν¬ν¬μŠ€νŠΈλŠ” 8일(ν˜„μ§€μ‹œκ°„) 2024년에 μˆ˜ν–‰λœ 각쒅 벀치마크 κ²°κ³Όλ₯Ό ν† λŒ€λ‘œ λ©€ν‹°νƒœμŠ€ν¬ μΆ”λ‘ (MMLU), μ½”λ”© 정확도(HumanEval), μˆ˜ν•™μ  λŠ₯μˆ™λ„(MATH), μ§€μ—° μ‹œκ°„ λ“± 13개 μ§€ν‘œμ— λŒ€ν•œ μ˜€ν”ˆAI, μ•€νŠΈλ‘œν”½, ꡬ글, λ©”νƒ€μ˜ LLM μˆœμœ„λ₯Ό κ³΅κ°œν–ˆλ‹€.


κ·Έ κ²°κ³Ό 압도적인 1μœ„λŠ” λ‚˜μ˜€μ§€ μ•Šμ•˜λ‹€.


'ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈ'λŠ” μ½”λ”©, μ•ˆμ „μ„±, μž₯λ¬Έ μ½˜ν…μΈ  생성 λ“± 6개 λΆ€λ¬Έμ—μ„œ 1μœ„λ₯Ό μ°¨μ§€ν–ˆλ‹€. 이어 'GPT-4o'κ°€ λ©€ν‹°νƒœμŠ€ν¬ μΆ”λ‘ , μˆ˜ν•™μ  λŠ₯λ ₯, λ‹€κ΅­μ–΄ μ„±λŠ₯ λ“± 4개 λΆ€λΆ„ 정상에 μ˜¬λžλ‹€.


ν•˜μ§€λ§Œ 이번 벀치마크의 μŠΉλ¦¬μžλŠ” μ˜€ν”ˆ μ†ŒμŠ€μΈ '라마 3.1 405B'둜 λ³Ό 수 μžˆλ‹€. λΉ„μš©κ³Ό μ§€μ—°μ‹œκ°„μ—μ„œ 졜고λ₯Ό κΈ°λ‘ν–ˆμœΌλ©°, λ‚˜λ¨Έμ§€ λΆ€λΆ„μ—μ„œλ„ 정상과 큰 차이가 λ‚˜μ§€ μ•Šμ•˜λ‹€.


반면, ꡬ글은 κ²½λŸ‰ λͺ¨λΈμΈ 'μ œλ―Έλ‚˜μ΄ 1.5 ν”Œλž˜μ‹œ'κ°€ 비ꡐ λŒ€μƒμ΄λΌ 두각을 λ‚˜νƒ€λ‚΄μ§€ λͺ»ν–ˆλ‹€. μ΄λŠ” 'μ œλ―Έλ‚˜μ΄ 2.0'이 λ‚˜μ˜€κΈ° μ „κΉŒμ§€λŠ” μ–΄μ©” 수 μ—†λŠ” 일이닀.


그만큼 ν”„λ‘ ν‹°μ–΄ λͺ¨λΈμ˜ 경쟁이 갈수둝 μΉ˜μ—΄ν•΄μ‘Œλ‹€λŠ” 사싀을 λ‹€μ‹œ ν™•μΈν•œ μ…ˆμ΄λ‹€.


β–  λ©€ν‹°νƒœμŠ€ν¬ μΆ”λ‘ (MMLU) λΆ€λ¬Έ


MMLU λ²€μΉ˜λ§ˆν¬λŠ” κ³Όν•™, 인문학, μˆ˜ν•™μ„ ν¬ν•¨ν•œ λ‹€μ–‘ν•œ μ£Όμ œμ—μ„œ μ§ˆλ¬Έμ— λ‹΅ν•˜λŠ” AI λͺ¨λΈμ˜ λŠ₯λ ₯을 ν‰κ°€ν•˜λŠ” 포괄적인 ν…ŒμŠ€νŠΈλ‹€. 이 λΆ„μ•Όμ—μ„œ 졜고의 μ„±κ³Όλ₯Ό λ‚΄λŠ” λͺ¨λΈλ“€μ€ λ‹€μ–‘ν•œ μ‹€μ œ 과제λ₯Ό μ²˜λ¦¬ν•  수 μžˆλŠ” λ‹€μž¬λ‹€λŠ₯함을 μž…μ¦ν•œλ‹€.


μ˜€ν”ˆAI의 GPT-4oλŠ” 88.7%의 점수둜 MMLUμ—μ„œ 선두λ₯Ό μ°¨μ§€ν–ˆλ‹€. GPT-4의 강점을 기반으둜 일반적인 μž‘μ—…μ„ μˆ˜ν–‰ν•  수 μžˆλ„λ‘ μ„€κ³„λμœΌλ©°, ν•™μˆ  및 μ „λ¬Έ λΆ„μ•Όμ—μ„œ λ‹€μž¬λ‹€λŠ₯ν•œ λͺ¨λΈλ‘œ 평가받고 μžˆλ‹€.


λ©”νƒ€μ˜ 라마 3.1 405Bκ°€ 88.6%둜 λ°”λ‘œ λ’€λ₯Ό μ«“μ•˜λ‹€. κ²½λŸ‰ν™” μ•„ν‚€ν…μ²˜μž„μ—λ„ λΆˆκ΅¬ν•˜κ³  λ‹€μ–‘ν•œ λΆ„μ•Όμ—μ„œ 경쟁λ ₯ μžˆλŠ” 정확성을 μœ μ§€ν•˜λ©΄μ„œλ„ 효율적인 μ„±λŠ₯을 λ°œνœ˜ν•˜λ„λ‘ 섀계됐닀.


μ•€νŠΈλ‘œν”½μ˜ ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 88.3%의 μ„±μ μœΌλ‘œ 3μœ„μ— 그친 것이 μ˜μ™Έλ‹€.


β–  μ½”λ”©(HumanEval) λΆ€λ¬Έ


ν΄λ‘œλ“œμ˜ μ΅œκ°•μ μ΄ μ½”λ”©μ΄λΌλŠ” 것을 κ°μ•ˆν•˜λ©΄ 이변은 μ—†μ—ˆλ‹€. 휴먼이벨 λ²€μΉ˜λ§ˆν¬λŠ” μ—¬λŸ¬ ν”„λ‘œκ·Έλž˜λ° μž‘μ—…μ—μ„œ λͺ¨λΈμ΄ μ •ν™•ν•œ μ½”λ“œλ₯Ό μƒμ„±ν•˜λŠ” λŠ₯λ ₯을 ν‰κ°€ν•˜λŠ” ν…ŒμŠ€νŠΈλ‹€.


ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 92%의 μ •ν™•λ„λ‘œ, 2μœ„μΈ GPT-4o(90.2%)λ₯Ό μ•žμ„°λ‹€.


μ—¬κΈ°μ—μ„œλ„ 라마 3.1 405Bκ°€ λΆ„λ°œν–ˆλ‹€. 89%의 점수둜, GPT-4o와 1.2%밖에 차이가 λ‚˜μ§€ μ•Šμ•˜λ‹€.





β–  μˆ˜ν•™(MATH) λΆ€λ¬Έ


MATH λ²€μΉ˜λ§ˆν¬λŠ” λ³΅μž‘ν•œ μˆ˜ν•™ 문제λ₯Ό ν•΄κ²°ν•˜κ³  수치 κ°œλ…μ„ μ΄ν•΄ν•˜λŠ” LLM의 λŠ₯λ ₯을 ν…ŒμŠ€νŠΈν•œλ‹€. μ΄λŸ¬ν•œ κΈ°μˆ μ€ 금육, 곡학, κ³Όν•™ 연ꡬ μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ—μ„œ 맀우 μ€‘μš”ν•˜λ‹€.


졜근 '슀트둜베리' λ“± μΆ”λ‘  λŠ₯λ ₯κ°•ν™” κΈ°μˆ μ— 집쀑해 온 μ˜€ν”ˆAiκ°€ μ—­μ‹œ 선두λ₯Ό μ°¨μ§€ν–ˆλ‹€. GPT-4oλŠ” 76.6%의 점수둜 선두닀. 3μœ„λ„ 'GPT-4 터보'λ‹€.


라마 3.1 405BλŠ” 73.8%둜 μ—”νŠΈλ‘œν”½μ΄λ‚˜ ꡬ글을 제치고 2μœ„μ— μ˜¬λžλ‹€. μ΄λŠ” μˆ˜ν•™μ΄ μ€‘μš”ν•œ μ‚°μ—…μ—μ„œ 더 κ°€λ³μ§€λ§Œ 효과적인 λŒ€μ•ˆμœΌλ‘œμ„œμ˜ 잠재λ ₯을 보여쀀닀. λ©”νƒ€λŠ” 논리적 μΆ”λ‘ κ³Ό 수치 정확성이 μš”κ΅¬λ˜λŠ” μž‘μ—…μ—μ„œ μš°μˆ˜ν•œ μ„±κ³Όλ₯Ό λ‚΄κΈ° μœ„ν•΄ μ•„ν‚€ν…μ²˜ μ΅œμ ν™”μ— λ§Žμ€ 투자λ₯Ό ν–ˆλ‹€.


β–  μ§€μ—° μ‹œκ°„(Latency) λΆ€λ¬Έ


μ§€μ—° μ‹œκ°„μ€ μ±—λ΄‡μ΄λ‚˜ 가상 λΉ„μ„œμ™€ 같은 μ‹€μ‹œκ°„ μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ—μ„œ λͺ¨λΈμ΄ μ–Όλ§ˆλ‚˜ λΉ λ₯΄κ²Œ 응닡을 μƒμ„±ν•˜λŠ”μ§€λ₯Ό λ‚˜νƒ€λ‚΄λ©°, 맀우 μ€‘μš”ν•œ μš”μ†Œλ‹€. TTFT(Time to First Token) λ²€μΉ˜λ§ˆν¬λŠ” AI λͺ¨λΈμ΄ ν”„λ‘¬ν”„νŠΈλ₯Ό 받은 ν›„ 첫번째 토큰을 좜λ ₯ν•˜κΈ°κΉŒμ§€μ˜ 속도λ₯Ό μΈ‘μ •ν•œλ‹€.


라마 3.1 8BλŠ” 0.3초의 μ§€μ—° μ‹œκ°„μœΌλ‘œ νƒμ›”ν•œ μ„±λŠ₯을 λ°œνœ˜ν•˜λ©°, 응닡 μ‹œκ°„μ΄ μ€‘μš”ν•œ μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ— 이상적이닀.


'GPT-3.5 터보'λŠ” 0.4초의 μ„±λŠ₯을 보여주며, 속도와 μ •ν™•μ„±μ˜ κ· ν˜•μ„ λ§žμΆ”κ³  μžˆλ‹€. λΉ λ₯Έ μƒν˜Έμž‘μš©μ„ μš°μ„ μ‹œν•˜λ©΄μ„œλ„ 이해λ ₯μ΄λ‚˜ λ³΅μž‘μ„±μ„ 크게 ν¬μƒν•˜μ§€ μ•ŠλŠ” κ°œλ°œμžλ“€μ—κ²Œ 경쟁λ ₯을 μ œκ³΅ν•œλ‹€.


라마 3.1 70B μ—­μ‹œ 0.4초의 μ§€μ—° μ‹œκ°„μ„ 기둝, 메타가 응닡 μ‹œκ°„ μ΅œμ ν™”μ— λ§Žμ€ 투자λ₯Ό ν–ˆμŒμ„ 보여쀬닀.


β–  λΉ„μš©(Cost) λΆ€λ¬Έ


AI 개발 λΉ„μš©μ΄ λ―Όκ°ν•΄μ§€λ©΄μ„œ, λΉ„μš© νš¨μœ¨μ„±μ€ LLM을 μš΄μ˜μ— ν†΅ν•©ν•˜λ €λŠ” 기업듀에 핡심 μš”μ†Œλ‹€.


라마 3.1 8BλŠ” μ‚¬μš© λΉ„μš©μ΄ μž…λ ₯ 토큰 100λ§Œκ°œλ‹Ή 0.05λ‹¬λŸ¬μ™€ 좜λ ₯ 토큰 100λ§Œκ°œλ‹Ή 0.08λ‹¬λŸ¬λ‘œ κ°€μž₯ 높은 λΉ„μš© νš¨μœ¨μ„±μ„ μ œκ³΅ν•œλ‹€.


κ΅¬κΈ€μ˜ 'μ œλ―Έλ‚˜μ΄ 1.5 ν”Œλž˜μ‹œ'κ°€ κ°€μž₯ 돋보인 것도 이 뢀뢄이닀. μž…λ ₯ 0.07λ‹¬λŸ¬μ™€ 좜λ ₯ 0.3λ‹¬λŸ¬ μš”κΈˆμœΌλ‘œ μ œκ³΅λœλ‹€. 또 큰 μ»¨ν…μŠ€νŠΈ 창을 지원해 μƒμ„Έν•œ 뢄석과 λŒ€μš©λŸ‰ 데이터 처리 λŠ₯λ ₯이 ν•„μš”ν•œ 기업에 μ ν•©ν•˜λ‹€.


이듀을 λ”°λΌμž‘κΈ° μœ„ν•΄ 내놓은 'GPT-4o λ―Έλ‹ˆ'λŠ” μž…λ ₯ 0.15λ‹¬λŸ¬μ™€ 좜λ ₯ 0.6λ‹¬λŸ¬λ‘œ 3μœ„μ— μ˜¬λžλ‹€.





β–  μ»¨ν…μŠ€νŠΈ μ°½(Context Window) λΆ€λ¬Έ


LLM의 μ»¨ν…μŠ€νŠΈ 창은 응닡을 생성할 λ•Œ ν•œλ²ˆμ— μ²˜λ¦¬ν•  수 μžˆλŠ” μž…λ ₯ ν…μŠ€νŠΈμ˜ 양을 μ •μ˜ν•œλ‹€. μ»¨ν…μŠ€νŠΈ 창이 큰 λͺ¨λΈμ€ 법λ₯  λ¬Έμ„œ 뢄석, ν•™μˆ  연ꡬ, 고객 μ„œλΉ„μŠ€ λ“± μž₯λ¬Έ 생성 μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ—μ„œ ν•„μˆ˜μ μ΄λ‹€.


μ œλ―Έλ‚˜μ΄ 1.5 ν”Œλž˜μ‹œλŠ” 100만 토큰 처리둜, 이 λΆ„μ•Όμ˜ 압도적 선두닀. 전체 μ±…, 연ꡬ λ…Όλ¬Έ λ˜λŠ” λŒ€κ·œλͺ¨ 고객 μ„œλΉ„μŠ€ 둜그λ₯Ό μž…λ ₯ν•˜λ”λΌλ„ μ»¨ν…μŠ€νŠΈκ°€ λŠκΈ°μ§€ μ•Šκ³ , λŒ€κ·œλͺ¨ ν…μŠ€νŠΈ 생성 μž‘μ—…μ— λŒ€ν•œ μœ μš©μ„±μ„ μ œκ³΅ν•œλ‹€.


ν΄λ‘œλ“œ 3 및 3.5λŠ” 20만 토큰 처리둜 2μœ„, GPT-4 터보와 GPT-4o 계열은 12만8000 ν† ν°μœΌλ‘œ 3μœ„λ‹€. 특히 μ΅œκ·Όμ—λŠ” 12만8000 토큰 제곡이 기본으둜 λ– μ˜€λ₯΄κ³  μžˆλ‹€.


β–  사싀 μ •ν™•μ„±(Factual Accuracy) λΆ€λ¬Έ


사싀 정확성은 LLM이 의료 진단, 법λ₯  λ¬Έμ„œ μš”μ•½, ν•™μˆ  연ꡬ와 같은 지식 쀑심 μž‘μ—…μ—μ„œ 점점 더 많이 μ‚¬μš©λ¨μ— 따라 μ€‘μš”ν•œ μ§€ν‘œκ°€ 됐닀. AI λͺ¨λΈμ΄ ν™˜κ°μ„ μœ λ°œν•˜μ§€ μ•Šκ³  사싀적 정보λ₯Ό κΈ°μ–΅ν•˜λŠ” μ •ν™•λ„λŠ” 신뒰성에 직접적인 영ν–₯을 λ―ΈμΉœλ‹€.


ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 사싀 확인 ν…ŒμŠ€νŠΈμ—μ„œ μ•½ 92.5%의 μ •ν™•λ„λ‘œ λ›°μ–΄λ‚œ μ„±κ³Όλ₯Ό λ³΄μ˜€λ‹€. μ•€νŠΈλ‘œν”½μ€ κ²€μ¦λœ 정보λ₯Ό 기반으둜 효율적이고 μ‹ λ’°ν•  수 μžˆλŠ” λͺ¨λΈμ„ κ΅¬μΆ•ν•˜λŠ” 데 쀑점을 두어, 윀리적 AI μ• ν”Œλ¦¬μΌ€μ΄μ…˜μ— ν•„μˆ˜μ μΈ μš”μ†Œλ‘œ μž‘μš©ν•˜κ³  μžˆλ‹€.


GPT-4oλŠ” 90%의 μ •ν™•λ„λ‘œ λ’€λ₯Ό λ”°λ₯Έλ‹€. μ˜€ν”ˆAI의 λ°©λŒ€ν•œ 데이터셋은 GPT-4oκ°€ μ΅œμ‹ μ˜ μ‹ λ’°ν•  수 μžˆλŠ” 정보 μΆœμ²˜μ—μ„œ 데이터λ₯Ό μΆ”μΆœν•˜λ„λ‘ 도와주며, 연ꡬ μ€‘μ‹¬μ˜ μž‘μ—…μ—μ„œ 특히 μœ μš©ν•˜λ‹€.


라마 3.1 405BλŠ” 88.8%의 정확성을 λ‹¬μ„±ν•˜μ˜€μœΌλ©°, μ΄λŠ” 메타가 데이터셋을 μ •μ œν•˜κ³  λͺ¨λΈμ˜ κΈ°λ°˜μ„ κ°œμ„ ν•˜λŠ” 데 μ§€μ†μ μœΌλ‘œ νˆ¬μžν•œ κ²°κ³Όλ‹€. κ·ΈλŸ¬λ‚˜ 비ꡐ적 덜 μ•Œλ €μ§€κ±°λ‚˜ νŠΉμˆ˜ν•œ μ£Όμ œμ— λŒ€ν•΄ 어렀움을 κ²ͺλŠ” κ²ƒμœΌλ‘œ μ•Œλ €μ Έ μžˆλ‹€.


β–  μ •λ ¬(Alignment) λΆ€λ¬Έ


μ •λ ¬ μ§€ν‘œλŠ” λͺ¨λΈμ˜ 좜λ ₯ κ²°κ³Όκ°€ 사전 μ •μ˜λœ 윀리적 μ§€μΉ¨κ³Ό μ–Όλ§ˆλ‚˜ 잘 μΌμΉ˜ν•˜λŠ”μ§€λ₯Ό ν‰κ°€ν•œλ‹€. 즉, μ•ˆμ „μ„±κ³Ό μ§κ²°λœλ‹€. 이 λΆ„μ•ΌλŠ” μ•€νŠΈλ‘œν”½μ˜ νŠΉκΈ°μ΄κΈ°λ„ ν•˜λ‹€.


μ—­μ‹œ ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈκ°€ 91%의 점수둜 1μœ„λ₯Ό μ°¨μ§€ν–ˆλ‹€. μ˜€ν”ˆAI도 GPT-4o의 89.5%둜 많이 μΆ”κ²©ν–ˆλ‹€.


μ—¬κΈ°μ—μ„œ 라마 3.1 405BλŠ” 87.7%의 점수λ₯Ό λ°›μ•„ 3μœ„μ— 였λ₯Έ 것도 μ£Όλͺ©λœλ‹€.


β–  μ λŒ€μ  ν”„λ‘¬ν”„νŠΈμ— λŒ€ν•œ μ•ˆμ „μ„± λΆ€λ¬Έ


μ •λ ¬μ„± 외에도, LLM은 λͺ¨λΈμ΄ μœ ν•΄ν•˜κ±°λ‚˜ 편ν–₯된, 비논리적인 좜λ ₯을 μƒμ„±ν•˜λ„λ‘ μ„€κ³„λœ 곡격적인 ν”„λ‘¬ν”„νŠΈμ— μ €ν•­ν•΄μ•Ό ν•œλ‹€.


이 뢄야도 1μœ„λŠ” ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈ(93%)λ‹€. GPT-4oλŠ” 90%둜 μ•½κ°„ λ’€μ²˜μ‘ŒμœΌλ©°, 라마 3.1 405BλŠ” 88%의 점수λ₯Ό κΈ°λ‘ν–ˆλ‹€.


β–  λ‹€κ΅­μ–΄ λΆ€λ¬Έ


μ „ μ„Έκ³„μ μœΌλ‘œ LLM μˆ˜μš”κ°€ λ†’μ•„μ§€λ©°, λ‹€κ΅­μ–΄ λŠ₯λ ₯도 비쀑이 μ»€μ‘Œλ‹€. λΉ„μ˜μ–΄κΆŒ μ–Έμ–΄μ—μ„œ 일관성 있고 μ •ν™•ν•˜λ©° λ¬Έλ§₯을 μ΄ν•΄ν•œ 응닡을 μƒμ„±ν•˜λŠ” λŠ₯λ ₯을 ν‰κ°€ν•œλ‹€.


GPT-4oλŠ” XGLUE λ‹€κ΅­μ–΄ λ²€μΉ˜λ§ˆν¬μ—μ„œ 92%λ₯Ό κΈ°λ‘ν•˜λ©° λ‹€κ΅­μ–΄ λŠ₯λ ₯μ—μ„œ 압도적인 μ„±λŠ₯을 λ³΄μ˜€λ‹€. μ˜€ν”ˆAI의 λ‹€μ–‘ν•œ μ–Έμ–΄, λ°©μ–Έ, 지역적 λ¬Έλ§₯에 λŒ€ν•œ 미세쑰정이 λ‹λ³΄μΈλ‹€λŠ” 뢄석이닀.


ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 89%둜 μžμ›μ΄ λΆ€μ‘±ν•œ μ–Έμ–΄μ—μ„œλŠ” μ˜€ν”ˆAi에 λΉ„ν•΄ μ„±λŠ₯이 λ‹€μ†Œ λ–¨μ–΄μ§„λ‹€.


라마 3.1 405BλŠ” 86%둜 μŠ€νŽ˜μΈμ–΄λ‚˜ 쀑ꡭ어, ν”„λž‘μŠ€μ–΄μ™€ 같이 널리 μ‚¬μš©λ˜λŠ” μ–Έμ–΄μ—μ„œ κ°•ν•œ κ²ƒμœΌλ‘œ μ•Œλ €μ‘Œλ‹€.


β–  지식 보유 및 μž₯λ¬Έ 생성 λΆ€λ¬Έ


λŒ€κ·œλͺ¨ μ½˜ν…μΈ  생성에 λŒ€ν•œ μˆ˜μš”κ°€ 증가함에 따라, LLM의 지식 보유 및 μž₯λ¬Έ 생성 λŠ₯λ ₯은 연ꡬ λ…Όλ¬Έ μž‘μ„±, 법λ₯  λ¬Έμ„œ μž‘μ„±, 그리고 연속적인 μ»¨ν…μŠ€νŠΈλ₯Ό μœ μ§€ν•˜λ©° κΈ΄ λŒ€ν™”λ₯Ό μˆ˜ν–‰ν•˜λŠ” λŠ₯λ ₯을 ν‰κ°€ν•œλ‹€.


ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 95%의 점수둜 졜고 자리λ₯Ό μ°¨μ§€ν–ˆλ‹€. 20만 ν† ν°μ˜ 높은 μš©λŸ‰μ„ 톡해, μ»¨ν…μŠ€νŠΈλ₯Ό μžƒμ§€ μ•Šκ³  κ³ ν’ˆμ§ˆμ˜ μž₯λ¬Έ μ½˜ν…μΈ λ₯Ό 생성할 수 μžˆλ‹€.


GPT-4oλŠ” 92%λ‹€. 100만 ν† ν°μ˜ μ»¨ν…μŠ€νŠΈ μ°½ 덕뢄에 κ΄‘λ²”μœ„ν•œ λ¬Έμ„œλ‚˜ λŒ€κ·œλͺ¨ 데이터셋을 ν•œλ²ˆμ— 뢄석할 수 μžˆλŠ” μ œλ―Έλ‚˜μ΄ 1.5 ν”Œλž˜μ‹œκ°€ 91%λ‹€.


β–  제둜 및 퓨샷 ν•™μŠ΅ λΆ€λ¬Έ


μ‹€μ œ μ‹œλ‚˜λ¦¬μ˜€μ—μ„œ LLM은 μ’…μ’… μœ μ‚¬ν•œ μž‘μ—…μ— λŒ€ν•œ λͺ…μ‹œμ μΈ ν•™μŠ΅ 없이 응닡을 μƒμ„±ν•˜λŠ” μ œλ‘œμƒ·μ΄λ‚˜ μ œν•œλœ μž‘μ—… νŠΉμ • 예제만으둜 퓨샷 μž‘μ—…μ„ μˆ˜ν–‰ν•΄μ•Ό ν•œλ‹€.


GPT-4oλŠ” μ œλ‘œμƒ· ν•™μŠ΅μ—μ„œ 88.5%의 μ •ν™•λ„λ‘œ 졜고의 μ„±κ³Όλ₯Ό λ³΄μ˜€λ‹€. ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 86%, 라마 3.1 405BλŠ” 84%이닀.


β–  편견 및 독성 좜λ ₯ λΆ€λ¬Έ


LLM의 윀리적 κ³ λ € 사항, 특히 편ν–₯을 μ΅œμ†Œν™”ν•˜κ³  독성 좜λ ₯을 ν”Όν•˜λŠ” 것이 점점 더 μ€‘μš”ν•΄μ§€κ³  μžˆλ‹€.


이 뢄야도 μ•€νŠΈλ‘œν”½μ˜ 강점이 λ‹λ³΄μ˜€λ‹€. ν΄λ‘œλ“œ 3.5 μ†Œλ„€νŠΈλŠ” 93%의 점수둜 윀리적으둜 κ°€μž₯ μ •λ ¬λœ LLM으둜 인정받고 μžˆλ‹€.


이어 GPT-4oκ°€ 91%, 라마 3.1 405B이 89%둜 λ’€λ₯Ό μ΄μ—ˆλ‹€.