https://www.aitimes.com/news/articleView.html?idxno=161082

β€œ10μ–΅ λ§€κ°œλ³€μˆ˜ LLM 싀행에 μ „κ΅¬μš© 13μ™€νŠΈ μ „λ ₯이면 좩뢄”13μ™€νŠΈ(W)의 μ „λ ₯만으둜 10μ–΅ λ§€κ°œλ³€μˆ˜ 규λͺ¨μ˜ λŒ€ν˜•μ–Έμ–΄λͺ¨λΈ(LLM)을 μ‹€ν–‰ν•˜λŠ” 방법이 λ“±μž₯ν–ˆλ‹€. μ—”λΉ„λ””μ•„ 'H100'κ³Ό 같은 데이터센터 GPU에 ν•„μš”ν•œ 700W μ „λ ₯보닀 μ•½ 50λ°° 더 νš¨μœ¨μ μ΄λ‹€.ν†°μŠ€ν•˜λ“œμ›¨μ–΄λŠ” 26일(ν˜„μ§€μ‹œκ°„) UC 산타 크루즈 연ꡬ진이 LLM μ‹€ν–‰μ—μ„œ κ°€μž₯ λΉ„μš©μ΄ 많이 λ“œλŠ” μš”μ†Œλ₯Ό μ œκ±°ν•˜λŠ” 방식에 κ΄€ν•œ 논문을 μ•„μΉ΄μ΄λΈŒμ— κ²Œμž¬ν–ˆλ‹€κ³  λ³΄λ„ν–ˆλ‹€.이에 λ”°λ₯΄λ©΄ 연ꡬ진은 LLMμ—μ„œ κ°€μž₯ λΉ„μš©μ΄ 많이 λ“œλŠ” μš”μ†ŒμΈ β€˜ν–‰λ ¬ κ³±μ…ˆ(matrix multiplication)’을 μ œκ±°ν•˜κ³  λ§žμΆ€ν˜• ν•˜λ“œμ›¨μ–΄μ—μ„œ μ•Œκ³ λ¦¬μ¦˜μ„ μ‹€ν–‰ν•˜λ©΄,www.aitimes.com



7ceb8176bd8007f739eb86e547ee706598b19cf72c8a0ff15d62a05f677a80f26629



13μ™€νŠΈ(W)의 μ „λ ₯만으둜 10μ–΅ λ§€κ°œλ³€μˆ˜ 규λͺ¨μ˜ λŒ€ν˜•μ–Έμ–΄λͺ¨λΈ(LLM)을 μ‹€ν–‰ν•˜λŠ” 방법이 λ“±μž₯ν–ˆλ‹€. μ—”λΉ„λ””μ•„ 'H100'κ³Ό 같은 데이터센터 GPU에 ν•„μš”ν•œ 700W μ „λ ₯보닀 μ•½ 50λ°° 더 νš¨μœ¨μ μ΄λ‹€.


ν†°μŠ€ν•˜λ“œμ›¨μ–΄λŠ” 26일(ν˜„μ§€μ‹œκ°„) UC 산타 크루즈 연ꡬ진이 LLM μ‹€ν–‰μ—μ„œ κ°€μž₯ λΉ„μš©μ΄ 많이 λ“œλŠ” μš”μ†Œλ₯Ό μ œκ±°ν•˜λŠ” 방식에 κ΄€ν•œ 논문을 μ•„μΉ΄μ΄λΈŒμ— κ²Œμž¬ν–ˆλ‹€κ³  λ³΄λ„ν–ˆλ‹€.


이에 λ”°λ₯΄λ©΄ 연ꡬ진은 LLMμ—μ„œ κ°€μž₯ λΉ„μš©μ΄ 많이 λ“œλŠ” μš”μ†ŒμΈ β€˜ν–‰λ ¬ κ³±μ…ˆ(matrix multiplication)’을 μ œκ±°ν•˜κ³  λ§žμΆ€ν˜• ν•˜λ“œμ›¨μ–΄μ—μ„œ μ•Œκ³ λ¦¬μ¦˜μ„ μ‹€ν–‰ν•˜λ©΄, 10μ–΅κ°œ λ§€κ°œλ³€μˆ˜ 규λͺ¨μ˜ LLM을 단지 13W의 μ „λ ₯으둜 ꡬ동할 수 μžˆλ‹€λŠ” 것을 λ°œκ²¬ν–ˆλ‹€. μ΄λŠ” 전ꡬ ν•˜λ‚˜λ₯Ό μΌœλŠ” 데 ν•„μš”ν•œ μ—λ„ˆμ§€ 정도이며, 일반적인 ν•˜λ“œμ›¨μ–΄λ³΄λ‹€ 50λ°° 이상 νš¨μœ¨μ μ΄λ‹€.


μ§€κΈˆκΉŒμ§€ LLM을 κ΅¬λ™ν•˜λŠ” 신경망은 λͺ¨λ‘ ν–‰λ ¬ κ³±μ…ˆμ΄λΌλŠ” 기법을 μ‚¬μš©ν–ˆλ‹€.


LLMμ—μ„œλŠ” 단어가 숫자둜 ν‘œν˜„λ˜λ©°, 이 μˆ«μžλ“€μ€ ν–‰λ ¬λ‘œ κ΅¬μ„±λœλ‹€. 행렬은 μ„œλ‘œ κ³±ν•΄μ Έμ„œ μ–Έμ–΄λ₯Ό μƒμ„±ν•˜λ©°, νŠΉμ • λ‹¨μ–΄μ˜ μ€‘μš”μ„±μ„ ν‰κ°€ν•˜κ±°λ‚˜ λ¬Έμž₯μ΄λ‚˜ 단락 λ‚΄μ˜ 단어듀 κ°„μ˜ 관계λ₯Ό κ°•μ‘°ν•˜λŠ” μž‘μ—…μ„ μˆ˜ν–‰ν•œλ‹€.


LLM은 수쑰개의 이런 숫자λ₯Ό ν¬ν•¨ν•˜κ³  μžˆλ‹€. 행렬이 클수둝 신경망이 ν•™μŠ΅ν•  λ‚΄μš©μ΄ λ§Žμ•„μ§€λ©° 계산도 λŠ˜μ–΄λ‚œλ‹€.


μ•Œκ³ λ¦¬μ¦˜μ΄ 행렬을 κ³±ν•˜λ €λ©΄, 이 행렬듀을 μ–΄λ””μ—”κ°€ μ €μž₯ν–ˆλ‹€κ°€ 계산할 λ•Œ λΆˆλŸ¬μ™€μ•Ό ν•œλ‹€. μ΄λŠ” 행렬을 물리적으둜 λΆ„λ¦¬λœ 수백개의 GPU에 μ €μž₯ν•¨μœΌλ‘œμ¨ ν•΄κ²°ν•œλ‹€. μ„œλ‘œ λ‹€λ₯Έ GPU에 μžˆλŠ” ν–‰λ ¬μ˜ 숫자λ₯Ό κ³±ν•˜λ €λ©΄ 데이터 이동이 ν•„μš”ν•˜λ©°, 이 과정이 μ‹ κ²½λ§μ˜ μ‹œκ°„κ³Ό μ—λ„ˆμ§€ λΉ„μš©μ˜ λŒ€λΆ€λΆ„μ„ μ°¨μ§€ν•œλ‹€.



7ceb8176bd8007f739eb86e544ee7065cf520d56f61a0d84bec1dc96cfbe41f047



μ—°κ΅¬μžλ“€μ€ λ™μΌν•œ μ„±λŠ₯κ³Ό 정확성을 μœ μ§€ν•˜λ©΄μ„œ μ‹ κ²½λ§μ—μ„œ ν–‰λ ¬ κ³±μ…ˆμ„ μ œκ±°ν•˜κΈ° μœ„ν•΄ 두가지 방법을 κ²°ν•©ν–ˆλ‹€. λ¨Όμ € ν–‰λ ¬ λ‚΄μ˜ λͺ¨λ“  숫자λ₯Ό -1, 0, 1의 μ„Έ κ°€μ§€ κ°’ 쀑 ν•˜λ‚˜λ‘œ λ³€ν™˜ν–ˆλ‹€. 이λ₯Ό 톡해 숫자λ₯Ό κ³±ν•˜λŠ” λŒ€μ‹ , λ”ν•˜λŠ” λ°©μ‹μœΌλ‘œ 계산이 κ°€λŠ₯ν•΄μ‘Œλ‹€. κ·Έλ‹€μŒ μ‹œκ°„ 기반 계산(time-based computation)을 λ„μž…ν•΄ λ„€νŠΈμ›Œν¬μ— 효과적인 λ©”λͺ¨λ¦¬λ₯Ό 제곡, 더 적은 연산을 μˆ˜ν–‰ν•˜λ©΄μ„œ λΉ λ₯΄κ²Œ λ™μž‘ν•  수 있게 ν–ˆλ‹€.


ν•œ ν–‰λ ¬μ˜ λͺ¨λ“  숫자λ₯Ό λ‹€λ₯Έ ν–‰λ ¬μ˜ λͺ¨λ“  μˆ«μžμ™€ κ³±ν•˜λŠ” 일반적인 방식 λŒ€μ‹ , λ™μΌν•œ μˆ˜ν•™μ  κ²°κ³Όλ₯Ό μ–»κΈ° μœ„ν•œ μ „λž΅μ„ κ°œλ°œν–ˆλ‹€. 이 μ ‘κ·Ό λ°©μ‹μ—μ„œλŠ” 행렬을 겹쳐 놓고 κ°€μž₯ μ€‘μš”ν•œ μ—°μ‚°λ§Œμ„ μˆ˜ν–‰ν•œλ‹€.


연ꡬ진은 "ν–‰λ ¬ κ³±μ…ˆμ— λΉ„ν•΄ μƒλ‹Ήνžˆ κ°€λ²Όμš΄ 방법"이라며 "μš°λ¦¬λŠ” λΉ„μš©μ΄ 덜 λ“œλŠ” μ—°μ‚°μœΌλ‘œ λΉ„μ‹Ό 연산을 λŒ€μ²΄ν–ˆλ‹€"라고 μ„€λͺ…ν–ˆλ‹€.


λ©”νƒ€μ˜ μ΅œμ‹  λͺ¨λΈ '라마 3'와 μžμ‹ λ“€μ˜ λͺ¨λΈμ„ λΉ„κ΅ν–ˆμ„ λ•Œ, 심지어 μˆ˜μ‹­μ–΅ 개의 λͺ¨λΈ λ§€κ°œλ³€μˆ˜ 규λͺ¨μ—μ„œλ„ λ™μΌν•œ μ„±λŠ₯을 달성할 수 μžˆμ—ˆλ‹€κ³  μ „ν–ˆλ‹€.


연ꡬ진은 μžμ‹ λ“€μ˜ 신경망을 GPUμ—μ„œ μž‘λ™ν•˜λ„λ‘ 섀계해 μ˜€ν”ˆ μ†ŒμŠ€λ‘œ κ³΅κ°œν–ˆλ‹€. ν‘œμ€€ GPUμ—μ„œ λ‹€λ₯Έ λͺ¨λΈλ³΄λ‹€ μ•½ 10λ°° 적은 λ©”λͺ¨λ¦¬λ₯Ό μ†ŒλΉ„ν•˜κ³  μ•½ 25% 더 λΉ λ₯΄κ²Œ μž‘λ™ν•˜λŠ” 것을 ν™•μΈν–ˆλ‹€. LLM을 μ‹€ν–‰ν•˜λŠ” 데 ν•„μš”ν•œ λ©”λͺ¨λ¦¬ 양을 μ€„μ΄λŠ” 것은 슀마트폰과 같은 μž‘μ€ λ©”λͺ¨λ¦¬ μž₯μΉ˜μ—μ„œλ„ μ•Œκ³ λ¦¬μ¦˜μ„ 전체 μš©λŸ‰μœΌλ‘œ μ‹€ν–‰ν•  수 μžˆλ‹€λŠ” μ˜λ―Έλ‹€.


κ·ΈλŸ¬λ‚˜ μ—”λΉ„λ””μ•„μ˜ GPU ν•˜λ“œμ›¨μ–΄λŠ” ν–‰λ ¬ κ³±μ…ˆμ— μ΅œμ ν™”λ˜μ–΄ 있기 λ•Œλ¬Έμ—, 연ꡬ진은 μ†ŒλΉ„ μ—λ„ˆμ§€λ₯Ό 더 쀄이기 μœ„ν•΄ 신경망에 μ΅œμ ν™”λœ λ§žμΆ€ν˜• ν•˜λ“œμ›¨μ–΄λ₯Ό μ„€κ³„ν–ˆλ‹€. 연ꡬ진은 FPGAλΌλŠ” ν”„λ‘œκ·Έλž˜λ° κ°€λŠ₯ν•œ 회둜 μœ„μ— λ§žμΆ€ν˜• ν•˜λ“œμ›¨μ–΄ ν”„λ‘œν† νƒ€μž…μ„ κ°œλ°œν–ˆλ‹€.


이 ν•˜λ“œμ›¨μ–΄λ₯Ό μ‚¬μš©ν•˜λ©΄ λͺ¨λΈμ€ 단지 13W의 μ „λ ₯으둜 μ‚¬λžŒμ΄ μ½λŠ” 속도보닀 더 λΉ λ₯΄κ²Œ 단어λ₯Ό 생성할 수 μžˆλ‹€. 반면 GPUλ₯Ό μ‚¬μš©ν•  경우 μ•½ 700W의 μ „λ ₯이 ν•„μš”ν•˜λ‹€.


연ꡬ진은 "ν˜„μž¬μ˜ κ²°κ³ΌλŠ” 맀우 만쑱슀러운 μˆ˜μ€€μ΄μ§€λ§Œ, 더 λ‚˜μ€ κ²°κ³Όλ₯Ό λ§Œλ“œλŠ” 것도 μ–΄λ ΅μ§€λŠ” μ•Šλ‹€"라며 "13W둜 이런 μž‘μ—…μ„ μˆ˜ν–‰ν•  수 μžˆλ‹€λ©΄ 전체 데이터 센터에 ν•΄λ‹Ήν•˜λŠ” μ»΄ν“¨νŒ… μ„±λŠ₯으둜 무엇을 ν•  수 μžˆλŠ”μ§€ 상상해 보라”라고 κ°•μ‘°ν–ˆλ‹€.