NVIDIA, LLM ์ถ๋ก ์ ๊ฐ์ํ๋ TensorRT-LLM ์คํ์์ค ๊ณต๊ฐย
TensorRT ๋ฅ๋ฌ๋ ์ปดํ์ผ๋ฌ์ ์ต์ ํ๋ ์ปค๋, ์ ์ฒ๋ฆฌ/ํ์ฒ๋ฆฌ ๋จ๊ณ, ๋ฉํฐGPU/๋ฉํฐ๋
ธ๋ ํต์ ๊ธฐ๋ณธ์์ ๋ฑ์ ํฌํจ
C++ ์ด๋ CUDA์ ๋ํ ๊น์ ์ง์ ์์ด๋ LLM์ ์ต๊ณ ์ฑ๋ฅ๊ณผ ์ฌ์ฉ์ ์ ์ ๊ธฐ๋ฅ์ ๋น ๋ฅด๊ฒ ์ ๊ณต ๊ฐ๋ฅ
์คํ์์ค ๋ชจ๋์ Python API๋ฅผ ์ ๊ณตํ์ฌ ์ฌ์ฉ ํธ์์ฑ๊ณผ ํ์ฅ์ฑ ์ ๊ณต
Ampere, Lovelace, Hopper GPU ์ง์
H100 ๊ธฐ๋ฐ์ผ๋ก TensorRT-LLM์ ์ ์ฉํ์ฌ ํ
์คํธ ํ์ ๋
GTP-J-6B ๋ ์ถ๋ก ์ฑ๋ฅ 8๋ฐฐ ํฅ์, TCO 5.3๋ฐฐ ๊ฐ์, ์๋์ง ์๋น๋ 5.6๋ฐฐ ๊ฐ์
Llama2 70B ๋ ์ถ๋ก ์ฑ๋ฅ 4.6๋ฐฐ ํฅ์, TCO 3๋ฐฐ ๊ฐ์, ์๋์ง ์๋น๋ 3.2๋ฐฐ ๊ฐ์
In-flight Batching ์ด๋ผ ๋ถ๋ฆฌ๋ ์ต์ ํ๋ ์ค์ผ์ค๋ง ๊ธฐ์ ํฌํจ
TensorRT-LLM์ด ํ์ฌ๋ NVIDIA H100 GPU๋ ์ฌ์ฉ์์๊ฒ ๋ชจ๋ธ ๊ฐ์ค์น๋ฅผ ์๋ก์ด FP8 ํ์์ผ๋ก ์ฝ๊ฒ ๋ณํํ๊ณ ๋ชจ๋ธ์ ์ปดํ์ผํ์ฌ ์ต์ ํ๋ FP8 ์ปค๋์ ์๋์ผ๋ก ํ์ฉํ ์ ์๋ ๊ธฐ๋ฅ์ ์ ๊ณต
Hopper Transformer ์์ง ๊ธฐ์ ์ ํตํด ๊ฐ๋ฅํ๋ฉฐ, ๋ชจ๋ธ ์ฝ๋๋ฅผ ๋ณ๊ฒฝํ ํ์ ์์
ํ์ฌ ์ผ๋ฆฌ์ต์ธ์ค ๊ฐ๋ฅํ๋ฉฐ, ๋ช์ฃผ๋ด๋ก ์ถ์ํ ์์
https://news.hada.io/topic?id=10852
SW์ชฝ์์๋ง ์ต์ ํํด๋ ์ง์ฌ ์ด์ ๋๊ฐ ๋๋ค
GPU ๊ฐ๊ฒฉ๋ง ์ข...
์น๋ค ๊ฐ์์์ผ ์ถ๋ก ๋, ํน์ด์ ๋ - dc App