NVIDIA, LLM ์ถ”๋ก ์„ ๊ฐ€์†ํ•˜๋Š” TensorRT-LLM ์˜คํ”ˆ์†Œ์Šค ๊ณต๊ฐœย 

TensorRT ๋”ฅ๋Ÿฌ๋‹ ์ปดํŒŒ์ผ๋Ÿฌ์™€ ์ตœ์ ํ™”๋œ ์ปค๋„, ์ „์ฒ˜๋ฆฌ/ํ›„์ฒ˜๋ฆฌ ๋‹จ๊ณ„, ๋ฉ€ํ‹ฐGPU/๋ฉ€ํ‹ฐ๋…ธ๋“œ ํ†ต์‹  ๊ธฐ๋ณธ์š”์†Œ ๋“ฑ์„ ํฌํ•จ

C++ ์ด๋‚˜ CUDA์— ๋Œ€ํ•œ ๊นŠ์€ ์ง€์‹ ์—†์ด๋„ LLM์— ์ตœ๊ณ  ์„ฑ๋Šฅ๊ณผ ์‚ฌ์šฉ์ž ์ •์˜ ๊ธฐ๋Šฅ์„ ๋น ๋ฅด๊ฒŒ ์ œ๊ณต ๊ฐ€๋Šฅ

์˜คํ”ˆ์†Œ์Šค ๋ชจ๋“ˆ์‹ Python API๋ฅผ ์ œ๊ณตํ•˜์—ฌ ์‚ฌ์šฉ ํŽธ์˜์„ฑ๊ณผ ํ™•์žฅ์„ฑ ์ œ๊ณต

Ampere, Lovelace, Hopper GPU ์ง€์›

H100 ๊ธฐ๋ฐ˜์œผ๋กœ TensorRT-LLM์„ ์ ์šฉํ•˜์—ฌ ํ…Œ์ŠคํŠธ ํ–ˆ์„ ๋•Œ
GTP-J-6B ๋Š” ์ถ”๋ก  ์„ฑ๋Šฅ 8๋ฐฐ ํ–ฅ์ƒ, TCO 5.3๋ฐฐ ๊ฐ์†Œ, ์—๋„ˆ์ง€ ์†Œ๋น„๋Ÿ‰ 5.6๋ฐฐ ๊ฐ์†Œ

Llama2 70B ๋Š” ์ถ”๋ก  ์„ฑ๋Šฅ 4.6๋ฐฐ ํ–ฅ์ƒ, TCO 3๋ฐฐ ๊ฐ์†Œ, ์—๋„ˆ์ง€ ์†Œ๋น„๋Ÿ‰ 3.2๋ฐฐ ๊ฐ์†Œ

In-flight Batching ์ด๋ผ ๋ถˆ๋ฆฌ๋Š” ์ตœ์ ํ™”๋œ ์Šค์ผ€์ค„๋ง ๊ธฐ์ˆ  ํฌํ•จ
TensorRT-LLM์ด ํƒ‘์žฌ๋œ NVIDIA H100 GPU๋Š” ์‚ฌ์šฉ์ž์—๊ฒŒ ๋ชจ๋ธ ๊ฐ€์ค‘์น˜๋ฅผ ์ƒˆ๋กœ์šด FP8 ํ˜•์‹์œผ๋กœ ์‰ฝ๊ฒŒ ๋ณ€ํ™˜ํ•˜๊ณ  ๋ชจ๋ธ์„ ์ปดํŒŒ์ผํ•˜์—ฌ ์ตœ์ ํ™”๋œ FP8 ์ปค๋„์„ ์ž๋™์œผ๋กœ ํ™œ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ๊ธฐ๋Šฅ์„ ์ œ๊ณต

Hopper Transformer ์—”์ง„ ๊ธฐ์ˆ ์„ ํ†ตํ•ด ๊ฐ€๋Šฅํ•˜๋ฉฐ, ๋ชจ๋ธ ์ฝ”๋“œ๋ฅผ ๋ณ€๊ฒฝํ•  ํ•„์š” ์—†์Œ
ํ˜„์žฌ ์–ผ๋ฆฌ์–ต์„ธ์Šค ๊ฐ€๋Šฅํ•˜๋ฉฐ, ๋ช‡์ฃผ๋‚ด๋กœ ์ถœ์‹œํ•  ์˜ˆ์ •

https://news.hada.io/topic?id=10852

NVIDIA, LLM ์ถ”๋ก ์„ ๊ฐ€์†ํ•˜๋Š” TensorRT-LLM ์˜คํ”ˆ์†Œ์Šค ๊ณต๊ฐœ | GeekNewsTensorRT ๋”ฅ๋Ÿฌ๋‹ ์ปดํŒŒ์ผ๋Ÿฌ์™€ ์ตœ์ ํ™”๋œ ์ปค๋„, ์ „์ฒ˜๋ฆฌ/ํ›„์ฒ˜๋ฆฌ ๋‹จ๊ณ„, ๋ฉ€ํ‹ฐGPU/๋ฉ€ํ‹ฐ๋…ธ๋“œ ํ†ต์‹  ๊ธฐ๋ณธ์š”์†Œ ๋“ฑ์„ ํฌํ•จC++ ์ด๋‚˜ CUDA์— ๋Œ€ํ•œ ๊นŠ์€ ์ง€์‹ ์—†์ด๋„ LLM์— ์ตœ๊ณ  ์„ฑ๋Šฅ๊ณผ ์‚ฌ์šฉ์ž ์ •์˜ ๊ธฐ๋Šฅ์„ ๋น ๋ฅด๊ฒŒ ์ œ๊ณต ๊ฐ€๋Šฅ์˜คํ”ˆ์†Œ์Šค ๋ชจ๋“ˆ์‹ Python API๋ฅผ ์ œ๊ณตํ•˜์—ฌ ์‚ฌ์šฉ ํŽธ์˜์„ฑ๊ณผ ํ™•์žฅ์„ฑ ์ œ๊ณตAmpere, Lovelace, Hopper GPU ์ง€์›H100 ๊ธฐ๋ฐ˜news.hada.io



SW์ชฝ์—์„œ๋งŒ ์ตœ์ ํ™”ํ•ด๋„ ์ง„์‹ฌ ์ด์ •๋„๊ฐ€ ๋˜๋„ค

GPU ๊ฐ€๊ฒฉ๋งŒ ์ข€...