An analysis of comparing the maximum model sizes attainable through the utilization of either the prevalent BF16 or our FP8 mixed-precision training approach on a cluster of Nvidia H100 GPUs with 80G memory. (์›๋ฌธ)

ย 

80G ๋ฉ”๋ชจ๋ฆฌ๊ฐ€ ์žฅ์ฐฉ๋œ ์—”๋น„๋””์•„ H100 GPU ํด๋Ÿฌ์Šคํ„ฐ์—์„œ ๋„๋ฆฌ ์‚ฌ์šฉ๋˜๋Š”

BF16 ๋˜๋Š” ์œ ๋‹ˆํ‹ฐ์˜ FP8 ํ˜ผํ•ฉ ์ •๋ฐ€๋„ ํ›ˆ๋ จ ๋ฐฉ์‹์„ ์‚ฌ์šฉํ•˜์—ฌ ์–ป์„ ์ˆ˜ ์žˆ๋Š” ์ตœ๋Œ€ ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ๋น„๊ตํ•œ ๋ถ„์„ ๊ฒฐ๊ณผ์ž…๋‹ˆ๋‹ค. (๋ฒˆ์—ญ)


H100 80G ์‚ฌ์šฉํ•  ๋•Œ GPU ๊ฐฏ์ˆ˜๋ณ„ ์ตœ๋Œ€ ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ๋ถ„์„ํ•œ๊ฑฐ๋ผ๊ณ  ๋งˆ์ดํฌ๋กœ์†Œํ”„ํŠธ ๋…ผ๋ฌธ์— ๋‚˜์˜จ๊ฑด๋ฐ

๋ˆˆ๋Œ€์ค‘์œผ๋กœ ๋ดค์„ ๋•Œ


8๊ฐœ - 50B

16๊ฐœ - 110B

32๊ฐœ - 280B

64๊ฐœ - 600B

128๊ฐœ - 1050B =ย 1.05T (1์กฐ ์ด์ƒ)


์ด๋ ‡๊ฒŒ ์ตœ๋Œ€ ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ๊ฐ€์งˆ ์ˆ˜ ์žˆ๋‹ค๋Š”๊ฑด๋ฐ

๊ทธ๋Ÿผ H100 1๋งŒ๊ฐœ๋ฉดย ์ง„์งœ ํŒŒ๋ผ๋ฏธํ„ฐ 100์กฐ๊ฐœ ๋น„๋น„๊ฒ ๋Š”๋ฐ?


์ €๊ฒŒ ์ž์ฒด์ ์œผ๋กœ ์ง„์งœ ์‹คํ—˜์„ ํ•œ๊ฑด์ง€ ์ด๋ก ์ ์ธ ์ˆ˜์น˜์ธ์ง€๋Š” ์ œ๋Œ€๋กœ ์•ˆ๋‚˜์™€์žˆ๋Š”๋ฐ

๋งˆ์†Œ์—์„œ ์ €๋Ÿฐ ํ‘œ๋ฅผ ๊ดœํžˆ ๋งŒ๋“ค์—ˆ์„๋ฆฌ๋Š” ์—†๊ณ 

GPT-5 ์ง„์งœ 100์กฐ๊ฐœ ๋  ์ˆ˜๋„ ์žˆ์„๋“ฏ?