(ํ ์ฌ๋ผ grok์ด๋ ์๊ด์์)
์ ๋งํฌ์์ ์จ๋ณผ ์ ์๋๋ฐ ์ง์ง ์ ์๋ ๋์ด (mixtral 8x7b 32k)
์๋ก์ด ์นฉ์ค๊ณ ๋๋ถ์ ๊ฐ๋ฅํ๋ค๋๋ฐ ์ง์ง ํ์ ์ ์ธ๋ฐ? ๋ฏธ์ณค๋ ธ
์ถ๋ก ์ชฝ์์๋ ํ์ ํ๋ ํฐ์ก๋ค
์ด๋ Groq ํ์ด ์ด๋น ์ฝ 500๊ฐ์ ํ ํฐ์ ์์ฑํ ์ ์๋ LLM(๋ํ ์ธ์ด ๋ชจ๋ธ)์ฉ ๋ง์ถคํ ASIC(Application-Specific Integrated Circuit) ์นฉ์ ๊ฐ๋ฐํ๊ธฐ ๋๋ฌธ์ ๋๋ค.ย
์ด์ ๋นํด ๊ณต๊ฐ์ ์ผ๋ก ์ฌ์ฉ ๊ฐ๋ฅํ ๋ชจ๋ธ ๋ฒ์ ์ธ ChatGPT-3.5๋ ์ด๋น ์ฝ 40๊ฐ์ ํ ํฐ์ ์์ฑํ ์ ์์ต๋๋ค.ย
์ด ๋ชจ๋ธ์ ๊ฐ๋ฐ์์ธ Groq Inc๋ ์ผ๋ฐ์ ์ผ๋ก AI ๋ชจ๋ธ์ ์คํํ๋ ๋ฐ ์ฌ์ฉ๋๋ ํฌ์ํ๊ณ ๊ฐ๋น์ผ ๊ทธ๋ํฝ ์ฒ๋ฆฌ ์ฅ์น(GPU) ๋์ ๋ชจ๋ธ์ ์คํํ๋ ๋ฐ ์ฌ์ฉ๋๋ ์ต์ด์ ์ธ์ด ์ฒ๋ฆฌ ์ฅ์น(LPU)๋ฅผ ๋ง๋ค์๋ค๊ณ ์ฃผ์ฅํฉ๋๋ค.
Groq๋ 2016๋ ์์ย Jonathan Ross๊ฐย ์ค๋ฆฝํ์ต๋๋ค.ย
๊ทธ๋ ์ฒ์์ Google์ TPU(Tensor Processor Unit) ํ๋ก์ ํธ๋ฅผ 20% ํ๋ก์ ํธ๋ก ์์ํ๊ณ ๋์ค์ Groq๋ฅผ ์ค๋ฆฝํ๊ธฐ ์ ์ Google X์ Rapid Eval Team์ ํฉ๋ฅํ์ต๋๋ค.
์ด๊ฑฐ ์ถ๋ก ๋ ๊ฐ๋ฅํจ?
์ถ๋ก (inference) ๋งํ๊ฑด๋ฐ ML์์ ์์ธกํ๋๊ฑธ ๋ณดํต ์ถ๋ก ์ด๋ผ์บ. ๊ทธ๋ฅ ์์ฑ ์๋ ๋นจ๋ผ์ก๋ค๊ณ ์๊ฐํ๋ฏ๋. ํ์ต์ ์ํ๊ณ ์๋ค๋๊ฑฐ๋ณด๋ฉด ์ ๊ฑธ๋ก ํ์ต์ด ๋๋์ง๋ ์์ง ๋ชจ๋ฅด๊ฒ ๋ค
ํ์ต์ ์์ง ์ฟ ๋ค ๋ชป๋ฒ์ด๋จ
๋์์์ธ์ง๋ ๊ฒ์ฆํด๋ด์ผ
๊ทผ๋ฐ ์ ๊ฑฐ ํ์ต์๋ ์ด์ฉํ ์ ์์ง ์๋? ํ์ต๋ ์กด๋ ๋นจ๋ผ์ง์๋?
์ง๊ธ ๋์ ์ค์ธ ์ ๋ค ํ์ต์ ๊ฑฐ์ง๋ค ํฌ๊ธฐํจ ใ ใ ์ถ๋ก ๋ง ๋์ฒดํด๋ ใ ใ ใ ใ ๊ธดํจ
๊ณต์ ๋ต๋ณ์ด ์์. Groq Inc @GroqInc ยท 12h Not at this time. We're focused on speed ultra-low latency with our first generation LPUโข Inference Engine. But who knows, we do have more chip designs coming. ?+
ํธ์ํฐ์ ๋๊ฐ ์ง๋ฌธ ์ด๋ ๊ฒ ํ๊ฑฐ์ ๋ํ ๋ต๋ณ์. Is there any plan for supporting training as well?
์ ํ์ค๋ฆฌ์ฝ๋ ์ถ๋ก ์ ์ผ์ถ ํ์ง๋ง ํ์ต์ ์ข๋ง
ํ์ต์ ๊ฑ GPU์ผ๊ฑธ ์ ๋ฐ๊ฒฝ์ฐ ๋ณดํต์ ์ถ๋ก ์ฉ ์นฉ์ด ๋๋ถ๋ถ
๊ฒ์ฆํด๋ด์ผ ํ๊ธดํ๊ฒ ์ง๋ง ์๋ ์ฅ๋์๋๊ธดํ๋ค
์ค...
๋ญ์ง ๋ชจ๋ฅด๊ฒ ๋๋ฐ ์ฌํผ ์ข์๊ฑฐ ๋์๋ค๋๊ฑฐ๊ฒ ์ง
์ ํํ์ ๋ณด๊ฐ์๋ค ๋ค์ด๋ฉด์ ,๋ฉ๋ชจ๋ฆฌ๊ตฌ์ฑ ๋ฑ...
๊ทธ๋ฆฌ๊ณ ๊ผฌ๋ผ์ง๋ณด๋๊น ๊ตฌ๊ธtpu์ฒ๋ผ ํด๋ผ์ฐ๋ํ์์ผ๋ก ์๋๋ง ํ ์๊ฐ์ธ๊ฐ๋ณด๋ค ใ ใ
์๋น๋์ ์ข๋๋ฏ? ๊ธฐ์กด gpu ์นฉ๋ณด๋ค ์์ฒญ๋๊ฒ ๋น ๋ฅธ ๋ฅ๋ฌ๋ ์ ์ฉ ์นฉ์ด ๋์๋ฒ๋ฆฌ๋ค๋..
์ข์๋จ ใ ใ
์๋น๋์๋ ์ด๋ฏธ ๊ธฐ์กด gpu๋ cpu ์ตํฉ์นฉ ๊ฐ๋ฐํ์
์๋ ๊ทผ๋ฐ ํน๊ฐค ์ค์ผ ๋๋ฆผ? ์ด๊ฑฐ ์ต์ 12์๊ฐ ์ ์ ๋์จ ๋ด์ค์ธ๋ฐ ์ ์ด์ ??
ํฐ๋ณด๋ ์ด๊ฒ ํฐ๋ณด๋ค ใ ใ ใ oai๋ ๊ตฌ๊ธ์์ ์ข ๋ฐฐ์๊ฐ์ผ๋ฉด ์ข๊ฒ ๋ค
LPU ์์ด๋์ด ์ข๋ค... ์ด์ฐจํผ ์์ฆ ๋ค Sequence Modeling์ผ๋ก ๋์ด๊ฐ๋ ์ถ์ธ๋ผ์...
์์ฆ ํ๋ฆ์ด ์ํ์ค๋ก ๋ค์ ๋์ด๊ฐ๋ ์ด์ ๊ฐ ๋ญ์ผ?
sequence modeling์ด ๊ธฐ๋ณธ์ ์ผ๋ก ์ฝ๊ณ CLM + MLM์ ๋น๋กฏํ์ฌ ์ฌ๋ฌ๊ฐ์ง ์ฐ๊ตฌ๊ฐ ๋ง์ด ๋์ด ์์ด์ ์ด๋ฏธ ํ์ค์ ์ธ ๊ธฐ๋ฒ๋ค์ด ๋ง์...
์ด.. ๋ด๊ฐ ์ฉ์ด๊ฐ ์ค๋ฝ๊ฐ๋ฝํด์ ๊ทธ๋ฐ๋ฐ ์ํ์ค๋ชจ๋ธ๋ง์ ์ดํ ์ ์ด ํฌํจ๋ ๊ฐ๋ ์ธ๊ฐ? ๊ทธ๋ฅ ์ํ์ค๋ฐ์ดํฐ ๋ค๋ฃจ๋๊ฑฐ๋ฉด ์ ๋ถ ํฌํจ?
๋ ๋ค์... ๋ฐ์ดํฐ ์์ญ์์๋ ์ํ์ค๋ก ํํํด์ ์ฒ๋ฆฌํ๋ ๊ฒ๊ณผ ์ดํ ์ ๋ฉ์ปค๋์ฆ์ ๊ตฌ์กฐ์ ๊ฐ๋์ด ๋๋ค ์งํ๋๊ณ ์์...
ใ ใ ๋ ๋ ์ดํ ์ ์ด๋ผ๋ ํจ๋ฌ๋ค์์์ ๋ฒ์ด๋์ ๋ค์ RNN๊ณ์ด๋ก ๋์๊ฐ๋ค๋ ์๊ธฐ์ธ์ค ๋ต๋ณ ใณ
ใ ใ mamba/zeta AI๊ฐ ๊ทธ๊ฑฐ ํด๋ณผ๋ ค๊ณ ํ๋ ๊ฑฐ ๊ฐ์๋ฐ.... ๊ฒฐ๊ณผ ๋์ค๊ธฐ ์ ์๋ ์๋จ๋ชปํด...
๊ทธ๋์ ์ผ๋ง๋ก ๋์ฌ๊น
๊ฑ ์ ๋ช ํ์ง์์์ ์ด์ฉ์๊ฐ ์ ์ผ๋ ๋์ฌ์์๋ ์๋ ์๋?
ํ๊ตญ์ด๋ ๋๋ค
๋น ๋ฅด๊ธด ํ๋ฐ ์ค๋ฅ์ฌํจ
๋ฌธ์ ๋ ์นฉ ํ๋ ๋น SRAM ์ฉ๋์ด 200MB ๋ฐ์ ๋์ง ์์ ํฐ ๋ชจ๋ธ์ ๋๋ฆด๋ ค๋ฉด ์๋ฐฑ๊ฐ์ ์นฉ์ ์ฐ๊ฒฐ์์ผ์ผ ํฉ๋๋ค. GPU ๋ช๊ฐ๋ฅผ ์ฐ๊ฒฐํ์ฌ batching์ผ๋ก ์ฌ๋ฌ๋ช ์ ์ ์ ๋ฅผ ๋์์ ์๋น์คํ ์ ์๋๋ฐ ๊ทธ๋ ๊ฒ ์ค์ฉ์ ์ธ ๋ฐฉ๋ฒ์ธ์ง๋ ๋ชจ๋ฅด๊ฒ ์ต๋๋ค.
์จ๋ณด๋ ๋น ๋ฅด๊ธฐ๋งํจ
์ง๊ธ๋ค๊ฐ๋ดค๋๋ฐ ๋๊ธฐ์ ใ ใด ๋ง๋ค ์ฌ๋๋ชฐ๋ฆฐ๋ฏ ใ ใ ใ ใ ใ ใ ใ