์ตœ๊ทผ ๋Œ€ํ˜• ๋ชจ๋ธ๋“ค์ด ์ž์—ฐ์–ด ์ฒ˜๋ฆฌ์™€ ์ปดํ“จํ„ฐ ๋น„์ „ ๋ถ„์•ผ์—์„œ ํฐ ์ง„์ „์„ ์ด๋ฃจ์—ˆ์ง€๋งŒ, Neural Video Coding (์‹ ๊ฒฝ๋ง ๊ธฐ๋ฐ˜ ๋น„๋””์˜ค ์••์ถ•) ๋ถ„์•ผ์—์„œ๋Š” ์•„์ง ๋งŽ์ด ์—ฐ๊ตฌ๋˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค. ๋ณธ ๋…ผ๋ฌธ์—์„œ๋Š” ์†Œํ˜• ๋ชจ๋ธ์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๋‹ค์–‘ํ•œ ์ฝ”๋”ฉ ์š”์†Œ์˜ ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ํ™•์žฅํ•˜์—ฌ ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์— ๋ฏธ์น˜๋Š” ์˜ํ–ฅ์„ ๋ถ„์„ํ•ฉ๋‹ˆ๋‹ค.

๋˜ํ•œ, CNN(Convolutional Neural Network), CNN-Transformer ํ˜ผํ•ฉํ˜•, Transformer ์•„ํ‚คํ…์ฒ˜ ๋“ฑ์„ ์‚ฌ์šฉํ•˜์—ฌ ๋ชจ๋ธ ๊ตฌ์กฐ๊ฐ€ ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์— ๋ฏธ์น˜๋Š” ์˜ํ–ฅ์„ ํƒ๊ตฌํ•ฉ๋‹ˆ๋‹ค. ์ด๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ 10์–ต ๊ฐœ ์ด์ƒ์˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ๊ฐ€์ง„ ์ฒซ Neural Video Coding ๋ชจ๋ธ์ธ NVC-1B๋ฅผ ์„ค๊ณ„ํ–ˆ์Šต๋‹ˆ๋‹ค. ์‹คํ—˜ ๊ฒฐ๊ณผ, ์ด ๋ชจ๋ธ์€ ์†Œํ˜• ๋ชจ๋ธ๋ณด๋‹ค ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์ด ํฌ๊ฒŒ ํ–ฅ์ƒ๋˜์—ˆ์œผ๋ฉฐ, ์ตœ์ฒจ๋‹จ ์••์ถ• ํšจ์œจ์„ฑ์„ ๋ณด์˜€์Šต๋‹ˆ๋‹ค.

์„ธ ์ค„ ์š”์•ฝ

1. ๋Œ€ํ˜• ๋ชจ๋ธ์€ ์ž์—ฐ์–ด ์ฒ˜๋ฆฌ์™€ ์ปดํ“จํ„ฐ ๋น„์ „์—์„œ ์„ฑ๊ณต์ ์ด์ง€๋งŒ, Neural Video Coding์—์„œ๋Š” ์—ฐ๊ตฌ๊ฐ€ ๋ถ€์กฑํ•ฉ๋‹ˆ๋‹ค.
2. ๋‹ค์–‘ํ•œ ์ฝ”๋”ฉ ์š”์†Œ์˜ ๋ชจ๋ธ ํฌ๊ธฐ์™€ ๊ตฌ์กฐ๋ฅผ ํ™•์žฅํ•˜์—ฌ ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์— ๋ฏธ์น˜๋Š” ์˜ํ–ฅ์„ ๋ถ„์„ํ•ฉ๋‹ˆ๋‹ค.
3. NVC-1B ๋ชจ๋ธ์€ 10์–ต ๊ฐœ ์ด์ƒ์˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ์‚ฌ์šฉํ•ด ์†Œํ˜• ๋ชจ๋ธ๋ณด๋‹ค ๋›ฐ์–ด๋‚œ ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์„ ๋ณด์˜€์Šต๋‹ˆ๋‹ค.

๊ตฌ์ฒด์ ์ธ ์ˆ˜์น˜

NVC-1B ๋ชจ๋ธ์€ ๊ธฐ์กด Neural Video Coding ์†Œํ˜• ๋ชจ๋ธ๋ณด๋‹ค ๋น„๋””์˜ค ์••์ถ• ์„ฑ๋Šฅ์ด 30% ํ–ฅ์ƒ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.


์‹ ๊ฒฝ๋ง์œผ๋กœ ์‹น๋‹ค ์••์ถ•์‹œ์ผœ.