์ด๋ฒˆ ํŽธ๋ถ€ํ„ฐ๋Š” ์ž…๋ฌธ์ž๋“ค์—๊ฒŒย ์™ธ๊ณ„์–ด์ฒ˜๋Ÿผ ๋А๊ปด์ง€๋Š” ๊ธฐ๋ฒ•๋“ค์ด ๋งŽ์€๋ฐ, ๊ทธ๋ƒฅ ์ด๋Ÿฐ ๊ฒŒ ์žˆ๋‹ค๋Š” ๊ฒƒ๋งŒ ์•Œ๊ณ  ๋„˜์–ด๊ฐ€์ž.


I. ๋จธ์‹ ๋Ÿฌ๋‹(Machine Learning, ๊ธฐ๊ณ„ํ•™์Šต)



์ง€๋‚œ ํŽธ์—์„œ ์†Œ๊ฐœํ–ˆ๋˜ ์ „๋ฌธ๊ฐ€ ์‹œ์Šคํ…œ์˜ ๋Œ€์•ˆ์œผ๋กœ ๋“ฑ์žฅํ•œ ๋ฐฉ์‹์œผ๋กœ, ๊ธฐ๋ณธ์ ์ธ ๊ทœ์น™๋งŒ ์ฃผ์–ด์ง„ ์ƒํƒœ์—์„œ ์ž…๋ ฅ๋ฐ›์€ ์ •๋ณด๋ฅผ ํ™œ์šฉํ•ด ์Šค์Šค๋กœ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด๋‹ค.


์ธ๊ฐ„์˜ ์ถ”๋ก  ๋ฐ ํ•™์Šต์„ ๋ชจ๋ฐฉํ•œ ๋ฐฉ๋ฒ•์ด๋ผ๊ณ  ๋ณด๋ฉด ๋˜๊ฒ ๋‹ค. ํ•™์Šต์‹œ์ผœ์ฃผ๋Š” ๋ฐ์ดํ„ฐ์˜ ํ’ˆ์งˆ์ด ์ข‹์„์ˆ˜๋ก ๊ฒฐ๊ณผ์˜ ์‹ ๋ขฐ๋„๊ฐ€ ์˜ฌ๋ผ๊ฐ„๋‹ค.


๊ทธ๋ฆฌ๊ณ  ๊ฐ€๋” ํŠน๊ฐค์— ๋น„์Šทํ•œ ๊ทธ๋ฆผ์ด ๋ณด์ด๋Š”๋ฐ, ๊ทธ๋ฆผ์ด ๊ดœํžˆ ์ €๋ ‡๊ฒŒ ์ƒ๊ธด ๊ฒŒ ์•„๋‹ˆ๋‹ค. ๋”ฅ๋Ÿฌ๋‹์ด ๋จธ์‹ ๋Ÿฌ๋‹์˜ ์ผ์ข…์ด๊ณ  ๋จธ์‹ ๋Ÿฌ๋‹์ด ์ธ๊ณต์ง€๋Šฅ ๊ธฐ๋ฒ•์˜ ์ผ์ข…์ด๋‹ค. ํฌํ•จ ๊ด€๊ณ„์ธ ์…ˆ.



1. ๋ถ„๋ฅ˜

ย 

๋ ˆ์ด๋ธ”(label)์ด ์กด์žฌํ•˜๋Š”์ง€ ์—ฌ๋ถ€์— ๋”ฐ๋ผ ์ง€๋„ํ•™์Šต๊ณผ ๋น„์ง€๋„ํ•™์Šต์œผ๋กœ ๋‚˜๋ˆˆ๋‹ค. ๋ ˆ์ด๋ธ”์€ โ€˜ํŠน์ง•์ด ์ •ํ•ด์ง„ ๋ฐ์ดํ„ฐโ€™๋กœ, ๋‹ค์Œ ๋ฌธ์žฅ์˜ ๋น„์œ ์—์„œ โ€˜๋‹ตโ€™ ์ •๋„๋กœ ์ดํ•ดํ•˜๋ฉด ๋˜๊ฒ ๋‹ค.

ย 

(1) ์ง€๋„ํ•™์Šต(Supervised Learning): ๋น„์œ ํ•˜์ž๋ฉด, ๋ฌธ์ œ์™€ ๋‹ต์„ ๋ชจ๋‘ ์•Œ๋ ค์ฃผ๋Š” ๋ฐฉ์‹. ๋‹น์—ฐํžˆ ์•Œ๋ ค์ฃผ๋Š” ๊ฑด ์‚ฌ๋žŒ์ด ํ•˜๊ธฐ ๋•Œ๋ฌธ์— ์ธ๊ฑด๋น„ ์ธก๋ฉด์—์„œ๋“ , ๋ฐ์ดํ„ฐ์–‘ ์ธก๋ฉด์—์„œ๋“  ๋น„ํšจ์œจ์ ์ด๋‹ค.

ย 

์ข…๋ฅ˜๋กœ๋Š” ๋ถ„๋ฅ˜(Classification)์™€ ํšŒ๊ท€(Regression)๊ฐ€ ์žˆ๋‹ค. (์›นํˆฐ/์›น์†Œ์„ค์— ๋‚˜์˜ค๋Š” ํšŒ๊ท€(go back)๊ฐ€ ์•„๋‹ˆ๋‹ค)

ย 

๋ถ„๋ฅ˜๋Š” ์ด์‚ฐ์ (discrete), ํšŒ๊ท€๋Š” ์—ฐ์†์ (continuous) ๋ฐ์ดํ„ฐ๋ฅผ ํ™œ์šฉํ•˜๋Š” ๊ฐœ๋…์ธ๋ฐ, ์—„๋ฐ€ํ•˜๊ฒŒ ๋งํ•˜์ง€ ์•Š๊ณ  ์•Œ๊ธฐ ์‰ฝ๊ฒŒ ๋งํ•˜์ž๋ฉด, ์…€ ์ˆ˜ ์žˆ๋Š” ๊ฒƒ์€ ์ด์‚ฐ์ , ์…€ ์ˆ˜ ์—†๋Š” ๊ฒƒ์€ ์—ฐ์†์ ์ด๋‹ค. ์‚ฌ๊ณผ๊ฐ€ ์–ด๋А ๋†์žฅ์—์„œ ์ƒ์‚ฐ๋˜์—ˆ๋Š”์ง€๋Š” ์ด์‚ฐ์ ์ธ ๊ฐœ๋…์ด๊ณ  (A๋†์žฅ/B๋†์žฅ/C๋†์žฅ), ๋ช‡ kg์ธ์ง€๋Š” ์—ฐ์†์ ์ธ ๊ฐœ๋…์ด๋‹ค(3.000203024953...kg).

ย 

ย  (a) ๋ถ„๋ฅ˜๋Š” ์ผ์ƒ์—์„œ ์ ‘ํ•˜๊ธฐ ์‰ฝ๋‹ค ๋ณด๋‹ˆ๊นŒ ๋งŽ์ด ์“ฐ์ด๋Š”๋ฐ, ๋กœ์ง€์Šคํ‹ฑ ํšŒ๊ท€๋ฒ•(๋‹จ์ผ์ธต ์‹ ๊ฒฝ๋ง), k-NN(k-Nearest Neighborhood), SVM(Support Vector Machine), ์˜์‚ฌ ๊ฒฐ์ • ํŠธ๋ฆฌ, ๋‹ค์ธต์‹ ๊ฒฝ๋ง ๋“ฑ์˜ ๊ธฐ๋ฒ•์ด ์“ฐ์ธ๋‹ค. ์–ด์ง€๊ฐ„ํ•˜๋ฉด ๋‹ค ์ด์ชฝ์ธ๋“ฏ... ๋กœ์ง€์Šคํ‹ฑ ํšŒ๊ท€๋ฒ•์€ ํšŒ๊ท€๊ฐ€ ์•„๋‹ˆ๋ผ ๋ถ„๋ฅ˜์— ์†ํ•œ๋‹ค. ๋ถ„๋ฅ˜ ๊ธฐ๋ฒ•์€ ๋ฒˆํ˜ธํŒ/์–ผ๊ตด/์Œ์„ฑ ์ธ์‹ ๋“ฑ์— ํ™œ์šฉ๋œ๋‹ค๊ณ  ํ•œ๋‹ค.


<k-NN(k-Nearest Neighborhood)>

ํ•˜๋‚˜๋ฅผ ๊ณจ๋ผ์„œ ์†Œ๊ฐœํ•˜์ž๋ฉด, ์ด ๊ธฐ๋ฒ•์€ ์ƒˆ๋กœ์šดย ๋ฐ์ดํ„ฐ๋ฅผ ์–ด๋А ์ชฝ์œผ๋กœ ๋ถ„๋ฅ˜ํ•˜๋А๋ƒ๋ฅผ ๊ฒฐ์ •ํ•˜๋Š” ๋ฐฉ์‹์ด๋‹ค. ๊ทธ๋ฆผ์„ ๋ณด๊ณ  ์ง๊ด€์ ์œผ๋กœ ์ดํ•ดํ•  ์ˆ˜ ์žˆ์œผ๋ฆฌ๋ผ ์ƒ๊ฐํ•œ๋‹ค. '๋™์ '์„ ํ”ผํ•˜๊ธฐ ์œ„ํ•ด k์˜ ๊ฐ’์€ ํ™€์ˆ˜๋กœ ์„ค์ •ํ•˜๋ฉฐ, k์˜ ๊ฐ’์„ ์ž˜ ์„ค์ •ํ•ด์•ผ ํ•œ๋‹ค. ์œ„ ๊ทธ๋ฆผ๋งŒ ๋ด๋„ k=3์ผ ๋•Œ๋Š” '?' ๋ฐ์ดํ„ฐ๊ฐ€ B๊ตฐ์œผ๋กœ ๋ถ„๋ฅ˜๋˜๋Š”๋ฐ k=7์ผ ๋•Œ๋Š” A๊ตฐ์œผ๋กœ ๋ถ„๋ฅ˜๋œ๋‹ค.


ย  (b) ํšŒ๊ท€๋Š” ์—ฌ๋Ÿฌ ๊ฐœ์˜ ๋ฐ์ดํ„ฐ๋ฅผ ๊ฐ€์žฅ ์ž˜ ์„ค๋ช…ํ•˜๋Š” ์ง์„ /๊ณก์„ ์„ ๊ทธ๋ฆฌ๋Š” ๊ธฐ๋ฒ•์ด๋‹ค. ์ผ๋ฐ˜ ์„ ํ˜• ํšŒ๊ท€ ๋“ฑ์˜ ๊ธฐ๋ฒ•์ด ์žˆ๋‹ค. ์•„๋ž˜ ๊ทธ๋ฆผ์„ ๋ณด๋ฉด ์ง๊ด€์ ์œผ๋กœ ์ดํ•ด๊ฐ€ ๋  ๊ฒƒ์ด๋‹ค.



(2) ๋น„์ง€๋„ํ•™์Šต(Unsupervised Learning, ์ž์œจํ•™์Šต): ๋น„์œ ํ•˜์ž๋ฉด, ๋ฌธ์ œ๋งŒ ์ฃผ๊ณ  ๋‹ต์€ ์ปดํ“จํ„ฐ๊ฐ€ ์•Œ์•„์„œ ์ฐพ๋„๋ก ํ•˜๋Š” ๋ฐฉ์‹. โ€˜์•ž์œผ๋กœ ๋จธ์‹ ๋Ÿฌ๋‹์ด ๋‚˜์•„๊ฐˆ ๋ฐฉํ–ฅ.โ€™

ย 

์ข…๋ฅ˜๋กœ๋Š” ๊ตฐ์ง‘ํ™”(Clustering, ํด๋Ÿฌ์Šคํ„ฐ๋ง) ๋“ฑ์ด ์žˆ๋‹ค. ์‹ค์ƒํ™œ ์˜ˆ์‹œ๋ฅผ ๋“ค๋ฉด SNS ์‚ฌ์ง„๋“ค์„ ์ž๋™์œผ๋กœ ๋ถ„๋ฅ˜ํ•˜๋Š” ํ”„๋กœ๊ทธ๋žจ ๋“ฑ์— ์“ฐ์ธ๋‹ค. ์ง๊ด€์ ์œผ๋กœ ์„ค๋ช…ํ•˜์ž๋ฉด ์•„๋ž˜ ๊ทธ๋ฆผ ๊ฐ™์€ ๊ฑฐ. ๋ฐ์ดํ„ฐ๋ฅผ ๊ตฐ์ง‘ํ™”ํ•˜์—ฌ ๋ถ„๋ฅ˜ํ•œ๋‹ค.


ย 

(3) ๊ฐ•ํ™”ํ•™์Šต(Reinforcement Learning): ํ˜„์žฌ์˜ ์ƒํƒœ์—์„œ ์–ด๋–ค ํ–‰๋™์„ ์ทจํ•˜๋Š” ๊ฒƒ์ด ์ตœ์ ์ธ๊ฐ€? ํ–‰๋™์„ ์ทจํ•  ๋•Œ๋งˆ๋‹ค ๋ณด์ƒ์ด ์ฃผ์–ด์ง€๋Š”๋ฐ, ๋ณด์ƒ์„ ์ตœ๋Œ€ํ™”ํ•˜๋Š” ๋ฐฉํ–ฅ์œผ๋กœ ํ•™์Šต์ด ์ง„ํ–‰๋œ๋‹ค. ์œ„ ๋‘ ํ•™์Šต๊ณผ ๋‹ค๋ฅด๊ฒŒ ์‹ค์‹œ๊ฐ„ ํ•™์Šต์ด๋ผ๋Š” ์ ์ด ํŠน์ง•.

์ง๊ด€์ ์ธ ์˜ˆ์‹œ๋ฅผ ๋“ค๋ฉด ์ฒด์Šค ๊ฐ™์€ ๋ณด๋“œ๊ฒŒ์ž„์„ ์ƒ๊ฐํ•ด๋ณผ ์ˆ˜ ์žˆ๋‹ค. ์ฒด์Šค์—์„œ ์ƒ๋Œ€ ๋ง์„ ์žก๋Š” ๊ฒƒ, ๊ฒŒ์ž„์—์„œ ์ด๊ธฐ๋Š” ๊ฒƒ ๋“ฑ์ด ๋ณด์ƒ์ด๋ผ๊ณ  ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

ย 

๋ฌธ์ œ๋Š” ์ง€์—ฐ๋œ ๋ณด์ƒ์ด ์žˆ๋‹ค๋Š” ๊ฒƒ. ๋‹น์žฅ ๋‚ด ๋ง์ด ์ฃฝ์–ด๋„ ๊ทธ๊ฒƒ์œผ๋กœ ์ธํ•ด ๊ฒŒ์ž„์—์„œ ์ด๊ธธ ์ˆ˜ ์žˆ๋‹ค๋ฉด ์ข‹์€ ๊ฒƒ์ด์ง€๋งŒ, ์‹ค์‹œ๊ฐ„ ํ•™์Šต์„ ํ•˜๋Š” ์ปดํ“จํ„ฐ๊ฐ€ ๊ทธ๊ฑธ ์•Œ ๋ฆฌ๊ฐ€ ์—†๋‹ค. ๊ทธ๋ฆฌ๊ณ  ๊ฒฐ๊ตญ ๋ง์„ ์‚ด๋ฆฌ๋ ค๋‹ค๊ฐ€ ๊ฒŒ์ž„์„ ์ง€๊ฒŒ ๋œ๋‹ค.

ย 

์ด ์ง€์—ฐ๋œ ๋ณด์ƒ๊ณผ ๊ด€๋ จ๋œ ๋ฌธ์ œ ๋•Œ๋ฌธ์—, ์œ„ ๋‘ ํ•™์Šต์— ๋น„ํ•ด ํ›จ์”ฌ ์–ด๋ ต๋‹ค.

ย 

ย 

2. ๋จธ์‹ ๋Ÿฌ๋‹์˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜

ย 

๋‚˜๋ฌด์œ„ํ‚ค์—์„œ๋Š” ๊ฒฝ์‚ฌ/๊ธฐ์šธ๊ธฐ ํ•˜๊ฐ•๋ฒ•(Gradient Descent), ํšŒ๊ท€๊ธฐ๋ฒ•, ํ™•๋ฅ  ๊ธฐ๋ฐ˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜, ๊ธฐํ•˜ ๊ธฐ๋ฐ˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜, ์•™์ƒ๋ธ” ๊ธฐ๋ฐ˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜ ๋“ฑ์œผ๋กœ ๋‚˜๋ˆ„์–ด์„œ ์†Œ๊ฐœํ•˜๊ณ  ์žˆ๋‹ค.

ย 

๊ตฌ์ฒด์ ์œผ๋กœ๋Š”

(a) ๊ฒฝ์‚ฌ/๊ธฐ์šธ๊ธฐ ํ•˜๊ฐ•๋ฒ•

(b) ํšŒ๊ท€๊ธฐ๋ฒ•: ์„ ํ˜• ํšŒ๊ท€๋ฒ•, ๋กœ์ง€์Šคํ‹ฑ ํšŒ๊ท€๋ฒ•(๋‹จ์ผ์ธต ์‹ ๊ฒฝ๋ง), ์ธ๊ณต์‹ ๊ฒฝ๋ง, ๋”ฅ๋Ÿฌ๋‹ ๋“ฑ

(c) ํ™•๋ฅ  ๊ธฐ๋ฐ˜: NBC, HMM

(d) ๊ธฐํ•˜ ๊ธฐ๋ฐ˜: K-Means Clustering, k-NN, SVM ๋“ฑ

(e) ์•™์ƒ๋ธ” ๊ธฐ๋ฐ˜: Boosting, Bagging ๋“ฑ


์ผ๋‹จ (d)๊ฐ€ ๊ธฐํ•˜ ๊ธฐ๋ฐ˜์ด๋ผ๋Š” ๊ฒƒ์€, ์œ„์—์„œ k-NN์™€ Clustering ๊ทธ๋ฆผ์„ ๋‹ค์‹œ ๋ณด๋ฉด ์ง๊ด€์ ์œผ๋กœ ์™€ ๋‹ฟ์„ ๊ฒƒ์ด๋‹ค.


์ด ์นผ๋Ÿผ์—์„œ๋Š” (c), (e)๋Š”ย ๋”ฐ๋กœ ์„ค๋ช…ํ•˜์ง€ ์•Š์„ ๊ฒƒ์ด๊ณ , (a)์™€ (b)๋Š” ์ดํ›„ย ์†Œ๊ฐœํ•˜๊ฒ ๋‹ค.


์ƒ๊ฐ๋ณด๋‹ค ์ธ๊ณต์ง€๋Šฅ๊ณผ ๋จธ์‹ ๋Ÿฌ๋‹์„ ์†Œ๊ฐœํ•˜๋Š” ๋ถ„๋Ÿ‰์ด ๋งŽ์ด ๋“ค์–ด๊ฐ€์„œ ๊ณ„์‚ฐ์ด ์™„์ „ํžˆ ์–ด๊ธ‹๋‚˜๋ฒ„๋ ธ๋‹ค. 7ํŽธ ํ•˜๋‚˜๋งŒ ๊ฐ€์ง€๊ณ ๋Š” ๋ถ„๋Ÿ‰์ƒ ๋‹ต์ด ์—†๋‹ค. ๊ทธ๋ž˜์„œ 10ํŽธ์„ ์‘์šฉ์‚ฌ๋ก€ ์นผ๋Ÿผ์œผ๋กœ ์“ฐ๋ ค๋˜ ๊ฑธ ํฌ๊ธฐํ•˜๊ณ  ๊ฐœ๋… ์นผ๋Ÿผ์œผ๋กœ ํ™œ์šฉํ•˜๋„๋ก ํ•˜๊ฒ ๋‹ค.




๋‹ค์Œ์€ ๋จธ์‹ ๋Ÿฌ๋‹ ๊ด€๋ จ ๊ธฐ์‚ฌ์˜ ๋งํฌ๋‹ค. ์—ด์‹ฌํžˆ ์ •๋ณด๊ธ€์„ ๊ฐ€์ ธ์˜ค์‹œ๋Š” ๋ถ„์ด ์ตœ๊ทผ ๋“ค๊ณ  ์˜ค์…จ๋˜ ๊ฒƒ์œผ๋กœ ๊ธฐ์–ตํ•œ๋‹ค.


์œ„ ๊ทธ๋ฆผ๋“ค์„ ๋ณด๊ณ  ์ด ๊ธฐ์‚ฌ์˜ ๊ทธ๋ฆผ์„ ๋ณด๋ฉด ๋ญ”๊ฐ€ ์ต์ˆ™ํ•˜๊ฒŒ ๋ณด์ผ์ง€๋„?

๊ธ‰์„ฑ๋ฐฑํ˜ˆ๋ณ‘ ์ง„๋‹จ ์ •ํ™•๋„ 99.1% AI ๋ชจ๋ธ ๊ฐœ๋ฐœ