μ΄ˆλŒ€κ·œλͺ¨ AI ν•˜μ΄νΌν΄λ‘œλ°”λ₯Ό AI μŒμ„±μΈμ‹ μ—”μ§„ NEST에 적용
μžκΈ°μ§€λ„ν•™μŠ΅ μ‚¬μš©ν•΄ μŒμ„±μΈμ‹ 정확도 30% κ°œμ„ Β·ν•™μŠ΅ λΉ„μš© κ°μ†Œ
ν΄λ‘œλ°”λ…ΈνŠΈμ— μš°μ„  적용...ν΄λ‘œλ°” μΌ€μ–΄μ½œΒ·λ‰΄μŠ€ μžλ™ μžλ§‰μœΌλ‘œ ν™•λŒ€ κ³„νš
(사진=넀이버)

넀이버(λŒ€ν‘œ ν•œμ„±μˆ™)κ°€ μžμ‚¬ μ΄ˆλŒ€κ·œλͺ¨ 인곡지λŠ₯(AI) β€˜ν•˜μ΄νΌν΄λ‘œλ°”β€™ 기술둜 AI μŒμ„±μΈμ‹ μ—”μ§„ μ„±λŠ₯을 λŒ€ν­ κ°•ν™”ν–ˆλ‹€κ³  8일 λ°ν˜”λ‹€.

ν•˜μ΄νΌν΄λ‘œλ°”μ˜ μžκΈ°μ§€λ„ν•™μŠ΅(self-supervised learning) 기법을 AI μŒμ„±μΈμ‹ μ—”μ§„ 'NEST(Neural End-to-end Speech Transcriber)'에 μ μš©ν•œ κ²°κ³Ό, κΈ°μ‘΄ λŒ€λΉ„ μŒμ„±μΈμ‹ 정확도가 μ•½ 30% μ¦κ°€ν–ˆλ‹€.

μ—…κ·Έλ ˆμ΄λ“œλœ NEST 엔진은 ν΄λ‘œλ°”λ…ΈνŠΈμ— μš°μ„  νƒ‘μž¬ν–ˆλ‹€. 이후 μ½”λ‘œλ‚˜19 λŠ₯λ™κ°μ‹œμžλ₯Ό κ΄€λ¦¬ν•˜λŠ” ν΄λ‘œλ°” μΌ€μ΄μ½œ, λ‰΄μŠ€ μžλ™ μžλ§‰ μ„œλΉ„μŠ€ 등에 μ μš©μ„ ν™•λŒ€ν•  μ˜ˆμ •μ΄λ‹€.

ν•˜μ΄νΌν΄λ‘œλ°”λŠ” 넀이버가 μ§€λ‚œ 5μ›” κ³΅κ°œν•œ μ΄ˆλŒ€κ·œλͺ¨ AI λͺ¨λΈλ‘œ μ΅œμ‹  λ”₯λŸ¬λ‹ 기법인 μžκΈ°μ§€λ„ν•™μŠ΅μ„ μ‚¬μš©ν•œλ‹€. μžκΈ°μ§€λ„ν•™μŠ΅μ„ μ‚¬μš©ν•˜λ©΄ λ ˆμ΄λΈ” 없이 데이터 자체만으둜 ν•™μŠ΅μ΄ κ°€λŠ₯ν•΄ ν•™μŠ΅ 데이터 ꡬ좕에 λ“œλŠ” μ‹œκ°„κ³Ό λΉ„μš©μ„ 획기적으둜 쀄일 수 μžˆλ‹€.

NEST 엔진은 단문 μœ„μ£Όμ˜ μŒμ„± λͺ…령보닀 λ³΅μž‘ν•œ μž₯문의 μŒμ„± ν‘œν˜„μ„ μΈμ‹ν•˜λŠ”λ° μ΅œμ ν™”λœ 기술둜, 넀이버가 2020λ…„ 4μ›” 처음 κ³΅κ°œν–ˆλ‹€.

μžκΈ°μ§€λ„ν•™μŠ΅ μ‚¬μš©μœΌλ‘œ μŒμ› 데이터 속 ν…μŠ€νŠΈλ₯Ό ν™•μΈν•˜λŠ” 전사(transcription) μž‘μ—…μ„ μ΅œμ†Œν™”ν•˜λŠ” λ™μ‹œμ— 기쑴보닀 μ •ν™•ν•œ AI ν•™μŠ΅μ΄ κ°€λŠ₯ν•΄μ‘Œλ‹€. λͺ¨λΈ ν•™μŠ΅μ— λ“œλŠ” μ‹œκ°„κ³Ό λΉ„μš©λ„ 획기적으둜 단좕됐닀.

넀이버 ν•œμ΅μƒ μ±…μž„λ¦¬λ”λŠ” β€œλ„€μ΄λ²„λŠ” μŒμ„± AI λΆ„μ•Ό μ–‘λŒ€ ꡭ제 ν•™νšŒμΈ 'Interspeech'와 'ICASSP'에 μ˜¬ν•΄ 각각 9κ°œμ”©μ˜ 논문이 μ±„νƒλ˜λŠ” λ“± κ΅­λ‚΄λ₯Ό λ„˜μ–΄ κΈ€λ‘œλ²Œ 졜고 μˆ˜μ€€μ˜ μŒμ„±κΈ°μˆ  경쟁λ ₯을 이미 인정받고 μžˆλ‹€. 여기에 ν•˜μ΄νΌν΄λ‘œλ°”μ˜ κΈ°μˆ μ„ μ ‘λͺ©μ‹œν‚΄μœΌλ‘œμ¨ λ‹€μ–‘ν•œ μŒμ„± AI μ„œλΉ„μŠ€ μ„±λŠ₯을 고도화할 것”이라고 μ „ν–ˆλ‹€.