컴퓨터 κ³Όν•™μžλ“€μ€ 더 큰 신경망이 더 λ‚˜μ€ 이유λ₯Ό 증λͺ…ν•©λ‹ˆλ‹€ | 퀀타 λ§€κ±°μ§„ (quantamagazine.org)

컴퓨터 κ³Όν•™μžλ“€μ€ 더 큰 신경망이 더 λ‚˜μ€ 이유λ₯Ό 증λͺ…ν•©λ‹ˆλ‹€


두 연ꡬ원은 신경망이 더 잘 κΈ°μ–΅ν•  수 있으렀면 이전에 μƒκ°ν–ˆλ˜ 것보닀 훨씬 더 λ§Žμ€ λ§€κ°œλ³€μˆ˜κ°€ ν•„μš”ν•˜λ‹€λŠ” 것을 λ³΄μ—¬μ€λ‹ˆλ‹€.



우리 쒅쑱은 λ°˜λŒ€λ˜λŠ” 엄지손가락에 λ§Žμ€ λΉšμ„ μ§€κ³  μžˆμŠ΅λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ μ§„.ν™”κ°€ μš°λ¦¬μ—κ²Œ 더 λ§Žμ€ 엄지손가락을 μ£Όμ—ˆλ‹€λ©΄ 상황이 많이 κ°œμ„ λ˜μ§€ μ•Šμ•˜μ„ κ²ƒμž…λ‹ˆλ‹€. ν•œ 손에 엄지손가락 ν•˜λ‚˜λ§ŒμœΌλ‘œ μΆ©λΆ„ν•©λ‹ˆλ‹€.


인간과 같은 μž‘μ—…μ„ μˆ˜ν–‰ν•˜κΈ° μœ„ν•œ 졜고의 인곡 μ§€λŠ₯ μ‹œμŠ€ν…œμΈ 신경망은 κ·Έλ ‡μ§€ μ•ŠμŠ΅λ‹ˆλ‹€. 그듀이 더 컀짐에 따라 더 λ§Žμ€ 것을 μ΄ν•΄ν•˜κ²Œ λ˜μ—ˆμŠ΅λ‹ˆλ‹€. 이것은 κ΅¬κ²½κΎΌλ“€μ—κ²Œ 놀라움을 μ„ μ‚¬ν–ˆμŠ΅λ‹ˆλ‹€. 기본적인 μˆ˜ν•™μ  κ²°κ³ΌλŠ” λ„€νŠΈμ›Œν¬κ°€ λ„ˆλ¬΄ 컀야 ν•œλ‹€κ³  μ œμ•ˆν–ˆμ§€λ§Œ ν˜„λŒ€ 신경망은 일반적으둜 μ˜ˆμƒ μš”κ΅¬ 사항 μ΄μƒμœΌλ‘œ ν™•μž₯λ©λ‹ˆλ‹€(κ³Όλ§€κ°œλ³€μˆ˜ν™”λ‘œ μ•Œλ €μ§„ 상황).


선도적인 컨퍼런슀인 NeurIPSμ—μ„œ 12월에 λ°œν‘œλœ λ…Όλ¬Έ μ—μ„œ Microsoft Research의 SΓ©bastien Bubeck κ³Ό Stanford University의 Mark Sellke λŠ” ν™•μž₯μ„± μ„±κ³΅μ˜ 비밀에 λŒ€ν•œ μƒˆλ‘œμš΄ μ„€λͺ…을 μ œκ³΅ν–ˆμŠ΅λ‹ˆλ‹€. 그듀은 신경망이 νŠΉμ • κΈ°λ³Έ 문제λ₯Ό ν”Όν•˜κΈ° μœ„ν•΄ 기쑴에 μ˜ˆμƒν–ˆλ˜ 것보닀 훨씬 컀야 함을 λ³΄μ—¬μ€λ‹ˆλ‹€. 이 λ°œκ²¬μ€ μˆ˜μ‹­ λ…„ λ™μ•ˆ μ§€μ†λœ μ§ˆλ¬Έμ— λŒ€ν•œ 일반적인 톡찰λ ₯을 μ œκ³΅ν•©λ‹ˆλ‹€.


μŠ€μœ„μŠ€ λ‘œμž” 곡과 λŒ€ν•™μ˜ Lenka ZdeborovΓ‘ λŠ” "정말 ν₯미둜운 μˆ˜ν•™ 및 이둠 κ²°κ³Ό μž…λ‹ˆλ‹€. β€œκ·Έλ“€μ€ 맀우 일반적인 λ°©μ‹μœΌλ‘œ 그것을 증λͺ…ν•©λ‹ˆλ‹€. 그런 μ˜λ―Έμ—μ„œ 컴퓨터 κ³Όν•™μ˜ 핡심이 될 κ²ƒμž…λ‹ˆλ‹€.”


μ‹ κ²½λ§μ˜ 크기에 λŒ€ν•œ ν‘œμ€€ κΈ°λŒ€μΉ˜λŠ” 데이터λ₯Ό κΈ°μ–΅ν•˜λŠ” 방법에 λŒ€ν•œ λΆ„μ„μ—μ„œ λΉ„λ‘―λ©λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ μ•”κΈ°λ₯Ό μ΄ν•΄ν•˜λ €λ©΄ λ¨Όμ € λ„€νŠΈμ›Œν¬κ°€ 무엇을 ν•˜λŠ”μ§€ 이해해야 ν•©λ‹ˆλ‹€.


μ‹ κ²½λ§μ˜ 일반적인 μž‘μ—… 쀑 ν•˜λ‚˜λŠ” μ΄λ―Έμ§€μ—μ„œ 개체λ₯Ό μ‹λ³„ν•˜λŠ” κ²ƒμž…λ‹ˆλ‹€. 이λ₯Ό μˆ˜ν–‰ν•  수 μžˆλŠ” λ„€νŠΈμ›Œν¬λ₯Ό λ§Œλ“€κΈ° μœ„ν•΄ 연ꡬ원듀은 λ¨Όμ € λ§Žμ€ 이미지와 객체 λ ˆμ΄λΈ”μ„ μ œκ³΅ν•˜κ³  이듀 κ°„μ˜ 상관 관계λ₯Ό ν•™μŠ΅ν•˜λ„λ‘ ν›ˆλ ¨ν•©λ‹ˆλ‹€. κ·Έ ν›„ λ„€νŠΈμ›Œν¬λŠ” 이미 λ³Έ μ΄λ―Έμ§€μ—μ„œ 개체λ₯Ό μ˜¬λ°”λ₯΄κ²Œ μ‹λ³„ν•©λ‹ˆλ‹€. 즉, ν›ˆλ ¨μ€ λ„€νŠΈμ›Œν¬κ°€ 데이터λ₯Ό κΈ°μ–΅ν•˜λ„λ‘ ν•©λ‹ˆλ‹€. λ”μš± λ†€λΌμš΄ 사싀은 λ„€νŠΈμ›Œν¬κ°€ ν›ˆλ ¨ 데이터λ₯Ό μΆ©λΆ„νžˆ κΈ°μ–΅ν•˜λ©΄ ν•œ λ²ˆλ„ λ³Έ 적이 μ—†λŠ” 객체의 λ ˆμ΄λΈ”μ„ λ‹€μ–‘ν•œ μ •ν™•λ„λ‘œ μ˜ˆμΈ‘ν•  수 μžˆλ‹€λŠ” κ²ƒμž…λ‹ˆλ‹€. ν›„μžμ˜ 과정을 μΌλ°˜ν™”λΌκ³  ν•©λ‹ˆλ‹€.


κΈ°μ–΅ν•  수 μžˆλŠ” 양은 λ„€νŠΈμ›Œν¬μ˜ 크기에 따라 κ²°μ •λ©λ‹ˆλ‹€. 이것은 κ·Έλž˜ν”½μœΌλ‘œ 이해할 수 μžˆμŠ΅λ‹ˆλ‹€. xy 평면 에 두 개의 데이터 포인트λ₯Ό λ°°μΉ˜ν•œλ‹€κ³  μƒμƒν•΄λ³΄μ‹­μ‹œμ˜€ . 두 개의 λ§€κ°œλ³€μˆ˜λ‘œ μ„€λͺ…λ˜λŠ” μ„ μœΌλ‘œ μ΄λŸ¬ν•œ 점을 μ—°κ²°ν•  수 μžˆμŠ΅λ‹ˆλ‹€. μ„ μ˜ κΈ°μšΈκΈ°μ™€ 수직 좕을 ꡐ차할 λ•Œμ˜ λ†’μ΄μž…λ‹ˆλ‹€. λ‹€λ₯Έ μ‚¬λžŒμ—κ²Œ μ„ κ³Ό μ›λž˜ 데이터 포인트 쀑 ν•˜λ‚˜μ˜ x μ’Œν‘œκ°€ μ£Όμ–΄μ§€λ©΄ μ„  을 λ³΄κ±°λ‚˜ λ§€κ°œλ³€μˆ˜λ₯Ό μ‚¬μš©ν•˜μ—¬ ν•΄λ‹Ή y μ’Œν‘œλ₯Ό νŒŒμ•…ν•  수 μžˆμŠ΅λ‹ˆλ‹€. 선은 두 개의 데이터 포인트λ₯Ό κΈ°μ–΅ν–ˆμŠ΅λ‹ˆλ‹€.


신경망도 λΉ„μŠ·ν•œ 일을 ν•©λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄ μ΄λ―Έμ§€λŠ” ν”½μ…€λ‹Ή ν•˜λ‚˜μ”© 수백 λ˜λŠ” 수천 개의 κ°’μœΌλ‘œ μ„€λͺ…λ©λ‹ˆλ‹€. 이 λ§Žμ€ 자유 κ°’ 집합은 고차원 κ³΅κ°„μ—μ„œ ν•œ 점의 μ’Œν‘œμ™€ μˆ˜ν•™μ μœΌλ‘œ λ™μΌν•©λ‹ˆλ‹€. μ’Œν‘œμ˜ 수λ₯Ό 차원이라고 ν•©λ‹ˆλ‹€.


였래된 μˆ˜ν•™μ  결과에 λ”°λ₯΄λ©΄ n개의 데이터 포인트λ₯Ό κ³‘μ„ μœΌλ‘œ λ§žμΆ”λ €λ©΄ n개의 λ§€κ°œλ³€μˆ˜ κ°€ μžˆλŠ” ν•¨μˆ˜κ°€ ν•„μš”ν•©λ‹ˆλ‹€ . (이전 μ˜ˆμ—μ„œ 두 점은 두 개의 λ§€κ°œλ³€μˆ˜κ°€ μžˆλŠ” κ³‘μ„ μœΌλ‘œ μ„€λͺ…λ˜μ—ˆμŠ΅λ‹ˆλ‹€.) 신경망이 1980λ…„λŒ€μ— 힘으둜 처음 λ“±μž₯ν–ˆμ„ λ•Œ 같은 것을 μƒκ°ν•˜λŠ” 것이 ν•©λ¦¬μ μ΄μ—ˆμŠ΅λ‹ˆλ‹€. 데이터 차원에 관계없이 n개의 데이터 포인트 에 λ§žμΆ”κΈ° μœ„ν•΄ n개의 λ§€κ°œλ³€μˆ˜ 만 ν•„μš” ν•©λ‹ˆλ‹€.


μ˜€μŠ€ν‹΄μ— μžˆλŠ” ν…μ‚¬μŠ€ λŒ€ν•™μ˜ Alex Dimakis λŠ” "이것은 더 이상 μΌμ–΄λ‚˜μ§€ μ•ŠλŠ” μΌμž…λ‹ˆλ‹€."라고 λ§ν–ˆμŠ΅λ‹ˆλ‹€ . β€œμ§€κΈˆ μš°λ¦¬λŠ” ν›ˆλ ¨ μƒ˜ν”Œμ˜ μˆ˜λ³΄λ‹€ 더 λ§Žμ€ λ§€κ°œλ³€μˆ˜λ₯Ό κ°€μ§„ 신경망을 μΌμƒμ μœΌλ‘œ λ§Œλ“€κ³  μžˆμŠ΅λ‹ˆλ‹€. 이것은 책을 λ‹€μ‹œ 써야 ν•œλ‹€λŠ” 것을 μ˜λ―Έν•©λ‹ˆλ‹€.”


Bubeckκ³Ό SellkeλŠ” 아무 것도 λ‹€μ‹œ μ“°κΈ° μ‹œμž‘ν•˜μ§€ μ•Šμ•˜μŠ΅λ‹ˆλ‹€. 그듀은 신경망에 μ’…μ’… κ²°μ—¬ λ˜μ–΄ μžˆλŠ” λ‹€λ₯Έ 속성 인 견고성(robustness)을 μ—°κ΅¬ν•˜κ³  μžˆμ—ˆμŠ΅λ‹ˆλ‹€. μ΄λŠ” μž‘μ€ λ³€ν™”λ₯Ό μ²˜λ¦¬ν•˜λŠ” λ„€νŠΈμ›Œν¬μ˜ λŠ₯λ ₯μž…λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄, κ²¬κ³ ν•˜μ§€ μ•Šμ€ λ„€νŠΈμ›Œν¬λŠ” 기린을 μΈμ‹ν•˜λŠ” 방법을 배웠을 수 μžˆμ§€λ§Œ 거의 μˆ˜μ •λ˜μ§€ μ•Šμ€ 버전을 gerbil둜 잘λͺ» λΆ„λ₯˜ν•  수 μžˆμŠ΅λ‹ˆλ‹€. 2019λ…„, Bubeckκ³Ό λ™λ£Œλ“€μ€ λ¬Έμ œκ°€ λ„€νŠΈμ›Œν¬μ˜ 크기와 μ—°κ²°λ˜μ–΄ μžˆλ‹€λŠ” 것을 κΉ¨λ‹¬μ•˜μ„ λ•Œ λ¬Έμ œμ— λŒ€ν•œ 정리λ₯Ό 증λͺ…ν•˜λ €κ³  ν–ˆμŠ΅λ‹ˆλ‹€.


"μš°λ¦¬λŠ” μ λŒ€μ μΈ 예λ₯Ό μ—°κ΅¬ν•˜κ³  μžˆμ—ˆκ³  규λͺ¨κ°€ μš°λ¦¬μ—κ²Œ λΆ€κ³Όλ˜μ—ˆμŠ΅λ‹ˆλ‹€."라고 Bubeck이 λ§ν–ˆμŠ΅λ‹ˆλ‹€. "규λͺ¨ 자체λ₯Ό 이해해야 ν•˜λŠ” ν•„μš”μ„±μ΄ μžˆμ—ˆκΈ° λ•Œλ¬Έμ— 이것이 λ†€λΌμš΄ κΈ°νšŒλΌλŠ” 것을 κΉ¨λ‹¬μ•˜μŠ΅λ‹ˆλ‹€."


κ·Έλ“€μ˜ μƒˆλ‘œμš΄ 증λͺ…μ—μ„œ, μŒμ€ λ„€νŠΈμ›Œν¬κ°€ κ²¬κ³ ν•˜κΈ° μœ„ν•΄ κ³Όλ§€κ°œλ³€μˆ˜ν™”κ°€ ν•„μš”ν•¨μ„ λ³΄μ—¬μ€λ‹ˆλ‹€. 그듀은 견고성과 λ™λ“±ν•œ μˆ˜ν•™μ  속성인 λΆ€λ“œλŸ¬μ›€μ„ κ°€μ§„ κ³‘μ„ μœΌλ‘œ 데이터 포인트λ₯Ό λ§žμΆ”λŠ” 데 ν•„μš”ν•œ λ§€κ°œλ³€μˆ˜μ˜ 수λ₯Ό νŒŒμ•…ν•˜μ—¬ 이λ₯Ό μˆ˜ν–‰ν•©λ‹ˆλ‹€.


이λ₯Ό 보기 μœ„ν•΄ x μ’Œν‘œκ°€ 단일 ν”½μ…€μ˜ 색상을 λ‚˜νƒ€λ‚΄κ³  y μ’Œν‘œκ°€ 이미지 λ ˆμ΄λΈ”μ„ λ‚˜νƒ€λ‚΄λŠ” ν‰λ©΄μ˜ 곑선을 λ‹€μ‹œ 상상해 λ³΄μ‹­μ‹œμ˜€. 곑선이 λΆ€λ“œλŸ½κΈ° λ•Œλ¬Έμ— ν”½μ…€μ˜ 색상을 μ•½κ°„ μˆ˜μ •ν•˜κ³  곑선을 따라 짧은 거리λ₯Ό μ΄λ™ν•˜λ©΄ ν•΄λ‹Ή 예츑이 μ•½κ°„λ§Œ λ³€κ²½λ©λ‹ˆλ‹€. λ°˜λ©΄μ— 맀우 λ“€μ­‰λ‚ μ­‰ν•œ κ³‘μ„ μ˜ 경우 x μ’Œν‘œ(색상)의 μž‘μ€ λ³€ν™”κ°€ y μ’Œν‘œ(이미지 λ ˆμ΄λΈ”) 의 극적인 λ³€ν™”λ‘œ μ΄μ–΄μ§ˆ 수 μžˆμŠ΅λ‹ˆλ‹€ . 기린은 μ €λΉŒμ΄ 될 수 μžˆμŠ΅λ‹ˆλ‹€.


Bubeckκ³Ό SellkeλŠ” 고차원 데이터 포인트λ₯Ό λ§€λ„λŸ½κ²Œ λ§žμΆ”λ €λ©΄ n λ§€κ°œλ³€μˆ˜λΏλ§Œ μ•„λ‹ˆλΌ n Γ— d λ§€κ°œλ³€μˆ˜κ°€ ν•„μš”ν•˜λ‹€λŠ” 것을 λ³΄μ—¬μ£Όμ—ˆμŠ΅λ‹ˆλ‹€. μ—¬κΈ°μ„œ d λŠ” μž…λ ₯의 μ°¨μ›μž…λ‹ˆλ‹€(예: 784ν”½μ…€ μ΄λ―Έμ§€μ˜ 경우 784). λ‹€μ‹œ 말해, λ„€νŠΈμ›Œν¬κ°€ ν›ˆλ ¨ 데이터λ₯Ό κ°•λ ₯ν•˜κ²Œ κΈ°μ–΅ν•˜κΈ°λ₯Ό μ›ν•œλ‹€λ©΄ κ³Όλ§€κ°œλ³€μˆ˜ν™”κ°€ 도움이 될 뿐만 μ•„λ‹ˆλΌ ν•„μˆ˜μž…λ‹ˆλ‹€. 증λͺ…은 고차원 κΈ°ν•˜ν•™μ— λŒ€ν•œ ν₯미둜운 사싀에 μ˜μ‘΄ν•©λ‹ˆλ‹€. 즉, ꡬ의 ν‘œλ©΄μ— 배치된 λ¬΄μž‘μœ„λ‘œ λΆ„ν¬λœ 점이 μ„œλ‘œ 거의 λͺ¨λ‘ 전체 직경으둜 λ–¨μ–΄μ Έ μžˆλ‹€λŠ” κ²ƒμž…λ‹ˆλ‹€. 점 μ‚¬μ΄μ˜ 큰 λΆ„λ¦¬λŠ” ν•˜λ‚˜μ˜ λΆ€λ“œλŸ¬μš΄ κ³‘μ„ μœΌλ‘œ λͺ¨λ“  점을 λ§žμΆ”λŠ” 데 λ§Žμ€ μΆ”κ°€ λ§€κ°œλ³€μˆ˜κ°€ ν•„μš”ν•¨μ„ μ˜λ―Έν•©λ‹ˆλ‹€.


예일 λŒ€ν•™μ˜ μ•„λ―Ό μΉ΄λ°”μ‹œ( Amin Karbasi ) λŠ” "증λͺ…은 맀우 기초적인 κ²ƒμž…λ‹ˆλ‹€. 무거운 μˆ˜ν•™μ΄ ν•„μš”ν•˜μ§€ μ•ŠμœΌλ©° 맀우 일반적인 것을 λ§ν•΄μ€λ‹ˆλ‹€."라고 λ§ν–ˆμŠ΅λ‹ˆλ‹€ .


κ²°κ³ΌλŠ” 신경망을 ν™•μž₯ν•˜λŠ” κ°„λ‹¨ν•œ μ „λž΅μ΄ μ™œ κ·Έλ ‡κ²Œ νš¨κ³Όμ μΈμ§€ μ΄ν•΄ν•˜λŠ” μƒˆλ‘œμš΄ 방법을 μ œκ³΅ν•©λ‹ˆλ‹€.


λ‹€λ₯Έ μ—°κ΅¬μ—μ„œλŠ” κ³Όλ§€κ°œλ³€μˆ˜ν™”κ°€ 도움이 λ˜λŠ” μΆ”κ°€ 이유λ₯Ό λ°ν˜”μŠ΅λ‹ˆλ‹€. 예λ₯Ό λ“€μ–΄, ν›ˆλ ¨ κ³Όμ •μ˜ νš¨μœ¨μ„±κ³Ό λ„€νŠΈμ›Œν¬μ˜ μΌλ°˜ν™” λŠ₯λ ₯을 ν–₯μƒμ‹œν‚¬ 수 μžˆμŠ΅λ‹ˆλ‹€. 이제 μš°λ¦¬λŠ” 견고성을 μœ„ν•΄ κ³Όλ§€κ°œλ³€μˆ˜ν™”κ°€ ν•„μš”ν•˜λ‹€λŠ” 것을 μ•Œκ³  μžˆμ§€λ§Œ, λ‹€λ₯Έ 것듀에 λŒ€ν•΄ 견고성이 μ–Όλ§ˆλ‚˜ ν•„μš”ν•œμ§€λŠ” λΆˆλΆ„λͺ…ν•©λ‹ˆλ‹€. κ·ΈλŸ¬λ‚˜ 이λ₯Ό κ³Όλ§€κ°œλ³€μˆ˜ν™”μ— μ—°κ²°ν•¨μœΌλ‘œμ¨ μƒˆλ‘œμš΄ μ¦κ±°λŠ” 견고성이 μƒκ°ν–ˆλ˜ 것보닀 더 μ€‘μš”ν•  수 μžˆμŒμ„ μ•”μ‹œν•©λ‹ˆλ‹€. μ΄λŠ” λ§Žμ€ 이점을 μ œκ³΅ν•˜λŠ” 단일 ν‚€μž…λ‹ˆλ‹€.


"강건성은 μΌλ°˜ν™”μ˜ μ „μ œ 쑰건처럼 λ³΄μž…λ‹ˆλ‹€."라고 Bubeck이 λ§ν–ˆμŠ΅λ‹ˆλ‹€. β€œλ§Œμ•½ 당신이 그것을 μ•½κ°„ ν˜Όλž€μŠ€λŸ½κ²Œ ν•˜κ³  엉망이 λ˜λŠ” μ‹œμŠ€ν…œμ΄ μžˆλ‹€λ©΄ 그것은 μ–΄λ–€ μ’…λ₯˜μ˜ μ‹œμŠ€ν…œμž…λ‹ˆκΉŒ? 합리적이지 μ•ŠμŠ΅λ‹ˆλ‹€. μ €λŠ” 그것이 맀우 기초적이고 기본적인 μš”κ΅¬ 사항이라고 μƒκ°ν•©λ‹ˆλ‹€.”