이미 학습된 딥러닝 모델에서 학습 데이터를 복원하는 방법은 꾸준히 개발중이고
그래서 개인정보를 필터링하되 모델의 성능은 유지하는 방법도 개발중이고
이루다는 가장 큰 문제 중 하나가 실제 이름이 유출되는 거지
누군가 이루다가 자기를 실제 있을법한 이름으로 지칭하는 것을 발견했고
그러자 사람들이 무작위로 흔한 이름을 대화에 넣어서 그 사람이 어떤 맥락의 대화를 했는지 유추할 수 있었지
CCTV영상 데이터를 학습해서 주어진 키워드에 맞는 상황의 사진을 합성해서 만들어내는 모델이 있다고 했을때
어떤 사람의 얼굴이 그대로 나오는 영상을 학습 데이터로 사용하면 합성한 결과에도 그 사람의 얼굴이 나오는거지
누군가 악의적으로 그 사람의 얼굴이 나오도록 키워드로 제시하면
실제 그 사람이 어떤 행동을 했는지 유추할 수도 있다는 거지
더 알아보려고 deep learning privacy 검색해서 찾아보는 중
돈 좀 써서 레이블링할때 개인정보 한번만 더 걸렀어도 이정도까지 파장 커지지는 않았을듯 이건 뭐 개인정보책임자의 문제지