내가 생각하기로 수치해석으로 딥러닝에서 정말 중요한 연구라면 대충 3가지 정도 생각나는데


1. RTL 레벨에서 verilog 이용해서 cublas, cudnn, cusolver의 함수들을 fpga, asic에 적용 및 원하는 딥러닝 방법을 저발열, 저전력 환경에서 low latency로 구현?


2. 아니면 TF, pytorch 따위는 못써먹겠고 CUDA SDK 중에서 tensorRT 같은것도 마음에 안들고 직접 더 내려가서 cublas, cusolver, cudnn 따위도 못써먹어서 직접 memory또는 computational complexity를 더 개선한 알고리즘으로 lapack, blas, dnn 라이브러리 직접짜냐?


3. gnn 등 convolution 일반화하는 너가 수학적으로 직접 유도하고 증명한 커스텀 함수를 구현하는데 기존 TF, torch는 구현이 힘들어서 직접 cuda 로 필요한 lapack 함수들과 함께 구현해서 씀?


이쪽 연구하는 사람이 ML 분야에서 소수이고 한국에서는 완전 극소수인데 어찌 딥러닝갤에 다 몰려있네 ㅋ