난 지금 딥러닝모델러가 주고 받을수 있는 DB를 설게하고 있는 1인입니다..
근데 일단 이 질문을 하는 이유가, 실제로 딥러닝을 하는 DB를 쌓아본적이 없어서 질문드려요.
CSV파일을 클라우드 스토리지에 저장해서 모델을 돌렸는데 이제 대용량 딥러닝용 DB를 설계 해야되는데.
예를들어 Iot 센서에서 매 초단위로 전력 측정을 하는데 그걸 DB 데이터에 쌓으면서 기준으로 끌어다가
예측을 하고 다시 주기적으로 딥러닝 을 하는 (추후 모델을 고정적으로 가져갈 지는 미지수 입니다.) 데이터를 계속 DB에 쌓으려고 합니다.
혹시 ML/DL 에 문제가 생길까요? 약간 요런식으로 (a1, b1은 변수 형태로 추가하면서 모델에 반영되도록 하려고 합니다.) 의견부탁드려요~
| sensor_id | sensor_value | timestamp | a1 | b1 |
|---|---|---|---|---|
| 1 | 1500 | 2022-01-01 12:01:05 | 2.00 | 0.5 |
| 2 | 1400 | 2021-01-01 19:01:05 | 3.00 | 0.4 |
예를들어 Iot 센서에서 매 초단위로 전력 측정을 하는데 그걸 DB 데이터에 쌓으면서 기준으로 끌어다가 예측을 하고 다시 주기적으로 딥러닝 을 하는 (추후 모델을 고정적으로 가져갈 지는 미지수 입니다.) 데이터를 계속 DB에 쌓으려고 합니다. - dc App
이부분이 잘 이해가 안감.. - dc App
요는 데이터셋을 지속적으로 쌓으면서 그걸로 다시 학습도 하고 예측도 하겠다 그런건가? 별 문제는 없어보이는데.. 다만 갈수록 데이터셋 양이 많아질텐데 그걸 전부 쓸건지, 아니면 특정시점부터의 데이터들만 쓸건지 등등을 고민해보면 좋을듯 - dc App
transfer learning 같은것도 도움 될 수도 있고 ㅇㅇ... 암튼 DB입장에선 별일 없을거같은데 - dc App
답변 감사합니다. 1. "예측을 하고 다시 주기적으로 딥러닝" -> [요는 데이터셋을 지속적으로 쌓으면서 그걸로 다시 학습도 하고 예측도 하겠다 ] 가 맞습니다. 근데 그것(예측한 데이터와, 그 예측 데이터)를 테이블에 넣고 학습기로 돌릴것입니다. 2. "그걸 전부 쓸건지, 아니면 특정시점부터의 데이터들만 쓸건지" 연단위 혹은 분기단위로 잘라서 슬 예정입니다. ( 제 의견이지만 .. ) 굳이 전체를 쓸 필요가 없을것같아서요 ㅎㅎ
모델이 예측해낸 데이터값을 데이터셋에 넣어서 쓰는건 좀 애매할 수 있음... 데이터셋엔 항상 실측값이 들어가야 한다고 봄
물론 GAN 같은데선 모델이 예측한 값을 학습에 쓰는 경우도 있고 다른 구조들도 모델이 예측한 값을 갖고 성능을 개선하는 경우가 있지만, 본인이 만든 모델의 정확도가 충분히 높지 않은 이상 예측에 악영향을 줄 수 있음. 지금 님이 만드는 모델은 Generative 모델이 아니라 Prediction 모델이기 때문에 어떠한 주기적으로 고정된 시스템의 특성을 학습하고 그 범위 안에서 예측하는 것이 중요하므로 모델의 예측값이 데이터셋에 편입되는건 별로같음