강화학습이랑 딥러닝이랑 뭐가다르징
강화학습은 선택지가 있을 때 해당 선택지의 가치를 평가해서 최종적으로 제일 많은 보상을 얻는 방향으로 조정하는 일종의 방법론임. 딥러닝은 미분 가능한 cost function 결과를 역전파해서 가중치를 조정해서 패턴을 학습하는거고. - dc App
이제 이 두가지를 결합하면 에이전트가 환경하고 상호작용하고 관측한 상태를 기반으로 최선의 선택을 하도록 패턴 학습이 가능함. - dc App
근데 강화학습도 결국 가중치를 수정해야되는거아닝?
니가 말하는 가중치가 미분값을 기반으로 결과값을 최소화 방향으로 유도하는거면 SGD 사용하는 방법론도 있고 사용하지 않는 방법론도 있음. - dc App
@포치포치타타 SGD가 아니라 경사하강 - dc App
@포치포치타타 아니 강화학습도 결국 가중치수정해야되는거아니냐 공
몰라 씨발 - dc App
강화학습을 하기 위한 수단 중 하나가 딥러닝 아님? 원래 전통적인 방법으로 q 러닝이 있는데 그게 딥러닝 합쳐져서 dqn으로 진화했거든 아님 말고 ㅋㅋ
강화학습이랑 딥러닝이랑 뭐가다르징
강화학습은 선택지가 있을 때 해당 선택지의 가치를 평가해서 최종적으로 제일 많은 보상을 얻는 방향으로 조정하는 일종의 방법론임. 딥러닝은 미분 가능한 cost function 결과를 역전파해서 가중치를 조정해서 패턴을 학습하는거고. - dc App
이제 이 두가지를 결합하면 에이전트가 환경하고 상호작용하고 관측한 상태를 기반으로 최선의 선택을 하도록 패턴 학습이 가능함. - dc App
근데 강화학습도 결국 가중치를 수정해야되는거아닝?
니가 말하는 가중치가 미분값을 기반으로 결과값을 최소화 방향으로 유도하는거면 SGD 사용하는 방법론도 있고 사용하지 않는 방법론도 있음. - dc App
@포치포치타타 SGD가 아니라 경사하강 - dc App
@포치포치타타 아니 강화학습도 결국 가중치수정해야되는거아니냐 공
몰라 씨발 - dc App
강화학습을 하기 위한 수단 중 하나가 딥러닝 아님? 원래 전통적인 방법으로 q 러닝이 있는데 그게 딥러닝 합쳐져서 dqn으로 진화했거든 아님 말고 ㅋㅋ