최적해를 찾는 과정?
강화학습도 DP 일종인가?
ㅇㅅㅇa(211.34)
2021-11-07 06:30
추천 0
댓글 8
다른 게시글
-
개인프로젝트 관리툴없나 [3]헬마스터(supersaver) | 21.11.07추천 0
-
진화알고리즘과 강화학습의 유사성, 그리고 증명triva(zomi12) | 21.11.07추천 3
-
삼성헬스앱 좋더라 [1]헬마스터(supersaver) | 21.11.07추천 0
-
얼리쥬지기상 완료헬마스터(supersaver) | 21.11.07추천 0
-
광고 짜증나는 점 [5]익명(77.2) | 21.11.07추천 0
-
중고거래 얼마 빼드려야할까 [8]삐죽이와삐..(218.51) | 21.11.07추천 0
-
오늘은 쓸 글이 없군 [15]ㅇㅅㅇa(211.34) | 21.11.07추천 0
-
회사규모 10~20명 어떰? [1]익명(92.119) | 21.11.07추천 0
-
아이폰 충전기 단자가 마치 내 쥬지같아서 방금 울었다익명(114.201) | 21.11.07추천 0
-
전공자들중에 연봉 1억 받아보는 비율 몇퍼냐 [3]익명(211.207) | 21.11.07추천 0
아는 애들이 없겠군 여긴
강화학습은 역전파예요 ㅇㅅㅇ
딥러닝의 핵심개념은 역전파인데 미분으로 결과에서 원인 방향으로 원래 해를 찾는 과정이죠 ㅇㅅㅇ
미안 모르겠다 내가 아무것도 몰라서 ㅇㅅㅇㅋㅋㅋ
DP는 하위문제의 재사용성이 중점인데 반해 강화학습은 리워드에 따른 폴리시 수정이 중점이라 엄청나게 다름
예컨대 DP가 "아 이 문제는 아까 풀어봤었는데 그때 답이 이거였지? 그대로 써먹어야겠다" 하는 방식이라면 강화학습은 "이 문제 아까 풀어봤는데 점수가 나빴으니까 이번에는 다른 방법으로 풀어봐야겠다" 하는 방식임
차라리 브루트포스에 더 가까울거 같은데
강화학습 책에 DP 얘기가 자주 나옴 Sutton 책 추천 - dc App