걍 베이즈 정리 써서 prior 상태에서 posterior상태 추정할 수 있으니까 그걸로 information value를 맞춰줘서 최적화 하면 더 좋더라
이거아님?
ㄴㄴ 전혀 아님, 원문 읽어봐 그런 단순한 문제가 아님
읽어봤는데 그냥 마르코프 프로세스에서 현재 상태 c의 가치함수로 베이즈정리써서 미래상태 e'의 가치함수를 추정해서 업데이트하는것 같은데
미래상태가치함수의 제한조건을 베이즈정리써서 설정하면 local optima에 빠지지 않는다가 결론인것같고
이 댓글은 게시물 작성자가 삭제하였습니다.
먼가 좀 내 이해에서 고리가 빠진게 있는 것 같은데 (대충 읽음) 혹시 업데이트 있으면 추가 좀 부탁..
특갤식 호들갑 하루이틀 보냐
그래도 해외발 뉴스 꾸준히 올리는 고닉게이들은 특갤의 보배들이니 괜찮음
ㄴㄴ 전혀 아님, 원문 읽어봐 그런 단순한 문제가 아님
읽어봤는데 그냥 마르코프 프로세스에서 현재 상태 c의 가치함수로 베이즈정리써서 미래상태 e'의 가치함수를 추정해서 업데이트하는것 같은데
미래상태가치함수의 제한조건을 베이즈정리써서 설정하면 local optima에 빠지지 않는다가 결론인것같고
이 댓글은 게시물 작성자가 삭제하였습니다.
먼가 좀 내 이해에서 고리가 빠진게 있는 것 같은데 (대충 읽음) 혹시 업데이트 있으면 추가 좀 부탁..
특갤식 호들갑 하루이틀 보냐
그래도 해외발 뉴스 꾸준히 올리는 고닉게이들은 특갤의 보배들이니 괜찮음