선생님들 짤처럼 식이 있을 때 시그마 괄호 해석을 1번으로 하는 게 맞나요 2번으로 하는 게 맞나요
Bellman's equation 공부 중인데 다른 표현식은 직관적으로 받아들여지는데 저 식은 많이 헷갈리네요
여기 보고 증명을 따라해봤는데 마지막에 굳이 policy인 pi 함수를 앞으로 뺀 거면 1번으로 보는 게 맞는 거 같긴 한데 확신이 없습니다
빡머갈 구원 좀 해주십쇼
선생님들 짤처럼 식이 있을 때 시그마 괄호 해석을 1번으로 하는 게 맞나요 2번으로 하는 게 맞나요
Bellman's equation 공부 중인데 다른 표현식은 직관적으로 받아들여지는데 저 식은 많이 헷갈리네요
여기 보고 증명을 따라해봤는데 마지막에 굳이 policy인 pi 함수를 앞으로 뺀 거면 1번으로 보는 게 맞는 거 같긴 한데 확신이 없습니다
빡머갈 구원 좀 해주십쇼
https://stats.stackexchange.com/questions/243384/deriving-bellmans-equation-in-reinforcement-learning
변수를 잘 보면 두번째 시그마 뒤의 식에 a가 있는데 좌변에 a가 없으니 왼쪽 시그마에서 전부 sum 되어야 하는 index variable임을 알수가 있지
그럼 2번이 맞다는 뜻이죠? 어차피 묶일 거면 그냥 앞으로 묶지 말고 시그마 3개 연속해서 쓰는 게 알아보기 편했을 거 같은데 왜 저렇게 표현한 건지 모르겠네요 여튼 감사합니다 즐밤되십쇼
잘 생각해보니 expected value 정의상 probability * X 꼴을 보여주기 위해 저렇게 나타낸 것 같기도 하네요
강화학습 ㅎㅇ