선생님들 짤처럼 식이 있을 때 시그마 괄호 해석을 1번으로 하는 게 맞나요 2번으로 하는 게 맞나요

Bellman's equation 공부 중인데 다른 표현식은 직관적으로 받아들여지는데 저 식은 많이 헷갈리네요

https://stats.stackexchange.com/questions/243384/deriving-bellmans-equation-in-reinforcement-learning

여기 보고 증명을 따라해봤는데 마지막에 굳이 policy인 pi 함수를 앞으로 뺀 거면 1번으로 보는 게 맞는 거 같긴 한데 확신이 없습니다

빡머갈 구원 좀 해주십쇼