내장 텐서 T1이 있음. T1과 현재 상황 텐서 T2를 곱해서 T3를 얻음. T3와 보상 텐서 T4를 이용하여 T1을 T5로 업데이트 함. n차 시도에서의 텐서를 T(n)이라 할때 (T2(1), T5(1)-T4(1)) 이랑 (T2(2), T5(2)-T4(2)) 랑 이용해서 현재 상환 텐서랑 값의 차를 이용해서 나온 두 텐서가 개념 텐서임 - dc official App
평균 정확도 20% 정확도 편차 50 - dc App
업데이트 하는 법도 모를거 같은데
몬테 카를로 탐색 - dc App
x := x - k*dC/dx - dc App
알면 수식으로 써야지