일정크기로 발산하는 것만 아니면 수렴할 때까지 계속 학습시키는게 맞나?
[일반] 강화학습은 리워드 수렴될 때까지 학습시키는게 맞나?
익명(125.251)
2025-09-28 21:06
추천 0
댓글 1
다른 게시글
-
아오 시발 뭐 온다니까 갑자기 흥분됨 [14][일반] 익명(bam9398) | 25.09.28추천 0
-
그록5 성능보면 대충 스타게이트 결과도 예측 되지 않을까 [1][일반] 익명(115.22) | 25.09.28추천 0
-
뭐 안 오기만 해봐 [10][일반] 익명(bam9398) | 25.09.28추천 0
-
만약에 그록5 성능이 GPT-4.5급 성능이면 [6][일반] 분노의라스(wxy0514) | 25.09.28추천 1
-
그냥 어그로 아니냐 [14][일반] 익명(175.199) | 25.09.28추천 4
-
솔직히 4단계 agi 까지만와도 agi 달성된체감일듯 [1][일반] 익명(14.52) | 25.09.28추천 0
-
오픈라우터에서 있는 API들 어떻게 씀? [3][일반] 익명(115.138) | 25.09.28추천 0
-
추가하자면 [5][일반] 와랄라케로..(decade3335) | 25.09.28추천 1
-
야 근데 솔직히 그록5도 기대 안됨 [3][일반] 익명(14.52) | 25.09.28추천 0
-
ais 50만 토큰쯤 오니까 대답 6초 컷뭐냐[일반] 익명(211.216) | 25.09.28추천 0
이론은 맞는데 보통 오버피팅 ,본문에서 말한 발산, 효율성등 고려해서 조기종료 시키거나 임계치 기반으로 학습 종료시킴