미주갤 이새끼들이 문제임 ㅇㅇ..





특히 요즘 미주갤은 근본도 분석도 없이 화제성으로 단타 치고 먹으려는 새끼들뿐이라 무지성 거인급으로 몰려다니면서 어그로 끌고다님













정보글) GRPO는 17년에 oai가 만든 A2C PPO를 기반으로 한 알고리즘으로 reward model이 다중 입출력을 하도록 개선한 알고리즘이다.




기존 deepseekmath RL모델은 기존 트랜스포머 훈련에 GRPO을 도입한 모델이며, deepseek r1은 deepseek math RL의 GRPO로 CoT학습을 시킨 모델이다.