Scaling Reinforcement Learning
— SemiAnalysis (@SemiAnalysis_) June 8, 2025
Environments, Reward Hacking, Agents, Scaling Data
Infrastructure Bottlenecks and Changes
Distillation
Data is a Moat
Recursive Self Improvement
o4 and o5 RL Training
China Accelerator Productionhttps://t.co/jJgRlggxV2
O4,o5-mini 훈련 방법 얘기하는 곳에서 딱 끊어놓고 구독 장사함 ㅋㅋ ㅅㅂ
- dc official App
지미애플이 읽으라고 해서 봤더니 개빡치네 ㅅㅂ.. - dc App
? 나 다열리는데 구독안함
O4부분에서 돈내라 함 - dc App
@ㅇㅇ 그러네