단순히 스케일만 키우는 건 한계가 있다는게 요 2년간 증명됐다고 보는데 파라미터 10배로 늘린다는 루머나 o1(스트로베리)으로 합성데이터 뽑아내서 그걸로 학습했다고 유의미한 도약이 있을 거 같지는 않음


아니면 에이전트 최적화 모델 같은 거려나?




도파민 다 떨어져간다