저번에 잠깐 유출됐던 o1이 성능이 일반 프리뷰랑 비슷하거나 약간 떨어진다는 소문을 따르면
이놈이 마치 GPT-4o-canvas 때처럼 경량화시키고 에이전트용으로 파인튜닝한 에이전트 전용버전이 아닌가 함
그때 이미지나 뭐 기타 파일들 입력 받을 수 있었는데 컴터용 에이전트용이라서 그런 거 같고,
바로 얼마 전에 앱 업데이트한 현재 컴터에서 실행 중인 프로그램 선택해서 실시간으로 권한 주고 화면 확인하는 기능도
이 o1-agent 빌드업인 거 같고...
o1-preview의 추론 토큰 사용량을 (마치 과거 GPT4-Turbo때처럼) 획기적으로 줄여서 굉장히 오래동안 생각하고 또 지속적으로
스스로 클로드 컴퓨터 유즈처럼 계속 문제 해결을 진행해나가도록 하는 데에 성공했고...
이로 인해 뭔가 복잡한 문제나 새로운 발명 같은 걸 오랜 시간 에이전트 돌려서 성공한 사례들도 소개할 것 같음
- 이상 기대컨 -
난 시간축 스케일링의 극한을 보여줬으면 좋겠음. 대체 시간축 스케일링으로 얼마나 성능이 발전하는가
그걸 연구한 논문이 조만간에 나와주긴 해야 할 텐데 실험하기에 굉장히 까다로운 문제라 그 논문 내기 전에 뭔가 엄청 더 발전할 듯
15x inferance time compute = 10x training compute
하긴, 한동안 너무 조용하기도 했고 중국이랑 막 치고 올라오는데도 별 반응 없어서 찜찜하긴 했는데. 개선시켜서 보여줄 게 많긴 하지.