OpenAI, AI 코딩 성능 평가 벤치마크 ‘SWE-Lancer’ 출시
OpenAI는 오늘 새로운 벤치마크인 ‘SWE-Lancer’를 공개했다. SWE-Lancer는 Upwork에서 실제로 수행된 1,400개 이상의 프리랜서 소프트웨어 엔지니어링 작업을 포함하며, 총 100만 달러의 실제 보상 가치로 평가된다. 이 벤치마크는 $50 규모의 간단한 버그 수정부터 $32,000에 달하는 대규모 기능 구현 작업까지 다양한 독립적인 엔지니어링 과제를 포함하며, 기술 구현 제안 중 최적의 선택을 요구하는 관리 업무도 포함한다. 작업 평가는 숙련된 소프트웨어 엔지니어가 삼중 검증한 종단 간 테스트를 통해 이루어지며, 관리 과제는 원래 고용된 관리자들의 선택과 비교하여 평가된다. OpenAI는 SWE-Lancer를 통해 AI 모델의 경제적 영향을 연구하고 발전시키기 위한 기반을 마련하고자 한다. 이를 위해 통합 Docker 이미지와 공개 평가 세트(SWE-Lancer Diamond)를 오픈소스로 제공한다. 초기 평가 결과에 따르면 최첨단 AI 모델도 대부분의 과제를 해결하지 못하는 것으로 나타났다.
기사 3줄 요약:
1. OpenAI는 1,400개 이상의 실제 프리랜서 소프트웨어 엔지니어링 작업을 기반으로 한 새로운 벤치마크 ‘SWE-Lancer’를 발표했다.
2. 이 벤치마크는 작업의 경제적 가치를 측정하며, 초기 결과에 따르면 최신 AI 모델도 대부분의 작업을 해결하지 못했다.
3. 연구 촉진을 위해 SWE-Lancer Diamond와 통합 Docker 이미지를 오픈소스로 제공한다.
OpenAI가 새로 공개한 코딩 벤치
에서 o1을 따버린 클황
아 그래서 API 안 쓸거냐고 ㅋㅋㅋ
댓글 0