같은 깃허브 레포가지고 여러버전 패치 평가하게 햇는데

gpt 같은 경우에는 기술적/빌드 최적화를 최우선해서 안정적인 코드를 원하고
제미니 같은 경우에는 기능적/아키텍처적 완성도를 우선함 

둘다 서로의 평가 주고 다시 평가하라하면 하나로 귀결 되는게 신기함